BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по MLOps и Data Science (ML, AI) » Алгоритмы кластеризации в машинном обучении

Алгоритмы кластеризации в машинном обучении

Кластеризация — это задача машинного обучения без учителя, в которой похожие объекты объединяются в группы, или кластеры. В отличие от классификации, здесь нет заранее заданных меток: алгоритм сам ищет структуру в данных и группирует наблюдения по сходству признаков.

В статье разберем основные алгоритмы кластеризации: K-means, DBSCAN, агломеративную кластеризацию, BIRCH и Mean Shift. Посмотрим, как они работают, чем отличаются друг от друга, в каких задачах применяются и когда стоит выбирать каждый подход. Также покажем связь кластеризации с анализом данных и реализацией алгоритмов на Python.

Что внутри:

  • что такое кластеризация простыми словами;
  • чем кластеризация отличается от классификации;
  • обучение без учителя и данные без меток;
  • K-means и центроиды;
  • DBSCAN и поиск плотных областей;
  • агломеративная кластеризация;
  • BIRCH для больших наборов данных;
  • Mean Shift;
  • как выбрать алгоритм кластеризации;
  • где кластеризация применяется в анализе данных;
  • реализация clustering-алгоритмов на Python.

 

Кластеризация – это задача выявления похожих экземпляров на основе аналогичных функций и их назначения кластерам на основе аналогичных экземпляров. Она похожа на классификацию, где каждый экземпляр также назначается группе, но в отличие от классификации, кластеризация основана на обучении без учителя. Здесь набор данных, с которым вы имеете дело, не имеет меток, поэтому мы не можем использовать алгоритм классификации в наборе данных без меток, здесь на помощь приходят алгоритмы кластеризации. Если вы хотите изучить все алгоритмы кластеризации, о которых вы должны знать, как исследователи данных, эта статья для вас. В этой статье я познакомлю вас со всеми алгоритмами кластеризации в машинном обучении.

 

Алгоритмы кластеризации

Ниже представлены все алгоритмы кластеризации, которые вам следует знать:

  1. Кластеризация K-средних
  2. Кластеризация DBSCAN
  3. Агломеративная кластеризация
  4. Кластеризация BIRCH.
  5. Кластеризация со средним сдвигом

Итак, это все алгоритмы кластеризации в машинном обучении, которые вам необходимо знать. Теперь давайте перейдем к введению во все эти алгоритмы кластеризации один за другим и рассмотрим их реализацию с использованием Python.

 

Кластеризация K-средних

K-средние – это алгоритм кластеризации в машинном обучении, который может очень быстро и эффективно сгруппировать немаркированный набор данных всего за несколько итераций. Он работает, маркируя все экземпляры в кластере ближайшим центроидом. Когда экземпляры сосредоточены вокруг определенной точки, эта точка называется центроидом. Если вы получаете метки экземпляров, вы можете легко найти все элементы, усреднив все экземпляры для каждого кластера.

Но здесь нам не дается метка или центроиды, поэтому мы должны начать с размещения центроидов случайным образом, выбрав k случайных экземпляров и используя их положения в качестве центроидов. Затем мы маркируем экземпляры, обновляем центроиды, повторно маркируем экземпляры, снова обновляем центроиды и так далее. Алгоритм кластеризации K-средних гарантированно сойдется за несколько итераций, он не будет повторяться бесконечно. Вы можете узнать о реализации алгоритма кластеризации K-средних здесь.

 

Кластеризация DBSCAN

Алгоритм кластеризации DBSCAN основан на концепции образцов ядра, неосновных образцов и выбросов:

  1. Образцы ядра: образцы, представленные в области с высокой плотностью, имеют минимальное количество точек выборки с радиусом eps.
  2. Образцы, не являющиеся образцами ядра: образцы близкие к образцам ядра, не являющиеся образцами ядра, но находящиеся очень близко к образцам ядра. Образцы без ядра лежат в радиусе eps от образцов ядра, но у них нет минимальных точек отбора проб.
  3. Выбросы: образцы, которые не являются частью образцов ядра и образцов, не являющихся образцами ядра, и находятся далеко от всех образцов.

Алгоритм кластеризации DBSCAN работает хорошо, если все кластеры достаточно плотные и хорошо представлены областями с низкой плотностью. Вы можете узнать о реализации алгоритма кластеризации DBSCAN здесь.

 

Агломеративная кластеризация

Агломеративная кластеризация – это один из алгоритмов кластеризации, в котором процесс группировки похожих экземпляров начинается с создания нескольких групп, каждая из которых содержит одну сущность на начальном этапе, затем он находит две самые похожие группы, объединяет их, повторяет процесс до тех пор, пока не получит единую группу наиболее похожих экземпляров.

Например, представьте пузыри, плавающие на воде и прикрепляющиеся друг к другу. В конце процесса вы увидите большую группу пузырьков. Так работает алгоритм агломеративной кластеризации. Вот некоторые из преимуществ использования этого алгоритма кластеризации:

  1. Хорошо адаптируется к большому количеству случаев.
  2. Может захватывать кластеры различной формы.
  3. Образует гибкие и информативные кластеры.
  4. Его также можно использовать с любым попарным расстоянием.

Вы можете узнать о реализации алгоритма агломеративной кластеризации здесь.

 

Кластеризация BIRCH

BIRCH – это алгоритм кластеризации в машинном обучении, специально разработанный для кластеризации очень большого набора данных. Часто он работает быстрее, чем другие алгоритмы кластеризации, такие как K-средние. Он дает результат, очень похожий на алгоритм K-средних, если количество объектов в наборе данных не превышает 20.

При обучении модели с использованием алгоритма BIRCH создается древовидная структура с достаточным количеством данных, чтобы быстро назначить каждую точку данных кластеру. Сохраняя все точки данных в дереве, этот алгоритм позволяет использовать ограниченную память при работе с очень большим набором данных. Вы можете узнать о реализации алгоритма кластеризации BIRCH здесь.

 

Кластеризация среднего сдвига

Кластеризация со средним сдвигом – это непараметрический алгоритм кластеризации, который не требует каких-либо предварительных знаний о количестве кластеров. Ниже приведен полный процесс алгоритма кластеризации среднего сдвига:

  1. Сначала ставим кружок с центром на каждом образце.
  2. Затем для каждого круга вычисляется среднее значение всех образцов, расположенных в круге.
  3. Затем круг перемещается так, чтобы его центр находился в центре среднего.
  4. Затем выполняется итерация среднего шага сдвига до тех пор, пока все круги не перестанут двигаться.
  5. Затем он сдвигает круги в направлении максимальной плотности, пока каждый круг не достигнет максимума локальной плотности.
  6. Затем все экземпляры, круги которых обосновались в одном и том же месте, помещаются в один и тот же кластер.

 

Некоторые особенности этого алгоритма делают его похожим на алгоритм кластеризации DBSCAN, например, как он находит любое количество кластеров любой формы. Но в отличие от алгоритма кластеризации DBSCAN, средний сдвиг имеет тенденцию разделять кластеры на куски, когда у них есть вариации внутренней плотности. Вы можете узнать о реализации алгоритма кластеризации среднего сдвига здесь.

 

Резюме

Итак, это были все алгоритмы кластеризации в машинном обучении, которые вам следует знать. Кластеризация – это задача выявления похожих экземпляров на основе аналогичных функций и их назначения кластерам на основе аналогичных экземпляров. Это похоже на классификацию, где каждый экземпляр также назначается группе, но в отличие от классификации, кластеризация основана на обучении без учителя. Надеюсь, вам понравилась эта статья об алгоритмах кластеризации, которые вы должны знать.

 

FAQ

Вопрос: Что такое кластеризация?

Ответ: Кластеризация — это метод машинного обучения без учителя, который объединяет похожие объекты в группы на основе признаков и расстояний между ними.

 

Вопрос: Чем кластеризация отличается от классификации?

Ответ: В классификации модель обучается на данных с заранее известными метками классов. В кластеризации меток нет: алгоритм сам ищет группы похожих объектов.

 

Вопрос: Что такое K-means?

Ответ: K-means — алгоритм кластеризации, который делит данные на K групп вокруг центроидов. Он итеративно назначает объекты ближайшему центроиду и пересчитывает центры кластеров.

 

Вопрос: Когда использовать DBSCAN?

Ответ: DBSCAN полезен, когда кластеры имеют произвольную форму и в данных есть шум или выбросы. Он ищет области высокой плотности и не требует заранее задавать число кластеров.

 

Вопрос: Как выбрать алгоритм кластеризации?

Ответ: Выбор зависит от формы кластеров, размера данных, наличия выбросов, необходимости задавать число кластеров и требований к интерпретации результата. Часто несколько алгоритмов сравнивают на одной задаче.

 

  • Кластеризация K-средних в машинном обучении
  • Метрики оценки Machine Learning моделей
  • Градиентный спуск в машинном обучении
  • TF-IDF в машинном обучении
  • Многослойный персептрон в машинном обучении

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Алгоритмы бинарной классификации в машинном обучении
Следующая статья →
Архитектура LeNet-5 с использованием Python

 

Внедряем AI в бизнес-процессы крупных компаний
От стратегии и инфраструктуры до AI-агентов, интеграций и промышленной эксплуатации.

Подробнее об AI-решениях

 

Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • "Уральский банк реконструкции и развития" входит в топ-25 крупнейших банков России и список значимых кредитных организаций на рынке платежных услуг по версии ЦБ РФ.

  •  ООО «ММК-Информсервис» создает высокотехнологичные решения для эффективной работы предприятий. Разрабатывают и внедряют телекоммуникационные и бизнес-приложения, автоматизируют производство, выстраивают и поддерживают корпоративную IT-инфраструктуру.

  • КАМИ – компания-лидер по поставкам тяжёлых станков в России, занимающаяся продажей и обслуживанием оборудования для обработки металла и дерева, изготовления мебели и не только. На сегодняшний день в компании работают более 1300 человек, запущено 10 обучающих центров, в продаже более 7000 единиц техники. 

  • АО «Евросиб СПб–транспортные системы» – оператор контейнерных сервисов с широкой сетью маршрутов на внутрироссийских и международных направлениях. Имеет успешный опыт управления парком фитинговых платформ, а также организации ускоренных контейнерных поездов, в основе которых точное расписание, оптимальные сроки доставки груза и экономическая целесообразность.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.