Перейти к основному контенту

Курс

Кластерный анализ на Python

Средний4 ч

В этом курсе вы познакомитесь с unsupervised learning через методы, такие как hierarchical и k-means clustering, используя библиотеку SciPy.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}3,650 XP65,436Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Вы наверняка сталкивались с Google News, который автоматически группирует похожие новостные статьи по темам. Задумывались ли вы, какой процесс стоит за этим? В этом курсе вы познакомитесь с обучением без учителя на примере кластеризации с использованием библиотеки SciPy в Python. Курс охватывает предобработку данных, а также применение иерархической кластеризации и метода k-средних. В ходе обучения вы будете исследовать статистику игроков из популярной футбольной видеоигры FIFA 18. По завершении курса вы сможете уверенно применять различные алгоритмы кластеризации к данным, визуализировать полученные кластеры и анализировать результаты.

Предварительные требования

Программа

Структура курса

1

Введение в кластеризацию

Прежде чем приступить к классификации новостных статей, нужно разобраться с основами кластеризации. В этой главе вы познакомитесь с классом алгоритмов машинного обучения, известных как обучение без учителя, а затем изучите кластеризацию — один из наиболее распространённых таких алгоритмов. Вы узнаете о двух популярных методах кластеризации: иерархической кластеризации и методе k-средних. Глава завершается рассмотрением базовых шагов предобработки данных перед началом кластеризации.
Начать главу
2

Иерархическая кластеризация

В этой главе подробно рассматривается популярный алгоритм кластеризации — иерархическая кластеризация — и его реализация в SciPy. Помимо процедуры выполнения иерархической кластеризации, глава помогает ответить на важный вопрос: сколько кластеров содержится в ваших данных? В завершение обсуждаются ограничения иерархической кластеризации и ключевые соображения при её использовании.
Начать главу
3

Метод k-средних

В этой главе рассматривается другой алгоритм кластеризации — метод k-средних — и его реализация в SciPy. Метод k-средних устраняет главный недостаток иерархической кластеризации, о котором шла речь в предыдущей главе. Поскольку дендрограммы применяются только в иерархической кластеризации, здесь обсуждается один из способов определить число кластеров до запуска метода k-средних. Глава завершается разбором ограничений метода k-средних и рекомендациями по его применению.
Начать главу
4

Кластеризация на практике

Теперь, когда вы познакомились с двумя наиболее популярными методами кластеризации, эта глава поможет вам применить полученные знания к реальным задачам. Сначала рассматривается процесс выделения доминирующих цветов на изображении, а затем — задача, упомянутая во введении: кластеризация новостных статей. В завершение обсуждается кластеризация с использованием множества переменных, при которой визуализировать все данные становится затруднительно.
Начать главу

Кластерный анализ на Python

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Кластерный анализ на Python | DataCamp