Перейти к основному содержимому

Курс

Кластерный анализ на Python

Средний4 ч

В этом курсе вы познакомитесь с unsupervised learning через методы, такие как hierarchical и k-means clustering, используя библиотеку SciPy.

Python4 чвидео: 14Упражнений: 463,650 XP65,796Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Вы наверняка сталкивались с Google News, который автоматически группирует похожие новостные статьи по темам. Задумывались ли вы, какой процесс стоит за этим? В этом курсе вы познакомитесь с обучением без учителя на примере кластеризации с использованием библиотеки SciPy в Python. Курс охватывает предобработку данных, а также применение иерархической кластеризации и метода k-средних. В ходе обучения вы будете исследовать статистику игроков из популярной футбольной видеоигры FIFA 18. По завершении курса вы сможете уверенно применять различные алгоритмы кластеризации к данным, визуализировать полученные кластеры и анализировать результаты.

Предварительные требования

Программа

План курса

1

Введение в кластеризацию

Прежде чем приступить к классификации новостных статей, нужно разобраться с основами кластеризации. В этой главе вы познакомитесь с классом алгоритмов машинного обучения, известных как обучение без учителя, а затем изучите кластеризацию — один из наиболее распространённых таких алгоритмов. Вы узнаете о двух популярных методах кластеризации: иерархической кластеризации и методе k-средних. Глава завершается рассмотрением базовых шагов предобработки данных перед началом кластеризации.
Начать главу
2

Иерархическая кластеризация

В этой главе подробно рассматривается популярный алгоритм кластеризации — иерархическая кластеризация — и его реализация в SciPy. Помимо процедуры выполнения иерархической кластеризации, глава помогает ответить на важный вопрос: сколько кластеров содержится в ваших данных? В завершение обсуждаются ограничения иерархической кластеризации и ключевые соображения при её использовании.
Начать главу
3

Метод k-средних

В этой главе рассматривается другой алгоритм кластеризации — метод k-средних — и его реализация в SciPy. Метод k-средних устраняет главный недостаток иерархической кластеризации, о котором шла речь в предыдущей главе. Поскольку дендрограммы применяются только в иерархической кластеризации, здесь обсуждается один из способов определить число кластеров до запуска метода k-средних. Глава завершается разбором ограничений метода k-средних и рекомендациями по его применению.
Начать главу
4

Кластеризация на практике

Теперь, когда вы познакомились с двумя наиболее популярными методами кластеризации, эта глава поможет вам применить полученные знания к реальным задачам. Сначала рассматривается процесс выделения доминирующих цветов на изображении, а затем — задача, упомянутая во введении: кластеризация новостных статей. В завершение обсуждается кластеризация с использованием множества переменных, при которой визуализировать все данные становится затруднительно.
Начать главу

Кластерный анализ на Python

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.