After doing these courses, I feel confident creating professional visualizations and dashboards
Описание курса
Каждый день появляются новости о прорывных достижениях машинного обучения, меняющих мир вокруг нас. При этом за кадром остаётся то, что перед применением любых сложных моделей необходимо выполнить огромный объём работы по обработке данных и конструированию признаков. В этом курсе вы освоите именно эти навыки. Работая с результатами опроса разработчиков Stack Overflow и историческими текстами инаугурационных речей президентов США, вы научитесь предобрабатывать данные и создавать признаки из категориальных, непрерывных и неструктурированных данных. Курс даст вам практический опыт подготовки данных для собственных моделей машинного обучения.
Предварительные требования
Программа
Структура курса
1
Создание признаков
В этой главе вы узнаете, что такое конструирование признаков, и начнёте применять его к реальным данным. Вы загрузите, исследуете и визуализируете набор данных с результатами опроса, изучите лежащие в его основе типы данных и поймёте, как они влияют на подход к созданию признаков. С помощью библиотеки pandas вы создадите новые признаки на основе как категориальных, так и непрерывных столбцов.
- Зачем создавать признаки?50 XP
- Знакомство с данными100 XP
- Выбор столбцов определённого типа данных100 XP
- Работа с категориальными признаками50 XP
- Унитарное кодирование и фиктивные переменные100 XP
- Работа с редкими категориями100 XP
- Числовые переменные50 XP
- Бинаризация столбцов100 XP
- Разбивка значений на интервалы100 XP
2
Работа с неаккуратными данными
Эта глава знакомит вас с реальностью неаккуратных и неполных данных. Вы научитесь обнаруживать пропущенные значения и рассмотрите несколько подходов к работе с ними. Кроме того, вы освоите методы обработки строк для устранения нежелательных символов в наборе данных.
3
Приведение данных к статистическим допущениям
В этой главе вы сосредоточитесь на анализе распределения данных и его влиянии на конвейер машинного обучения. Вы узнаете, как работать с асимметричными данными и как поступать в ситуациях, когда выбросы негативно сказываются на результатах анализа.
4
Работа с текстовыми данными
В заключительной главе вы будете работать с неструктурированными текстовыми данными и изучите способы создания столбцовых признаков на основе текстового корпуса. Вы сравните различные подходы с точки зрения того, сколько контекста они позволяют извлечь, и научитесь находить баланс между достаточным количеством контекста и разумным числом создаваемых признаков.
Конструирование признаков для машинного обучения в Python
Курс
завершён

