Build your ultimate AI agent
Описание курса
Многомерные наборы данных могут поставить в тупик: с чего вообще начать? Обычно первый шаг — визуальное изучение данных, но при большом числе измерений классические подходы оказываются недостаточными. К счастью, существуют техники визуализации, разработанные специально для многомерных данных, — именно с ними вы познакомитесь в этом курсе. Изучив данные, вы нередко обнаружите, что многие признаки почти не несут информации: они либо не имеют разброса, либо дублируют другие признаки. Вы научитесь выявлять такие признаки и удалять их из набора данных, чтобы сосредоточиться на действительно значимых. Затем вы, возможно, захотите построить модель на оставшихся признаках — и окажется, что некоторые из них никак не влияют на то, что вы пытаетесь предсказать. Вы научитесь обнаруживать и исключать такие нерелевантные признаки, снижая тем самым размерность и сложность данных. Наконец, вы узнаете, как методы извлечения признаков позволяют автоматически снизить размерность за счёт вычисления некоррелированных главных компонент.
Предварительные требования
Программа
Структура курса
1
Исследование многомерных данных
Вы познакомитесь с концепцией снижения размерности и узнаете, когда и почему это важно. Вы поймёте разницу между отбором признаков и их извлечением, а также примените оба подхода для исследования данных. Глава завершается уроком о методе t-SNE — мощной технике извлечения признаков, которая позволяет визуализировать многомерные наборы данных.
- Введение50 XP
- Определение количества измерений в наборе данных50 XP
- Удаление признаков без вариации100 XP
- Отбор признаков и извлечение признаков50 XP
- Визуальное обнаружение избыточных признаков100 XP
- Преимущество отбора признаков50 XP
- Визуализация многомерных данных с помощью t-SNE50 XP
- Интуиция за t-SNE50 XP
- Применение t-SNE к данным ANSUR100 XP
- Визуализация снижения размерности с помощью t-SNE100 XP
2
Отбор признаков I — отбор по информативности
В первой из двух глав, посвящённых отбору признаков, вы узнаете о проклятии размерности и о том, как снижение размерности помогает с ним справиться. Вы познакомитесь с рядом методов обнаружения и удаления признаков, которые почти не добавляют ценности набору данных: из-за низкой вариативности, большого числа пропущенных значений или сильной корреляции с другими признаками.
3
Отбор признаков II — отбор по точности модели
Во второй главе об отборе признаков вы узнаете, как использовать модели для поиска наиболее важных признаков в наборе данных при предсказании целевого признака. В финальном уроке главы вы объедините рекомендации нескольких различных моделей, чтобы решить, какие признаки стоит сохранить.
4
Извлечение признаков
Эта глава — детальное погружение в метод снижения размерности, который используется чаще всего: метод главных компонент (PCA). Вы сформируете интуитивное понимание того, как и почему этот алгоритм столь эффективен, и примените его как для исследования данных, так и для их предобработки в конвейере моделирования. В завершение вас ждёт увлекательный практический пример — сжатие изображений.
Снижение размерности в Python
Курс
завершён

