Перейти к основному содержимому

Курс

Снижение размерности в R

Базовый4 ч

Освойте методы уменьшения размерности в R и улучшайте отбор и извлечение признаков для своих данных и моделей.

R4 чвидео: 16Упражнений: 564,600 XP2,792Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Вы когда-нибудь работали с наборами данных, содержащими огромное количество признаков? Вам действительно нужны все эти функции? Какие из них самые важные? В этом курсе вы изучите методы уменьшения размерности, которые помогут упростить ваши данные и создаваемые на их основе модели, сохраняя при этом информацию исходных данных и высокую точность прогнозирования.

Зачем изучать понижение размерности?



Мы живём в эпоху информации — время, когда нас окружает избыток данных. Умение извлекать ключевую информацию из данных — востребованный навык на рынке. Модели обучаются быстрее на уменьшенных данных. В производственной среде более компактные модели обеспечивают более быстрое время отклика. Возможно, самое важное — меньшие объемы данных и модели зачастую проще для понимания. Снижение размерности — это ваш бритва Оккама в data science.

Чему вы научитесь на этом курсе?



Разница между отбором признаков и извлечением признаков! Используя R, вы научитесь определять и удалять признаки с низкой или избыточной информацией, оставляя только наиболее информативные признаки. Это и есть отбор признаков. Вы также узнаете, как извлекать комбинации признаков в виде сжатых компонентов, содержащих максимальное количество информации. Вот что такое извлечение признаков!

Но самое главное — с помощью нового пакета tidymodel R вы будете работать с реальными данными, чтобы создавать модели с меньшим количеством признаков без существенной потери производительности.

Предварительные требования

Программа

План курса

1

Основы снижения размерности

Приготовьтесь упрощать большие наборы данных! Вы узнаете, что такое информация в данных, как оценивать важность признаков и как определять малоинформативные из них. К концу главы вы будете чётко понимать разницу между отбором признаков и извлечением признаков — двумя подходами к снижению размерности.
Начать главу
2

Отбор признаков по важности

Вы научитесь выявлять информативные и малоинформативные признаки с помощью доли пропущенных значений, дисперсии и корреляции. Затем узнаете, как строить рецепты tidymodels для отбора признаков на основе этих показателей.
Начать главу
3

Отбор признаков для улучшения качества модели

В третьей главе рассматривается разница между несупервизированным и супервизированным подходами к отбору признаков. Вы повторите, как использовать рабочие процессы tidymodels для построения моделей, а затем выполните супервизированный отбор признаков с помощью лассо-регрессии и моделей случайного леса.
Начать главу
4

Извлечение признаков и качество модели

В этой финальной главе вы сформируете глубокое понимание извлечения признаков — на примере того, как главные компоненты извлекают и объединяют наиболее важную информацию из различных признаков. Вы познакомитесь с тремя методами извлечения признаков — анализом главных компонентов (PCA), t-SNE и UMAP — и научитесь применять их как шаг предобработки данных в процессе построения моделей с помощью tidymodels.
Начать главу
R

Снижение размерности в R

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.