Перейти к основному контенту

Курс

Работа с пропущенными данными в R

Начальный4 ч

Сделайте визуализацию, исследуйте и заполняйте пропуски с naniar — удобным для tidyverse подходом к пропущенным данным.

R4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}4,350 XP17,313Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Пропущенные данные — неотъемлемая часть любого реального анализа. Они могут появляться в самых неожиданных местах и существенно затруднять интерпретацию результатов. В этом курсе вы научитесь использовать инструменты tidyverse и пакет naniar для R, чтобы визуализировать пропущенные значения. Вы приведёте пропуски в порядок, подготовив их для дальнейшего анализа, и исследуете их в поисках систематических смещений. Затем вы изучите другие скрытые закономерности пропущенности. Наконец, вы узнаете, как «заполнить пробелы» с помощью моделей импутации, и научитесь визуализировать, оценивать и интерпретировать восстановленные наборы данных.

Предварительные требования

Программа

Структура курса

1

Зачем обращать внимание на пропущенные данные?

В первой главе вы познакомитесь с пропущенными данными: узнаете, что такое пропущенные значения, как они ведут себя в R, как их обнаружить и подсчитать. Затем мы рассмотрим сводные характеристики пропущенности и научимся обобщать информацию о пропусках по наблюдениям, переменным и группам внутри данных. В завершение мы обсудим визуализацию пропущенных данных: как создавать обзорные графики для всего набора данных, а также по переменным, наблюдениям и другим сводным показателям — и как исследовать всё это в разрезе групп.
Начать главу
2

Обработка и приведение в порядок пропущенных значений

Во второй главе вы научитесь выявлять скрытые пропущенные значения — такие как `"missing"` или `"N/A"` — и заменять их на `NA`. Вы узнаете, как эффективно работать с неявными пропусками — теми значениями, которые подразумеваются пропущенными, но явно не указаны. Мы также рассмотрим зависимость пропущенных данных: разберём понятия «пропущено полностью случайно» (MCAR), «пропущено случайно» (MAR) и «пропущено неслучайно» (MNAR) и обсудим, что каждое из них означает для вашего анализа.
Начать главу
3

Анализ зависимостей в пропущенных данных

В этой главе вы познакомитесь с рабочими процессами для анализа пропущенных данных. Мы введём специальные структуры данных — матрицу теней и набор данных nabular — и покажем, как применять их в рабочих процессах, чтобы связывать сводные характеристики пропущенности с реальными значениями в данных. Вы научитесь использовать ggplot для исследования и визуализации того, как изменяются значения при появлении пропусков в других переменных. В завершение вы освоите визуализацию пропущенности по двум переменным и узнаете, как и зачем отображать пропуски на диаграмме рассеяния.
Начать главу
4

Восстановление данных (импутация)

В этой главе вы изучите заполнение пропущенных значений в данных — процесс, называемый импутацией. Вы узнаете, как выполнять импутацию и отслеживать пропущенные значения, а также разберёте достоинства и недостатки различных подходов к восстановлению данных. Это позволит вам исследовать, визуализировать и оценивать восстановленные данные в сравнении с исходными значениями. Наконец, вы научитесь применять, оценивать и сравнивать различные модели импутации и изучите, как выбор модели влияет на выводы, которые можно сделать из данных.
Начать главу
R

Работа с пропущенными данными в R

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.