Перейти к основному содержимому

Курс

Работа с пропущенными данными в R

Базовый4 ч

Сделайте визуализацию, исследуйте и заполняйте пропуски с naniar — удобным для tidyverse подходом к пропущенным данным.

R4 чвидео: 14Упражнений: 524,350 XP17,485Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Пропущенные данные — неотъемлемая часть любого реального анализа. Они могут появляться в самых неожиданных местах и существенно затруднять интерпретацию результатов. В этом курсе вы научитесь использовать инструменты tidyverse и пакет naniar для R, чтобы визуализировать пропущенные значения. Вы приведёте пропуски в порядок, подготовив их для дальнейшего анализа, и исследуете их в поисках систематических смещений. Затем вы изучите другие скрытые закономерности пропущенности. Наконец, вы узнаете, как «заполнить пробелы» с помощью моделей импутации, и научитесь визуализировать, оценивать и интерпретировать восстановленные наборы данных.

Предварительные требования

Программа

План курса

1

Зачем обращать внимание на пропущенные данные?

В первой главе вы познакомитесь с пропущенными данными: узнаете, что такое пропущенные значения, как они ведут себя в R, как их обнаружить и подсчитать. Затем мы рассмотрим сводные характеристики пропущенности и научимся обобщать информацию о пропусках по наблюдениям, переменным и группам внутри данных. В завершение мы обсудим визуализацию пропущенных данных: как создавать обзорные графики для всего набора данных, а также по переменным, наблюдениям и другим сводным показателям — и как исследовать всё это в разрезе групп.
Начать главу
2

Обработка и приведение в порядок пропущенных значений

Во второй главе вы научитесь выявлять скрытые пропущенные значения — такие как `"missing"` или `"N/A"` — и заменять их на `NA`. Вы узнаете, как эффективно работать с неявными пропусками — теми значениями, которые подразумеваются пропущенными, но явно не указаны. Мы также рассмотрим зависимость пропущенных данных: разберём понятия «пропущено полностью случайно» (MCAR), «пропущено случайно» (MAR) и «пропущено неслучайно» (MNAR) и обсудим, что каждое из них означает для вашего анализа.
Начать главу
3

Анализ зависимостей в пропущенных данных

В этой главе вы познакомитесь с рабочими процессами для анализа пропущенных данных. Мы введём специальные структуры данных — матрицу теней и набор данных nabular — и покажем, как применять их в рабочих процессах, чтобы связывать сводные характеристики пропущенности с реальными значениями в данных. Вы научитесь использовать ggplot для исследования и визуализации того, как изменяются значения при появлении пропусков в других переменных. В завершение вы освоите визуализацию пропущенности по двум переменным и узнаете, как и зачем отображать пропуски на диаграмме рассеяния.
Начать главу
4

Восстановление данных (импутация)

В этой главе вы изучите заполнение пропущенных значений в данных — процесс, называемый импутацией. Вы узнаете, как выполнять импутацию и отслеживать пропущенные значения, а также разберёте достоинства и недостатки различных подходов к восстановлению данных. Это позволит вам исследовать, визуализировать и оценивать восстановленные данные в сравнении с исходными значениями. Наконец, вы научитесь применять, оценивать и сравнивать различные модели импутации и изучите, как выбор модели влияет на выводы, которые можно сделать из данных.
Начать главу
R

Работа с пропущенными данными в R

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.