After doing these courses, I feel confident creating professional visualizations and dashboards
Описание курса
Пропущенные данные — неотъемлемая часть любого реального анализа. Они могут появляться в самых неожиданных местах и существенно затруднять интерпретацию результатов. В этом курсе вы научитесь использовать инструменты tidyverse и пакет naniar для R, чтобы визуализировать пропущенные значения. Вы приведёте пропуски в порядок, подготовив их для дальнейшего анализа, и исследуете их в поисках систематических смещений. Затем вы изучите другие скрытые закономерности пропущенности. Наконец, вы узнаете, как «заполнить пробелы» с помощью моделей импутации, и научитесь визуализировать, оценивать и интерпретировать восстановленные наборы данных.
Предварительные требования
Программа
Структура курса
1
Зачем обращать внимание на пропущенные данные?
В первой главе вы познакомитесь с пропущенными данными: узнаете, что такое пропущенные значения, как они ведут себя в R, как их обнаружить и подсчитать. Затем мы рассмотрим сводные характеристики пропущенности и научимся обобщать информацию о пропусках по наблюдениям, переменным и группам внутри данных. В завершение мы обсудим визуализацию пропущенных данных: как создавать обзорные графики для всего набора данных, а также по переменным, наблюдениям и другим сводным показателям — и как исследовать всё это в разрезе групп.
- Введение в пропущенные данные50 XP
- Работа с пропущенными значениями и их обнаружение100 XP
- Сколько пропущенных значений?100 XP
- Работа с пропущенными значениями50 XP
- Зачем обращать внимание на пропущенные значения?50 XP
- Сводка по пропущенным значениям100 XP
- Таблицы пропущенных значений100 XP
- Другие сводки пропущенных значений100 XP
- Как визуализировать пропущенные значения?50 XP
- Первые визуализации пропущенных данных100 XP
- Визуализация пропущенных значений по наблюдениям и переменным100 XP
- Визуализация паттернов пропущенных данных100 XP
2
Обработка и приведение в порядок пропущенных значений
Во второй главе вы научитесь выявлять скрытые пропущенные значения — такие как `"missing"` или `"N/A"` — и заменять их на `NA`. Вы узнаете, как эффективно работать с неявными пропусками — теми значениями, которые подразумеваются пропущенными, но явно не указаны. Мы также рассмотрим зависимость пропущенных данных: разберём понятия «пропущено полностью случайно» (MCAR), «пропущено случайно» (MAR) и «пропущено неслучайно» (MNAR) и обсудим, что каждое из них означает для вашего анализа.
3
Анализ зависимостей в пропущенных данных
В этой главе вы познакомитесь с рабочими процессами для анализа пропущенных данных. Мы введём специальные структуры данных — матрицу теней и набор данных nabular — и покажем, как применять их в рабочих процессах, чтобы связывать сводные характеристики пропущенности с реальными значениями в данных. Вы научитесь использовать ggplot для исследования и визуализации того, как изменяются значения при появлении пропусков в других переменных. В завершение вы освоите визуализацию пропущенности по двум переменным и узнаете, как и зачем отображать пропуски на диаграмме рассеяния.
4
Восстановление данных (импутация)
В этой главе вы изучите заполнение пропущенных значений в данных — процесс, называемый импутацией. Вы узнаете, как выполнять импутацию и отслеживать пропущенные значения, а также разберёте достоинства и недостатки различных подходов к восстановлению данных. Это позволит вам исследовать, визуализировать и оценивать восстановленные данные в сравнении с исходными значениями. Наконец, вы научитесь применять, оценивать и сравнивать различные модели импутации и изучите, как выбор модели влияет на выводы, которые можно сделать из данных.
R
Работа с пропущенными данными в R
Курс
завершён

