After doing these courses, I feel confident creating professional visualizations and dashboards
Опис курсу
Пропущені дані трапляються в будь-якому аналізі реальних даних. Вони можуть виникати у неочікуваних місцях і ускладнювати інтерпретацію результатів. У цьому курсі ви навчитеся використовувати інструменти tidyverse і пакет naniar в R для візуалізації пропусків. Ви впорядкуєте пропущені значення, щоб їх можна було коректно використовувати в аналізі, і дослідите пропуски, щоб виявляти упередження в даних. Нарешті, ви зможете відкрити інші приховані закономірності пропущеності. Також ви дізнаєтеся, як «заповнювати прогалини» за допомогою моделей імпутації, а також як візуалізувати, оцінювати й ухвалювати рішення на основі таких імпутованих наборів даних.
Попередні вимоги
Навчальний план
Зміст курсу
1
Чому варто дбати про пропущені дані?
У розділі 1 вас познайомлять із пропущеними даними: що таке пропущені значення, як вони поводяться в R, як їх виявляти та підраховувати. Далі ми розглянемо підсумкові огляди пропущених даних: як узагальнювати пропущеність за випадками, змінними та як досліджувати її в групах у межах даних. Нарешті, ми обговоримо візуалізації пропущених даних: як побудувати оглядові графіки для всього набору даних і для змінних, випадків та інших підсумків, а також як досліджувати це у різних групах.
- Вступ до пропущених даних50 XP
- Використання та пошук пропущених значень100 XP
- Скільки пропущених значень?100 XP
- Робота з пропущеними значеннями50 XP
- Чому варто зважати на пропущені значення?50 XP
- Підсумовування пропусків100 XP
- Табличне подання пропусків100 XP
- Інші підсумки пропусків100 XP
- Як візуалізувати пропущені значення?50 XP
- Ваші перші візуалізації пропусків у даних100 XP
- Візуалізація пропусків у випадках і змінних100 XP
- Візуалізація патернів пропусків100 XP
2
Упорядкування та приведення пропущених значень до ладу
У другому розділі ви навчитеся знаходити приховані пропуски на кшталт «missing» або «N/A» та замінювати їх на `NA`. Ви дізнаєтеся, як ефективно працювати з неявними пропущеними значеннями — тими, які випливають із даних, але не зазначені явно. Ми також розглянемо залежності пропущеності даних, обговоримо поняття Missing Completely at Random (MCAR), Missing At Random (MAR), Missing Not At Random (MNAR) та їхні наслідки для вашого аналізу даних.
3
Перевірка зв'язків пропущеності
У цьому розділі ви ознайомитеся з робочими процесами для роботи з пропущеними даними. Ми представимо спеціальні структури даних — матрицю-тінь (shadow matrix) та «набулярні» дані (nabular data) — і покажемо, як використовувати їх у процесах дослідження пропусків, щоб пов'язувати підсумки пропущеності зі значеннями у даних. Ви навчитеся використовувати ggplot, щоб досліджувати та візуалізувати, як змінюються значення, коли інші змінні стають пропущеними. Нарешті, ви дізнаєтеся, як візуалізувати пропущеність для двох змінних і як та навіщо показувати пропуски на точковій діаграмі.
4
З'єднати точки (імпутація)
У цьому розділі ви дізнаєтеся про заповнення пропущених значень у ваших даних — це називається імпутацією. Ви навчитеся імпутувати та відстежувати пропущені значення, а також зрозумієте сильні та слабкі сторони імпутацій, щоб мати змогу досліджувати, візуалізувати й оцінювати імпутовані дані відносно початкових значень. Ви навчитеся використовувати, оцінювати та порівнювати різні моделі імпутації й дослідите, як різні підходи впливають на висновки, які можна робити з моделей.
R
Робота з пропущеними даними в R
Курс
завершено

