Перейти до основного вмісту

Курс

Робота з пропущеними даними в R

Базовий4 год

Легко візуалізуйте, досліджуйте й імпутуйте пропуски з naniar — зручним для tidyverse підходом до пропущених даних.

R4 год14 відео52 вправ4,350 XP17,302Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Пропущені дані трапляються в будь-якому аналізі реальних даних. Вони можуть виникати у неочікуваних місцях і ускладнювати інтерпретацію результатів. У цьому курсі ви навчитеся використовувати інструменти tidyverse і пакет naniar в R для візуалізації пропусків. Ви впорядкуєте пропущені значення, щоб їх можна було коректно використовувати в аналізі, і дослідите пропуски, щоб виявляти упередження в даних. Нарешті, ви зможете відкрити інші приховані закономірності пропущеності. Також ви дізнаєтеся, як «заповнювати прогалини» за допомогою моделей імпутації, а також як візуалізувати, оцінювати й ухвалювати рішення на основі таких імпутованих наборів даних.

Попередні вимоги

Навчальний план

Зміст курсу

1

Чому варто дбати про пропущені дані?

У розділі 1 вас познайомлять із пропущеними даними: що таке пропущені значення, як вони поводяться в R, як їх виявляти та підраховувати. Далі ми розглянемо підсумкові огляди пропущених даних: як узагальнювати пропущеність за випадками, змінними та як досліджувати її в групах у межах даних. Нарешті, ми обговоримо візуалізації пропущених даних: як побудувати оглядові графіки для всього набору даних і для змінних, випадків та інших підсумків, а також як досліджувати це у різних групах.
Почати розділ
2

Упорядкування та приведення пропущених значень до ладу

У другому розділі ви навчитеся знаходити приховані пропуски на кшталт «missing» або «N/A» та замінювати їх на `NA`. Ви дізнаєтеся, як ефективно працювати з неявними пропущеними значеннями — тими, які випливають із даних, але не зазначені явно. Ми також розглянемо залежності пропущеності даних, обговоримо поняття Missing Completely at Random (MCAR), Missing At Random (MAR), Missing Not At Random (MNAR) та їхні наслідки для вашого аналізу даних.
Почати розділ
3

Перевірка зв'язків пропущеності

У цьому розділі ви ознайомитеся з робочими процесами для роботи з пропущеними даними. Ми представимо спеціальні структури даних — матрицю-тінь (shadow matrix) та «набулярні» дані (nabular data) — і покажемо, як використовувати їх у процесах дослідження пропусків, щоб пов'язувати підсумки пропущеності зі значеннями у даних. Ви навчитеся використовувати ggplot, щоб досліджувати та візуалізувати, як змінюються значення, коли інші змінні стають пропущеними. Нарешті, ви дізнаєтеся, як візуалізувати пропущеність для двох змінних і як та навіщо показувати пропуски на точковій діаграмі.
Почати розділ
4

З'єднати точки (імпутація)

У цьому розділі ви дізнаєтеся про заповнення пропущених значень у ваших даних — це називається імпутацією. Ви навчитеся імпутувати та відстежувати пропущені значення, а також зрозумієте сильні та слабкі сторони імпутацій, щоб мати змогу досліджувати, візуалізувати й оцінювати імпутовані дані відносно початкових значень. Ви навчитеся використовувати, оцінювати та порівнювати різні моделі імпутації й дослідите, як різні підходи впливають на висновки, які можна робити з моделей.
Почати розділ
R

Робота з пропущеними даними в R

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.

Робота з пропущеними даними в R | DataCamp