Перейти до основного вмісту

Курс

Очищення даних в R

Середній4 год

Навчіться очищати дані якомога швидше й точніше, щоб перейти від сирих даних до чудових інсайтів.

R4 год13 відео44 вправ3,700 XP61,325Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Подолайте поширені проблеми з даними, як-от видалення дублікатів у R

Часто кажуть, що фахівці з даних витрачають 80% свого часу на очищення та обробку даних і лише 20% — на їх аналіз. Час, витрачений на очищення, є надзвичайно важливим, оскільки аналіз брудних даних може призвести до хибних висновків.

У цьому курсі ви опануєте різноманітні техніки, які допоможуть вам очищати «брудні» дані за допомогою R. Ви почнете з перетворення типів даних, застосування обмежень діапазону та роботи з повними й частковими дублікатами, щоб уникнути подвійного підрахунку.

Пориньте у складні завдання з обробки даних

Після того, як ви потренуєтеся працювати з поширеними проблемами даних, ви перейдете до складніших завдань, таких як забезпечення узгодженості вимірювань і робота з відсутніми даними. Після кожної нової концепції у вас буде можливість виконати практичну вправу, щоб закріпити знання та набути досвіду.

Навчіться використовувати зіставлення записів під час очищення даних

Зіставлення записів використовується для об’єднання наборів даних, коли значення мають проблеми, такі як друкарські помилки або різні варіанти написання. Ви ознайомитеся з цією корисною технікою в останньому розділі та потренуєте її застосування, використавши її для об’єднання двох наборів даних із відгуками про ресторани в один набір даних.

Попередні вимоги

Навчальний план

Зміст курсу

1

Типові проблеми з даними

У цьому розділі ви навчитеся долати деякі з найпоширеніших проблем «брудних» даних. Ви перетворюватимете типи даних, застосовуватимете обмеження діапазону, щоб забрати точки з майбутнього, та видалятимете дублікати, щоб уникнути подвійного підрахунку.
Почати розділ
2

Категоріальні та текстові дані

Категоріальні та текстові дані часто є найхаотичнішою частиною набору даних через їх неструктурованість. У цьому розділі ви виправите розбіжності з пробілами та регістром у мітках категорій, об'єднаєте кілька категорій в одну та переформатуєте рядки для узгодженості.
Почати розділ
3

Просунуті проблеми з даними

У цьому розділі ви зануритеся в складніші завдання очищення даних, наприклад, забезпечите, щоб ваги були записані в кілограмах, а не у фунтах. Також ви здобудете важливі навички, які допоможуть перевіряти коректність внесення значень і стежити, щоб пропуски не спотворювали ваш аналіз.
Почати розділ
4

Record Linkage

Record linkage — це потужна техніка для об'єднання кількох наборів даних, яку застосовують, коли у значеннях є опечатки чи різні написання. У цьому розділі ви навчитеся поєднувати записи, обчислюючи схожість між рядками, — а потім застосуєте нові вміння, щоб об'єднати два набори відгуків про ресторани в єдиний чистий майстер-набір даних.
Почати розділ
R

Очищення даних в R

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.