Przejdź do głównej treści

Kurs

Czyszczenie danych w R

Średniozaawansowany4 godz.

Naucz się czyścić dane jak najszybciej i najdokładniej, by przejść od surowych danych do świetnych wniosków.

R4 godz.{count, plural, one {# film} few {# filmy} many {# filmów} other {# filmów}}{count, plural, one {# ćwiczenie} few {# ćwiczenia} many {# ćwiczeń} other {# ćwiczenia}}3,700 XP61,321Oświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z Google
lub
Kontynuując, akceptujesz nasz Warunki użytkowania, nasz Polityka prywatności i że Twoje dane są przechowywane w USA.

Uwielbiany przez uczących się w tysiącach firm

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

Pokonaj typowe problemy z danymi, takie jak usuwanie duplikatów w R

Powszechnie mówi się, że data scientist spędzają 80% swojego czasu na czyszczeniu i przekształcaniu danych, a tylko 20% na ich analizie. Czas poświęcony na czyszczenie danych jest kluczowy, ponieważ analiza nieczystych danych może prowadzić do wyciągania nieprawidłowych wniosków.

W tym kursie nauczysz się różnych technik, które pomogą Ci czyścić nieczyste dane za pomocą R. Zaczniesz od konwertowania typów danych, stosowania ograniczeń zakresu i radzenia sobie z pełnymi oraz częściowymi duplikatami, aby uniknąć podwójnego liczenia.

Zanurz się w zaawansowane wyzwania związane z danymi

Gdy już poćwiczysz pracę nad typowymi problemami z danymi, przejdziesz do bardziej zaawansowanych wyzwań, takich jak zapewnianie spójności pomiarów i radzenie sobie z brakującymi danymi. Po każdym nowym zagadnieniu będziesz mieć okazję wykonać praktyczne ćwiczenie, aby utrwalić wiedzę i zdobyć doświadczenie.

Naucz się wykorzystywać record linkage podczas czyszczenia danych

Łączenie rekordów służy do scalania zbiorów danych, gdy wartości zawierają problemy, takie jak literówki lub różne pisownie. W ostatnim rozdziale poznasz tę przydatną technikę i przećwiczysz jej zastosowanie, łącząc dwa zbiory danych z recenzjami restauracji w jeden zbiór danych.

Wymagania wstępne

Program kursu

Plan kursu

1

Typowe problemy z danymi

W tym rozdziale nauczysz się radzić sobie z najczęstszymi problemami z brudnymi danymi. Dokonasz konwersji typów danych, zastosujesz ograniczenia zakresu, aby usunąć przyszłe punkty danych, oraz usuniesz zduplikowane rekordy, by uniknąć podwójnego liczenia.
Rozpocznij rozdział
2

Dane kategoryczne i tekstowe

Dane kategoryczne i tekstowe bywają jedną z najbardziej nieuporządkowanych części zbioru danych ze względu na swoją nieustrukturyzowaną naturę. W tym rozdziale nauczysz się usuwać zbędne spacje i wyrównywać wielkość liter w etykietach kategorii, łączyć wiele kategorii w jedną oraz ujednolicać format ciągów znaków.
Rozpocznij rozdział
3

Zaawansowane problemy z danymi

W tym rozdziale zmierzysz się z bardziej zaawansowanymi problemami z czyszczeniem danych – na przykład sprawdzisz, czy wagi są wszędzie podane w kilogramach, a nie w funtach. Zdobędziesz też cenne umiejętności, które pomogą ci weryfikować poprawność wartości i zadbać o to, by brakujące dane nie zaburzały wyników analiz.
Rozpocznij rozdział
4

Łączenie rekordów

Łączenie rekordów to skuteczna technika scalania wielu zbiorów danych, przydatna wtedy, gdy wartości zawierają literówki lub różne warianty pisowni. W tym rozdziale nauczysz się łączyć rekordy przez obliczanie podobieństwa między ciągami znaków, a następnie wykorzystasz nowe umiejętności, by połączyć dwa zbiory recenzji restauracji w jeden, spójny zbiór danych.
Rozpocznij rozdział
R

Czyszczenie danych w R

Kurs
ukończony

Zdobądź Certyfikat Ukończenia

Zapisz się

Rozwijaj swoje umiejętności danych z DataCamp for Mobile

Rozwijaj się w drodze dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.

Czyszczenie danych w R | DataCamp