Kurs
Czyszczenie danych w R
ŚredniozaawansowanyPoziom umiejętności
Zaktualizowano 08.2024
RData Preparation4 godz.13 filmów44 Ćwiczenia3,700 XP61,210Zaświadczenie o ukończeniu
Utwórz bezpłatne konto
Kontynuuj z GooglePokaż więcej opcjilub
Kontynuując, akceptujesz nasze Warunki korzystania, naszą Politykę prywatności i fakt, że twoje dane są przechowywane w USA.
Uwielbiany przez kursantów z tysięcy firm
Szkolisz zespół?
Wypróbuj dla firmOpis kursu
Pokonaj typowe problemy z danymi, takie jak usuwanie duplikatów w R
Powszechnie mówi się, że data scientist spędzają 80% swojego czasu na czyszczeniu i przekształcaniu danych, a tylko 20% na ich analizie. Czas poświęcony na czyszczenie danych jest kluczowy, ponieważ analiza nieczystych danych może prowadzić do wyciągania nieprawidłowych wniosków.W tym kursie nauczysz się różnych technik, które pomogą Ci czyścić nieczyste dane za pomocą R. Zaczniesz od konwertowania typów danych, stosowania ograniczeń zakresu i radzenia sobie z pełnymi oraz częściowymi duplikatami, aby uniknąć podwójnego liczenia.
Zanurz się w zaawansowane wyzwania związane z danymi
Gdy już poćwiczysz pracę nad typowymi problemami z danymi, przejdziesz do bardziej zaawansowanych wyzwań, takich jak zapewnianie spójności pomiarów i radzenie sobie z brakującymi danymi. Po każdym nowym zagadnieniu będziesz mieć okazję wykonać praktyczne ćwiczenie, aby utrwalić wiedzę i zdobyć doświadczenie.Naucz się wykorzystywać record linkage podczas czyszczenia danych
Łączenie rekordów służy do scalania zbiorów danych, gdy wartości zawierają problemy, takie jak literówki lub różne pisownie. W ostatnim rozdziale poznasz tę przydatną technikę i przećwiczysz jej zastosowanie, łącząc dwa zbiory danych z recenzjami restauracji w jeden zbiór danych.Wymagania wstępne
Joining Data with dplyr1
Typowe problemy z danymi
W tym rozdziale nauczysz się radzić sobie z najczęstszymi problemami z brudnymi danymi. Dokonasz konwersji typów danych, zastosujesz ograniczenia zakresu, aby usunąć przyszłe punkty danych, oraz usuniesz zduplikowane rekordy, by uniknąć podwójnego liczenia.
2
Dane kategoryczne i tekstowe
Dane kategoryczne i tekstowe bywają jedną z najbardziej nieuporządkowanych części zbioru danych ze względu na swoją nieustrukturyzowaną naturę. W tym rozdziale nauczysz się usuwać zbędne spacje i wyrównywać wielkość liter w etykietach kategorii, łączyć wiele kategorii w jedną oraz ujednolicać format ciągów znaków.
3
Zaawansowane problemy z danymi
W tym rozdziale zmierzysz się z bardziej zaawansowanymi problemami z czyszczeniem danych – na przykład sprawdzisz, czy wagi są wszędzie podane w kilogramach, a nie w funtach. Zdobędziesz też cenne umiejętności, które pomogą ci weryfikować poprawność wartości i zadbać o to, by brakujące dane nie zaburzały wyników analiz.
4
Łączenie rekordów
Łączenie rekordów to skuteczna technika scalania wielu zbiorów danych, przydatna wtedy, gdy wartości zawierają literówki lub różne warianty pisowni. W tym rozdziale nauczysz się łączyć rekordy przez obliczanie podobieństwa między ciągami znaków, a następnie wykorzystasz nowe umiejętności, by połączyć dwa zbiory recenzji restauracji w jeden, spójny zbiór danych.
Czyszczenie danych w R
Kurs ukończony
Zdobądź zaświadczenie o ukończeniu
Dodaj to poświadczenie do swojego profilu LinkedIn, CV lub życiorysuUdostępnij to w mediach społecznościowych i podczas oceny wyników pracyZapisz się teraz
Dołącz do ponad 19 milionów kursantów i zacznij Czyszczenie danych w R już dziś!
Utwórz bezpłatne konto
Kontynuuj z GooglePokaż więcej opcjilub
Kontynuując, akceptujesz nasze Warunki korzystania, naszą Politykę prywatności i fakt, że twoje dane są przechowywane w USA.
Rozwijaj swoje umiejętności w zakresie danych dzięki DataCamp dla urządzeń mobilnych
Rób postępy w podróży dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.