Przejdź do głównej treści
Strona głównaR

Kurs

Czyszczenie danych w R

ŚredniozaawansowanyPoziom umiejętności
Zaktualizowano 08.2024
Naucz się czyścić dane jak najszybciej i najdokładniej, by przejść od surowych danych do świetnych wniosków.
Zacznij kurs za darmo
RData Preparation
4 godz.
13 filmów
44 Ćwiczenia
3,700 XP
61,210
Zaświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z GooglePokaż więcej opcji

lub


Kontynuując, akceptujesz nasze Warunki korzystania, naszą Politykę prywatności i fakt, że twoje dane są przechowywane w USA.

Uwielbiany przez kursantów z tysięcy firm

Group

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

Pokonaj typowe problemy z danymi, takie jak usuwanie duplikatów w R

Powszechnie mówi się, że data scientist spędzają 80% swojego czasu na czyszczeniu i przekształcaniu danych, a tylko 20% na ich analizie. Czas poświęcony na czyszczenie danych jest kluczowy, ponieważ analiza nieczystych danych może prowadzić do wyciągania nieprawidłowych wniosków.

W tym kursie nauczysz się różnych technik, które pomogą Ci czyścić nieczyste dane za pomocą R. Zaczniesz od konwertowania typów danych, stosowania ograniczeń zakresu i radzenia sobie z pełnymi oraz częściowymi duplikatami, aby uniknąć podwójnego liczenia.

Zanurz się w zaawansowane wyzwania związane z danymi

Gdy już poćwiczysz pracę nad typowymi problemami z danymi, przejdziesz do bardziej zaawansowanych wyzwań, takich jak zapewnianie spójności pomiarów i radzenie sobie z brakującymi danymi. Po każdym nowym zagadnieniu będziesz mieć okazję wykonać praktyczne ćwiczenie, aby utrwalić wiedzę i zdobyć doświadczenie.

Naucz się wykorzystywać record linkage podczas czyszczenia danych

Łączenie rekordów służy do scalania zbiorów danych, gdy wartości zawierają problemy, takie jak literówki lub różne pisownie. W ostatnim rozdziale poznasz tę przydatną technikę i przećwiczysz jej zastosowanie, łącząc dwa zbiory danych z recenzjami restauracji w jeden zbiór danych.

Wymagania wstępne

Joining Data with dplyr
1

Typowe problemy z danymi

W tym rozdziale nauczysz się radzić sobie z najczęstszymi problemami z brudnymi danymi. Dokonasz konwersji typów danych, zastosujesz ograniczenia zakresu, aby usunąć przyszłe punkty danych, oraz usuniesz zduplikowane rekordy, by uniknąć podwójnego liczenia.
Zacznij rozdział
2

Dane kategoryczne i tekstowe

Dane kategoryczne i tekstowe bywają jedną z najbardziej nieuporządkowanych części zbioru danych ze względu na swoją nieustrukturyzowaną naturę. W tym rozdziale nauczysz się usuwać zbędne spacje i wyrównywać wielkość liter w etykietach kategorii, łączyć wiele kategorii w jedną oraz ujednolicać format ciągów znaków.
Zacznij rozdział
3

Zaawansowane problemy z danymi

W tym rozdziale zmierzysz się z bardziej zaawansowanymi problemami z czyszczeniem danych – na przykład sprawdzisz, czy wagi są wszędzie podane w kilogramach, a nie w funtach. Zdobędziesz też cenne umiejętności, które pomogą ci weryfikować poprawność wartości i zadbać o to, by brakujące dane nie zaburzały wyników analiz.
Zacznij rozdział
4

Łączenie rekordów

Łączenie rekordów to skuteczna technika scalania wielu zbiorów danych, przydatna wtedy, gdy wartości zawierają literówki lub różne warianty pisowni. W tym rozdziale nauczysz się łączyć rekordy przez obliczanie podobieństwa między ciągami znaków, a następnie wykorzystasz nowe umiejętności, by połączyć dwa zbiory recenzji restauracji w jeden, spójny zbiór danych.
Zacznij rozdział
Czyszczenie danych w R
Kurs
ukończony

Zdobądź zaświadczenie o ukończeniu

Dodaj to poświadczenie do swojego profilu LinkedIn, CV lub życiorysu
Udostępnij to w mediach społecznościowych i podczas oceny wyników pracy
Zapisz się teraz

Dołącz do ponad 19 milionów kursantów i zacznij Czyszczenie danych w R już dziś!

Utwórz bezpłatne konto

Kontynuuj z GooglePokaż więcej opcji

lub


Kontynuując, akceptujesz nasze Warunki korzystania, naszą Politykę prywatności i fakt, że twoje dane są przechowywane w USA.

Rozwijaj swoje umiejętności w zakresie danych dzięki DataCamp dla urządzeń mobilnych

Rób postępy w podróży dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.