Build your ultimate AI agent
Opis kursu
Brakujące dane zdarzają się wszędzie. Proces uzupełniania brakujących wartości nazywamy imputacją – umiejętność poprawnego wypełniania luk w danych jest niezbędna, jeśli chcesz tworzyć trafne prognozy i wyróżniać się na tle innych. W tym kursie nauczysz się korzystać z wizualizacji i testów statystycznych, aby rozpoznawać wzorce brakujących danych, oraz imputować dane za pomocą modeli statystycznych i uczenia maszynowego. Zdobędziesz też umiejętności decyzyjne, które pomogą ci dobrać najlepszą metodę imputacji do konkretnej sytuacji. Na koniec nauczysz się uwzględniać niepewność wynikającą z imputacji w swoich wnioskach i prognozach, czyniąc je bardziej rzetelnymi i odpornymi.
Wymagania wstępne
Program kursu
Plan kursu
1
Problem brakujących danych
W tym rozdziale dowiesz się, dlaczego brakujące dane mogą stanowić zagrożenie podczas analizy zbioru danych. Poznasz trzy mechanizmy powstawania braków i nauczysz się je rozpoznawać za pomocą testów statystycznych oraz narzędzi wizualizacyjnych.
- Brakujące dane: co może pójść nie tak50 XP
- Regresja liniowa z niekompletnymi danymi100 XP
- Analiza wyników regresji50 XP
- Porównywanie modeli100 XP
- Mechanizmy powstawania braków danych50 XP
- Rozpoznawanie mechanizmów brakujących danych100 XP
- Test t dla MAR: przygotowanie danych100 XP
- Test t dla MAR: interpretacja100 XP
- Wizualizacja wzorców brakujących danych50 XP
- Wykres agregacji100 XP
- Wykres słupkowy typu spine100 XP
- Wykres mozaikowy100 XP
2
Imputacja oparta na dawcach
Poznaj klasyfikację metod imputacji i naucz się trzech technik opartych na dawcach: imputacji średnią, hot-deck oraz k-najbliższych sąsiadów. Przyjrzysz się, jak te metody działają od środka, a następnie zastosujesz je do rzeczywistego zbioru danych pogodowych ze strefy tropikalnej. Po drodze poznasz też przydatne triki, dzięki którym metody te będą jeszcze skuteczniejsze w twoich problemach.
3
Imputacja oparta na modelach
Czas nauczyć się, jak używać modeli statystycznych i uczenia maszynowego – takich jak regresja liniowa, regresja logistyczna czy lasy losowe – do imputacji brakujących danych. W tym rozdziale przeanalizujesz, jak modele tworzą swoje predykcje, i wykorzystasz tę wiedzę do pobierania imputowanych wartości z rozkładów warunkowych. Jest to ważne, ponieważ sprawia, że imputacje są bardziej zróżnicowane i wiarygodne, a tym samym bliższe prawdziwym danym.
4
Niepewność wynikająca z imputacji
Imputowane wartości nie są ostateczne. To jedynie szacunki, a każdy szacunek wiąże się z pewną niepewnością. W tym ostatnim rozdziale odkryjesz, jak bootstrapping i metoda równań łańcuchowych z pakietu mice mogą służyć do uwzględniania niepewności imputacji w modelach i analizach, czyniąc je bardziej rzetelnymi i odpornymi.
R
Obsługa brakujących danych z imputacją w R
Kurs
ukończony

