After doing these courses, I feel confident creating professional visualizations and dashboards
Opis kursu
Brakujące dane są nieodłączną częścią każdej analizy danych z prawdziwego świata. Mogą pojawiać się w nieoczekiwanych miejscach, utrudniając interpretację wyników. W tym kursie nauczysz się korzystać z narzędzi tidyverse oraz pakietu naniar w R, aby wizualizować brakujące wartości. Poznasz sposoby porządkowania brakujących danych tak, by można je było wykorzystać w analizie, a także metody ich eksploracji pod kątem potencjalnych błędów systematycznych. Na koniec odkryjesz ukryte wzorce braków danych. Dowiesz się również, jak „wypełniać luki" za pomocą modeli imputacji oraz jak wizualizować, oceniać i interpretować zaimputowane zbiory danych.
Wymagania wstępne
Program kursu
Plan kursu
1
Dlaczego brakujące dane mają znaczenie?
Rozdział 1 wprowadza w tematykę brakujących danych: dowiesz się, czym są brakujące wartości, jak zachowują się w R, jak je wykrywać i zliczać. Następnie poznasz podsumowania brakujących danych oraz sposoby agregowania braków według obserwacji, zmiennych i grup w zbiorze danych. Na koniec omówimy wizualizacje brakujących danych – od ogólnych przeglądów całego zbioru, przez analizy według zmiennych i obserwacji, aż po eksplorację w podziale na grupy.
- Wprowadzenie do brakujących danych50 XP
- Praca z brakującymi wartościami i ich wykrywanie100 XP
- Ile brakujących wartości jest w danych?100 XP
- Praca z brakującymi wartościami50 XP
- Dlaczego warto dbać o brakujące wartości?50 XP
- Podsumowanie brakujących wartości100 XP
- Tabelaryczne podsumowanie braków danych100 XP
- Inne podsumowania brakujących danych100 XP
- Jak wizualizować brakujące wartości?50 XP
- Twoja pierwsza wizualizacja brakujących danych100 XP
- Wizualizacja brakujących obserwacji i zmiennych100 XP
- Wizualizacja wzorców brakujących danych100 XP
2
Porządkowanie i przetwarzanie brakujących wartości
W rozdziale drugim nauczysz się wykrywać ukryte brakujące wartości, takie jak „missing" czy „N/A", i zastępować je wartością `NA`. Poznasz efektywne metody obsługi niejawnych braków danych – czyli wartości, które faktycznie brakują, ale nie są jawnie oznaczone. Omówimy też zależności w brakujących danych: Missing Completely at Random (MCAR), Missing at Random (MAR) oraz Missing Not at Random (MNAR) – i wyjaśnimy, co każdy z tych mechanizmów oznacza dla twojej analizy.
3
Badanie zależności w brakujących danych
W tym rozdziale poznasz przepływy pracy do obsługi brakujących danych. Przedstawimy specjalne struktury danych – macierz cieni (shadow matrix) oraz dane nabular – i pokażemy, jak wykorzystać je w eksploracji braków, łącząc podsumowania brakujących wartości z rzeczywistymi danymi. Nauczysz się używać ggplot do eksploracji i wizualizacji tego, jak wartości zmieniają się wraz z pojawianiem się braków w innych zmiennych. Na koniec dowiesz się, jak wizualizować braki dla par zmiennych oraz jak i dlaczego uwzględniać brakujące wartości na wykresach punktowych.
4
Łączenie kropek (imputacja)
W tym rozdziale nauczysz się uzupełniać brakujące wartości w danych – czyli stosować imputację. Poznasz metody imputacji i śledzenia brakujących wartości, a także zalety i wady poszczególnych podejść, które pozwolą ci eksplorować, wizualizować i oceniać zaimputowane dane w odniesieniu do wartości oryginalnych. Dowiesz się, jak używać różnych modeli imputacji, jak je oceniać i porównywać, a także jak różne podejścia do imputacji wpływają na wnioski, które można wyciągnąć z modeli.
R
Praca z brakującymi danymi w R
Kurs
ukończony

