Nach diesen Kursen fühle ich mich sicher, professionelle Visualisierungen und Dashboards zu erstellen.
Kursbeschreibung
Fehlende Daten gibt es überall. Das Auffüllen fehlender Werte nennt man Imputation, und zu wissen, wie man fehlende Daten korrekt ergänzt, ist eine zentrale Fähigkeit, wenn du präzise Vorhersagen treffen und dich von der Masse abheben willst. In diesem Kurs lernst du, mit Visualisierungen und statistischen Tests fehlende Datenmuster zu erkennen und Daten mithilfe verschiedener statistischer und Machine-Learning-Modelle zu imputieren. Außerdem baust du Entscheidungsfähigkeiten auf, mit denen du auswählen kannst, welche Imputationsmethode in einer bestimmten Situation am besten passt. Zum Schluss lernst du, die Unsicherheit aus der Imputation in deine Inferenz und Vorhersagen einzubeziehen, sodass sie robuster und verlässlicher werden.
Voraussetzungen
Lernprogramm
Kursübersicht
1
Das Problem fehlender Daten
In diesem Kapitel findest du heraus, warum fehlende Daten ein Risiko bei der Analyse eines Datensatzes darstellen können. Du lernst die drei Mechanismen fehlender Daten kennen und erfährst, wie du sie mit statistischen Tests und Visualisierungstools erkennst.
- Fehlende Daten: Was kann schiefgehen50 XP
- Lineare Regression mit unvollständigen Daten100 XP
- Regressionsausgabe analysieren50 XP
- Modelle vergleichen100 XP
- Mechanismen fehlender Daten50 XP
- Fehlende-Daten-Mechanismen erkennen100 XP
- t-test für MAR: Datenaufbereitung100 XP
- t-test für MAR: Interpretation100 XP
- Fehlende Datenmuster visualisieren50 XP
- Aggregations-Plot100 XP
- Spine-Plot100 XP
- Mosaikdiagramm100 XP
2
Spenderbasierte Imputation
Lerne die Taxonomie der Imputationsmethoden kennen und drei spenderbasierte Techniken: Mittelwert-, Hot-Deck- und k-Nearest-Neighbors-Imputation. Du wirfst einen Blick unter die Haube, um zu sehen, wie diese Methoden funktionieren, bevor du lernst, wie du sie auf einen realen Datensatz zu tropischem Wetter anwendest. Unterwegs entdeckst du außerdem nützliche Tricks, mit denen du sie für deine Aufgaben noch besser einsetzen kannst.
3
Modellbasierte Imputation
Jetzt lernst du, wie du statistische und Machine-Learning-Modelle wie lineare Regression, logistische Regression und Random Forests zur Imputation fehlender Daten nutzt. In diesem Kapitel schaust du dir an, wie die Modelle ihre Vorhersagen treffen, und nutzt dieses Wissen, um die imputierten Werte aus konditionalen Verteilungen zu ziehen. Das ist wichtig, weil es deine Imputationen vielfältiger und plausibler macht – und damit den echten Daten ähnlicher.
4
Unsicherheit durch Imputation
Imputierte Werte sind nicht in Stein gemeißelt. Es sind Schätzwerte, und Schätzungen gehen mit Unsicherheit einher. In diesem letzten Kapitel entdeckst du, wie Bootstrapping und verkettete Gleichungen mit dem Paket mice verwendet werden können, um die Imputationsunsicherheit in deine Modelle und Analysen zu integrieren und sie dadurch verlässlicher und robuster zu machen.
R
Fehlende Daten mit Imputationen in R behandeln
Kurs
abgeschlossen

