Weiter zum Inhalt

Kurs

Fehlende Daten mit Imputationen in R behandeln

Fortgeschritten4 Std.

Fehlende Daten diagnostizieren, visualisieren und mit verschiedenen Imputationstechniken behandeln – mit Tipps, um deine Ergebnisse zu verbessern.

R4 Std.13 Videos49 Übungen4,200 XP6,237Leistungsnachweis

Erstelle dein kostenloses Konto

Mit Google fortfahren
oder
Indem du fortfährst, akzeptierst du unsere Nutzungsbedingungen, unser Datenschutzrichtlinie und dass Ihre Daten in den USA gespeichert werden.

Geliebt von Lernenden in Tausenden Unternehmen

Kursbeschreibung

Fehlende Daten gibt es überall. Das Auffüllen fehlender Werte nennt man Imputation, und zu wissen, wie man fehlende Daten korrekt ergänzt, ist eine zentrale Fähigkeit, wenn du präzise Vorhersagen treffen und dich von der Masse abheben willst. In diesem Kurs lernst du, mit Visualisierungen und statistischen Tests fehlende Datenmuster zu erkennen und Daten mithilfe verschiedener statistischer und Machine-Learning-Modelle zu imputieren. Außerdem baust du Entscheidungsfähigkeiten auf, mit denen du auswählen kannst, welche Imputationsmethode in einer bestimmten Situation am besten passt. Zum Schluss lernst du, die Unsicherheit aus der Imputation in deine Inferenz und Vorhersagen einzubeziehen, sodass sie robuster und verlässlicher werden.

Voraussetzungen

Lernprogramm

Kursübersicht

1

Das Problem fehlender Daten

In diesem Kapitel findest du heraus, warum fehlende Daten ein Risiko bei der Analyse eines Datensatzes darstellen können. Du lernst die drei Mechanismen fehlender Daten kennen und erfährst, wie du sie mit statistischen Tests und Visualisierungstools erkennst.
Kapitel starten
2

Spenderbasierte Imputation

Lerne die Taxonomie der Imputationsmethoden kennen und drei spenderbasierte Techniken: Mittelwert-, Hot-Deck- und k-Nearest-Neighbors-Imputation. Du wirfst einen Blick unter die Haube, um zu sehen, wie diese Methoden funktionieren, bevor du lernst, wie du sie auf einen realen Datensatz zu tropischem Wetter anwendest. Unterwegs entdeckst du außerdem nützliche Tricks, mit denen du sie für deine Aufgaben noch besser einsetzen kannst.
Kapitel starten
3

Modellbasierte Imputation

Jetzt lernst du, wie du statistische und Machine-Learning-Modelle wie lineare Regression, logistische Regression und Random Forests zur Imputation fehlender Daten nutzt. In diesem Kapitel schaust du dir an, wie die Modelle ihre Vorhersagen treffen, und nutzt dieses Wissen, um die imputierten Werte aus konditionalen Verteilungen zu ziehen. Das ist wichtig, weil es deine Imputationen vielfältiger und plausibler macht – und damit den echten Daten ähnlicher.
Kapitel starten
4

Unsicherheit durch Imputation

Imputierte Werte sind nicht in Stein gemeißelt. Es sind Schätzwerte, und Schätzungen gehen mit Unsicherheit einher. In diesem letzten Kapitel entdeckst du, wie Bootstrapping und verkettete Gleichungen mit dem Paket mice verwendet werden können, um die Imputationsunsicherheit in deine Modelle und Analysen zu integrieren und sie dadurch verlässlicher und robuster zu machen.
Kapitel starten
R

Fehlende Daten mit Imputationen in R behandeln

Kurs
abgeschlossen

Bescheinigung über den Abschluss erhalten

Jetzt einschreiben

Datenkompetenz für unterwegs – mit der DataCamp-App

Mit unseren Kursen für Mobilgeräte und täglichen Programmier-Challenges erweiterst du deine Datenkompetenz von unterwegs.