Weiter zum Inhalt

[Infografik] Checkliste zur Datenbereinigung

Datenbereinigung macht 80 % des Data-Science-Workflows aus. Nutze diese Checkliste, um Qualitätsprobleme in deinen Daten zu erkennen und zu beheben.
Aktualisiert 18. Sept. 2026  · 5 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Datenbereinigung macht 80 % des Data-Science-Workflows aus. Deshalb haben wir diese Checkliste erstellt, damit du Qualitätsprobleme in deinen Daten schnell erkennst und behebst. Wenn du mehr über Datenbereinigung lernen willst, sieh dir unseren Kurs zu Cleaning Data in Python bzw. in R an. 

Checkliste zur Datenbereinigung

Zum Herunterladen auf das Bild oben klicken

Probleme mit Datenrestriktionen

1. Einschränkungen beim Datentyp

  • Was ist das: Sicherstellen, dass Spalten vor der Analyse den korrekten Datentyp haben. 
  • Beispiel aus der Praxis: Eine Spalte revenue_usd ist als String statt als numerischer Datentyp gespeichert.
  • Mögliche Lösungen: In den korrekten Datentyp umwandeln

2. Einschränkungen beim Wertebereich

  • Was ist das: Sicherstellen, dass Spalten im erwarteten Wertebereich liegen. Besonders relevant für Spalten mit klaren Grenzen.
  • Beispiel aus der Praxis: Eine gpa-Spalte sollte auf den Bereich [0,0; 4,0] beschränkt sein
  • Mögliche Lösungen:
    • Auf Tippfehler prüfen, z. B. ein falsch gesetztes Dezimalzeichen.
    • Zeilen entfernen, die die Bereichsgrenzen verletzen
    • Werte, die die Grenzen verletzen, auf das Maximum oder Minimum setzen
    • Werte, die die Grenzen verletzen, als fehlend markieren und imputieren

3. Eindeutigkeitsbeschränkungen

  • Was ist das: Sicherstellen, dass es keine exakten oder nahezu exakten Duplikate in den Zeilen gibt. 
  • Beispiel aus der Praxis: Eine doppelte Zeile, in der name und phone_number identisch sind, aber height_cm nicht
  • Mögliche Lösungen:
    • Nur eine der exakt doppelten Zeilen behalten
    • Zeilen mit nicht exakt identischen Duplikaten zusammenführen 

Probleme mit Text- und kategorialen Daten

1. Zugehörigkeitsregeln für kategoriale Daten

  • Was ist das: Sicherstellen, dass kategoriale Spalten korrekte und einheitliche Kategorien haben
  • Beispiel aus der Praxis: Zwei unterschiedliche Einträge für „New York“ in der Spalte city
  • Mögliche Lösungen:
    • Zeilen mit inkonsistenten Kategorien entfernen
    • Inkonsistente Kategorien auf den korrekten Kategorienamen mappen
    • Kategorien anhand anderer Merkmale ableiten, wenn unklar ist, wie remappt werden soll

2. Längenverletzung bei Textdaten

  • Was ist das: Sicherstellen, dass Textspalten mit festem Standard dieselbe Zeichenlänge aufweisen 
  • Beispiel aus der Praxis: Eine US-phone_number-Spalte mit 9 statt 14 Zeichen
  • Mögliche Lösungen:
    • Betroffene Zeilen mit Längenverletzungen entfernen
    • Betroffene Werte als fehlend setzen

3. Inkonsistente Formatierung bei Textdaten

  • Was ist das: Sicherstellen, dass Textspalten einem einheitlichen Formatstandard folgen 
  • Beispiel aus der Praxis: Unterschiedliche Schreibweisen oder Formatierungen in der Spalte address
  • Mögliche Lösungen:
    • Formatierungen vereinheitlichen (z. B. Groß-/Kleinschreibung, Leerzeichen, Sonderzeichen)
    • Betroffene Werte als fehlend markieren und bei Bedarf imputieren

Probleme mit Datenuniformität

1. Einheitliche Maßeinheiten bei numerischen Spalten

  • Was ist das: Sicherstellen, dass numerische Spalten dieselben Einheiten verwenden (z. B. Temperatur konsistent in Celsius oder Fahrenheit über alle Beobachtungen. Besonders wichtig beim Zusammenführen von Datensätzen aus verschiedenen Ländern oder Quellen.) 
  • Beispiel aus der Praxis: Eine Temperaturspalte in Celsius mit unrealistisch hohen oder niedrigen Werten 
  • Mögliche Lösungen:
    • Zeilen entfernen, bei denen der Kontext zu Einheiten fehlt und die den Plausibilitätscheck nicht bestehen
    • Einheiten, wo möglich, standardisieren

2. Einheitliche Formate bei Datumsspalten

  • Was ist das: Sicherstellen, dass Datumsspalten dasselbe Datums-/Zeitformat haben
  • Beispiel aus der Praxis: Spalte birthday mit Datumsangaben in dd-mm-yyyy und mm-dd-yyyy
  • Mögliche Lösungen:
    • Datums- und Zeitformate, wo möglich, standardisieren
    • Zeilen entfernen, bei denen der Kontext zum Datumsformat fehlt und die den Plausibilitätscheck nicht bestehen

3. Crossfield-Validierung bei numerischen Spalten

  • Was ist das: Crossfield-Validierung nutzt mehrere Felder eines Datensatzes, um die Gültigkeit eines anderen Feldes zu prüfen. Beispiel: Sicherstellen, dass Teile-zu-Ganze-Spalten zu einer sinnvollen Gesamtsumme addiert werden.
  • Beispiel aus der Praxis: Flugbuchungen je Klasse summieren sich zur Gesamtzahl der Buchungen
  • Mögliche Lösungen:
    • Zeilen entfernen, die Plausibilitätsprüfungen nicht bestehen
    • Regeln aus Domänenwissen anwenden, basierend auf Kenntnis der Daten 

4. Crossfield-Validierung bei Datumsspalten

  • Was ist das: Sicherstellen, dass Datums- und Zeitspalten Plausibilitätsprüfungen bestehen (z. B. dass Anmeldedaten zu Webinaren immer vor dem Teilnahmedatum liegen) 
  • Beispiel aus der Praxis: Eine Spalte date_of_birth, die nicht mit der Spalte age übereinstimmt
  • Mögliche Lösungen:
    • Zeilen entfernen, die Plausibilitätsprüfungen nicht bestehen
    • Regeln aus Domänenwissen anwenden, basierend auf Kenntnis der Daten 

Probleme mit fehlenden Daten

1. Missing Completely at Random

  • Was ist das: Es gibt keinen systematischen Zusammenhang zwischen fehlenden Werten und anderen Werten im Datensatz
  • Beispiel aus der Praxis: Es lässt sich kein Zusammenhang zwischen fehlenden Daten und anderen Werten im Datensatz beobachten
  • Mögliche Lösungen:
    • Zeilen mit fehlenden Werten entfernen
    • Fehlende Werte mit Lagemaßen wie Median oder Mittelwert imputieren
    • Fehlende Werte mit algorithmischen, Machine-Learning-basierten Methoden imputieren
    • Neue Datenpunkte und Merkmale erheben 

2. Missing at Random

  • Was ist das: Es gibt einen systematischen Zusammenhang zwischen fehlenden Daten und anderen beobachteten Werten
  • Beispiel aus der Praxis: Fehlende Zensusdaten aus einer bestimmten Region, weil der Postdienst dort keine vollständige Abdeckung hat
  • Mögliche Lösungen:
    • Zeilen mit fehlenden Werten entfernen
    • Fehlende Werte mit Lagemaßen wie Median oder Mittelwert imputieren
    • Fehlende Werte mit algorithmischen, Machine-Learning-basierten Methoden imputieren
    • Neue Datenpunkte und Merkmale erheben 

3. Missing Not at Random

  • Was ist das: Es gibt einen systematischen Zusammenhang zwischen fehlenden Daten und nicht beobachteten Größen 
  • Beispiel aus der Praxis: Ausgefallene Temperaturmessungen eines Sensors, weil die Temperatur zu niedrig oder zu hoch war
  • Mögliche Lösungen:
    • Zeilen mit fehlenden Werten entfernen
    • Fehlende Werte mit Lagemaßen wie Median oder Mittelwert imputieren
    • Fehlende Werte mit algorithmischen, Machine-Learning-basierten Methoden imputieren
    • Neue Datenpunkte und Merkmale erheben 
Themen
Datenwissenschaft
Datenanalyse

Mehr über Datenbereinigung lernen

Kurs

Datenbereinigung in Python

4 Std.
160.2K
Erwirb die nötigen Fähigkeiten, um fehlerhafte Daten zu bereinigen und Rohdaten in wertvolle Erkenntnisse zu verwandeln.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow