Weiter zum Inhalt

[Infografik] Checkliste für Data-Science-Projekte

Nutze diese Checkliste für die Planung deines nächsten Data-Science-Projekts.
Aktualisiert 18. Sept. 2026

Mit KI erkunden

ChatGPTClaudePerplexity

Gutes Projektmanagement steigert Effizienz und Produktivität und senkt gleichzeitig das Risiko zu scheitern. Leider sind Data-Science-Projekte besonders anspruchsvoll, weil sie Stakeholder aus vielen Teams einbinden und sowohl geschäftliche als auch technische Ziele unter einen Hut bringen müssen.

Projektmanagement-Frameworks geben dir Leitplanken, um zu planen, Ressourcen zuzuweisen und Aufgaben so umzusetzen, dass du deine Ziele termingerecht und im Budget erreichst.

Diese Infografik verdichtet die wichtigsten Punkte aus zwei führenden Projektmanagement-Frameworks – Microsofts Team Data Science Process und dem Domino Data Science Life Cycle von Domino Data Lab – zu einer handlichen Checkliste für deine eigenen Projekte.

Data Cleaning Checklist@1x (1).png

Habe diese Infografik immer griffbereit

Lade diese Infografik herunter und halte sie für dein nächstes Data Science-Projekt bereit

Jetzt Herunterladen

So nutzt du diesen Spickzettel

Dieser Spickzettel fasst Best Practices für das Projektmanagement von Data-Science-Projekten zusammen, gesammelt aus Microsofts Team Data Science Process und dem Domino Data Science Life Cycle von Domino Data Lab. Er verbindet CRISP-DM-Prinzipien mit denen der agilen Softwareentwicklung (Agile und Scrum). Nutze diese Checkliste für die Planung deines nächsten Data-Science-Projekts! 

Prinzipien für wirksames Data-Science-Projektmanagement 

Erfahrungsgemäß haben erfolgreiche Data-Science-Projekte oft folgende Merkmale gemeinsam:

  • Messbar: Lassen sich Projekterfolg und Business-Impact quantifizieren?
  • Zuverlässig: Welcher Anteil der Projekte hat die Ziele erreicht?
  • Skalierbar: Lässt sich der Durchsatz steigern, ohne die Zuverlässigkeit spürbar zu verschlechtern?

Darüber hinaus sollten Datenteams bei der Steuerung von Data-Science-Projekten folgende Prinzipien beachten: 

  • Iterieren: Projekte verlaufen selten geradlinig. Im Verlauf lernst du Dinge, die Anpassungen erfordern. Im Sinne von Scrum und Agile ist es ausdrücklich erwünscht, bei Bedarf frühere Schritte erneut aufzugreifen.
  • Wiederverwenden statt neu bauen: Jedes Projekt von Grund auf zu entwickeln, kostet Zeit und ist ineffizient. Die Wiederverwendung von Komponenten – ob Code, Modell-Features oder Dokumentvorlagen – bewahrt dich davor, das Rad neu zu erfinden.
  • Reproduzierbarkeit sicherstellen: Die Erklärung und Begründung deiner Arbeit ist oft aufwändiger als die Arbeit selbst. Methode und Ergebnisse können von Aufsichtsbehörden oder Kundinnen und Kunden geprüft werden. Auch du könntest später darauf zurückkommen. Reproduzierbare Arbeitsweisen sparen hier Zeit und reduzieren das Risiko unentdeckter Fehler.

Checkliste für Data-Science-Projekte 

Sowohl Microsoft als auch Domino Data Lab schlagen ähnliche Phasen für Data-Science-Projekte vor. Im Folgenden fassen wir diese Phasen zu einem einheitlichen Rahmen zusammen:

Kontext klären & Ideen entwickeln 

Was ist zu tun?

Wie geht man vor?

Geschäftsproblem definieren

Formuliere so eindeutig wie möglich, warum das Projekt durchgeführt wird. 

Stakeholder identifizieren

Rollen können sein: Projektmanager, Data Scientist, Account Manager, Datenadministrator.

Vorarbeiten prüfen

Sichte bestehende Projekte mit ähnlicher Fragestellung.

  • Was waren die wichtigsten Ergebnisse?
  • Lassen sich Arbeiten oder Assets für dieses Projekt wiederverwenden?
  • Welche Fehler sollten vermieden werden?

Messgrößen (KPIs/Metriken) für den Erfolg festlegen

Metriken sollten die SMART-Kriterien erfüllen.

  • Specific: Eindeutig definiert, damit alle im Team sie verstehen.
  • Measurable: Es ist messbar, ob der KPI erreicht wurde.
  • Achievable: Team verfügt über die nötigen Kompetenzen und Ressourcen.
  • Relevant: Der KPI zahlt auf übergeordnete Unternehmensziele ein.
  • Time-related: Es gibt eine Frist zur Zielerreichung.

Nicht SMART: "Website-Conversions steigern"

SMART: "Design und User Experience der Website optimieren, um die Conversion-Rate bis Ende Q2 um 10% zu erhöhen"

Projektumfang festlegen

  • Welche Ergebnisse werden geliefert?
  • Welche Anforderungen gelten für diese Ergebnisse?
  • Was ist explizit nicht Teil des Projekts?

Projektplan erstellen

  • Meilensteine für Zwischenschritte definieren.
  • Zeitplan für jeden Meilenstein festlegen.
  • Kurze Beschreibung jedes Schritts verfassen.

Projekteinfluss abschätzen

  • Den Nutzen für die Organisation bei Zielerreichung quantifizieren.
  • Bei Unsicherheit Spannen oder Konfidenzintervalle für den Nutzen angeben.
  • Qualitative, nicht quantifizierbare Vorteile auflisten.

Projektaufwand abschätzen

  • Wie hoch sind die Kosten?
  • Wie viel Zeit wird benötigt?
  • Welche Ressourcen werden gebraucht?

Projektrisiken einschätzen

  • Alle Risiken auflisten.
  • Für jedes Risiko die Auswirkung als Produkt aus Eintrittswahrscheinlichkeit und Schwere bewerten.

Entscheiden, ob das Projekt fortgesetzt wird

Auf Basis von erwartetem Nutzen im Verhältnis zu Aufwand und Risiken entscheiden, ob du

  • das Projekt jetzt vorantreibst,
  • es zugunsten höher priorisierter Vorhaben pausierst oder
  • es beendest.

Verantwortlichkeiten je Stakeholder festlegen

Nutze das RACI-Modell. Für jede Aufgabe festlegen, wer

  • Responsible ist: führt die Arbeit aus,
  • Accountable ist: trifft Schlüsselentscheidungen,
  • Consulted wird: wird für Entscheidungen um Rat gefragt,
  • Informed wird: über Entscheidungen informiert werden muss.

Kommunikationsstrategie festlegen

  • Wie bleibt ihr im Austausch?
  • In welchem Rhythmus finden Meetings statt?

Datenquellen identifizieren

  • Hast du bereits Zugriff auf diese Daten?
  • Wo sind die Daten gespeichert?
  • In welchem Format liegen sie vor?
  • Wie groß ist der Datensatz?
  • Gibt es ein Data Dictionary, das die Bedeutung erklärt?
  • Lassen sich synthetische Daten für einen Proof of Concept erzeugen?

Regulatorische Anforderungen antizipieren

  • Werden Deliverables (z. B. Finanzmodelle) geprüft?
  • Dürfen alle Datenquellen oder Features rechtlich genutzt werden?

Technologie-Stack festlegen

  • Auf Tools für Speicherung, Verarbeitung und Modellierung der Daten einigen.

Project Charter erstellen

  • In einem kurzen Dokument Ziele, Stakeholder, KPIs, Plan, Datenquellen, Tech-Stack und Kommunikationsstrategie zusammenfassen.

Datensammlung & -exploration 

Was ist zu tun?

Wie geht man vor?

Data Scientists Zugriff auf alle Datensätze geben

  • Die passenden Berechtigungen für jeden Datensatz einrichten.
  • Kommerzielle Datensätze einkaufen oder synthetische Daten mit ähnlichen Eigenschaften nutzen.

Daten ingestieren

  • Jede Datenquelle in die Analytics-Umgebung überführen.

Daten explorieren

  • Die Verteilung jeder Variable mit Histogramm oder Balkendiagramm visualisieren.
  • Fehlende Werte pro Variable quantifizieren.
  • Beziehungen zwischen Features und Zielvariable mit Scatterplot, Histogrammen, Boxplots oder Heatmap darstellen.

Datenqualitätsbericht erstellen

Für jeden Datensatz:

  • Eine Zusammenfassung des Datensatzes geben.
  • Übergeordnete Datenqualitätsprobleme beschreiben.
  • Die Qualität der Zielvariable beschreiben.
  • Die Qualität jedes Features beschreiben.
  • Die Beziehung jedes Features zur Zielvariable beschreiben.

Entscheiden, ob das Projekt fortgesetzt wird

Auf Basis des Datenqualitätsberichts entscheiden, ob du

  • das Projekt fortsetzt,
  • es pausierst, um weitere Daten zu sammeln, oder
  • es beendest.

Datenpipeline aufbauen

Im Projektverlauf müssen Daten in der Regel regelmäßig aktualisiert werden. Die Datenpipeline 

  • sollte Ingestion und Bereinigung automatisieren und
  • zeitgesteuert (Batch) oder kontinuierlich (Streaming) laufen.

Datenpipeline dokumentieren

  • Ein Diagramm der Schritte und Abhängigkeiten der Pipeline zeichnen.
  • Beschreiben, was in jedem Schritt passiert.

Modellierung & Testing

Das umfasst sowohl Machine-Learning-Projekte als auch Experimente wie A/B-Tests. Streiche Schritte, die für deinen Use Case keinen Sinn ergeben. 

Modellierung 

Was ist zu tun?

Wie geht man vor?

Hypothese aufstellen

  • Ergibt die Hypothese im Business-Kontext Sinn?
  • Lässt sich das Ergebnis messen?
  • Gibt es genug Daten für einen statistisch signifikanten Effekt?
  • Müssen statistische Verzerrungen berücksichtigt werden?

Daten in Trainings- und Testmenge aufteilen

Unbedingt vor dem Feature Engineering aufteilen, um Data Leakage zu vermeiden.

Features entwickeln

Neue Features mit unter anderem folgenden Techniken erstellen:

  • Numerische Variablen zentrieren oder skalieren.
  • Numerische Variablen per Binning in Kategorien überführen.
  • Box-Cox- oder Yeo-Johnson-Transformation anwenden, um Normalverteilung näherungsweise herzustellen.
  • Seltene oder verwandte Kategorien zusammenfassen.
  • Bestandteile von Datetimes extrahieren oder kombinieren.
  • Neue Variablen aus zusammenfassenden Statistiken bilden.
  • Quantitative Metriken aus Text und anderen unstrukturierten Daten extrahieren.

Modell fitten oder Experiment durchführen

  • Mit dem einfachsten Modell starten und die Komplexität schrittweise erhöhen.
  • Bei sehr großen Datensätzen ggf. mit einer Stichprobe modellieren.

Ergebnisse bewerten

Leistung mit Metriken wie Accuracy, Precision und Recall quantifizieren. Wenn die Performance noch nicht ausreicht:

  • Kannst du zusätzliche Daten sammeln?
  • Lassen sich weitere Features entwickeln?
  • Kommen andere Algorithmen infrage?

Über Ergebnisse berichten

  • Stakeholder regelmäßig zurückmelden.
  • Sprache für Business- vs. technische Stakeholder anpassen.
  • Nicht nur Erfolge, auch Fehlschläge transparent machen.

Testing

Was ist zu tun?

Wie geht man vor?

Testsuite aufsetzen

Automatische Tests definieren, um die Performance deines Modells/Experiments zu prüfen und Bugs zu erkennen, die beim Iterieren entstehen könnten. Dazu zählen:

  • Unit-Tests für Code.
  • Backtesting für Portfolios oder andere Zeitreihen.

Business Impact validieren

Mit vorliegenden Modellmetriken lässt sich der erwartete Business-Impact besser quantifizieren. Diskutiere ihn mit Business-Stakeholdern.

Technischen Ansatz validieren

Prüfen, ob das finale Modell technisch geeignet ist.

  • Sind die Modellannahmen erfüllt?
  • Sind die Ergebnisse sensitiv gegenüber der Stichprobe?
  • Sind die Hyperparameter passend?
  • Ist das Modell reproduzierbar?

Deployability prüfen

  • Können alle möglichen Eingabewerte und Use Cases verarbeitet werden?
  • Sind alle benötigten Datenquellen in Produktion verfügbar?
  • Fällt das Modell fehlertolerant aus, wenn Datenquellen fehlen?
  • Sind Vorhersagen schnell genug verfügbar?

Null-Ergebnisse bewahren

Alles, was nicht in Produktion geht, sollte in einem Wissens-Repository dokumentiert werden, damit künftige Projekte keine Zeit mit denselben Ansätzen verlieren.

Deployment & User Testing

Deployment

Was ist zu tun?

Wie geht man vor?

Datenpipeline entwickeln

  • Einen Directed Acyclic Graph (DAG) von allen Datenquellen bis zur Produktionsumgebung aufsetzen.
  • Automatische Datenaktualisierungen einplanen.

Modell-Pipeline entwickeln

  • Den Modellsfluss in Aufgaben gliedern und zu einer Pipeline zusammenfügen.

Modell operationalisieren

Eine API für dein Modell bereitstellen, die von Dashboards, Websites oder anderer Software genutzt werden kann.

Monitoring-Plan entwerfen

  • Zu überwachende Metriken festlegen, inkl. Performance- und Safety-Metriken, die auf mögliche Bugs hinweisen.
  • Schwellenwerte bzw. zulässige Bereiche definieren.
  • Festlegen, wie du benachrichtigt wirst, wenn Metriken außerhalb des Bereichs liegen.

Per A/B-Test ausrollen

  • Das neue Feature oder Modell einer zufälligen Stichprobe von Nutzenden bereitstellen.
  • Die gewählten Metriken eng begleiten, aber mit dem Urteil über die Gewinnergruppe warten, bis Signifikanz erreicht ist.

A/B-Testergebnisse analysieren und berichten

  • Die gewählten Metriken zwischen den Gruppen vergleichen.
  • Ergebnisse berichten – auch, wenn der Test kein Erfolg war.

An die meisten oder alle Nutzenden ausrollen

War der Test erfolgreich, Feature oder Modell an die meisten oder alle Nutzenden ausrollen.

  • Eine kleine Holdout-Gruppe ohne Feature/Modell zu belassen, erlaubt langfristig den Performance-Gewinn zu quantifizieren.

User Testing

Was ist zu tun?

Wie geht man vor?

Abschlussbericht verfassen

Projektstatus und Learnings zusammenfassen.

  • Projektüberblick geben.
  • Das bearbeitete Geschäftsproblem zusammenfassen.
  • Datenquellen und deren Verarbeitung beschreiben.
  • Genutzte Modellierungstechniken und Validierung erläutern.
  • Lösungsarchitektur zusammenfassen.
  • Vorteile für Unternehmen und Kundschaft skizzieren.
  • Learnings zu Projektdurchführung, Data Science, Business-Domain und Produkt beschreiben.
  • Nächste Schritte aufzeigen.

Kundenfeedback einholen

  • Umfragen und Nutzerinterviews durchführen.
  • Bewertungen, Ratings und Social Media beobachten.

Monitoring

Was ist zu tun?

Wie geht man vor?

Monitoring-Pipeline entwickeln

Eine Pipeline aufsetzen, die die im Monitoring-Plan definierten Performance- und Safety-Metriken automatisch verfolgt.

Dashboards erstellen

Dashboards bauen, die die Entwicklung dieser Metriken im Zeitverlauf anzeigen.

Alerts einrichten

Benachrichtigungen konfigurieren – per E-Mail, Slack etc. – wenn Metriken den zulässigen Bereich verlassen.

Themen
Datenwissenschaft