Gutes Projektmanagement steigert Effizienz und Produktivität und senkt gleichzeitig das Risiko zu scheitern. Leider sind Data-Science-Projekte besonders anspruchsvoll, weil sie Stakeholder aus vielen Teams einbinden und sowohl geschäftliche als auch technische Ziele unter einen Hut bringen müssen.
Projektmanagement-Frameworks geben dir Leitplanken, um zu planen, Ressourcen zuzuweisen und Aufgaben so umzusetzen, dass du deine Ziele termingerecht und im Budget erreichst.
Diese Infografik verdichtet die wichtigsten Punkte aus zwei führenden Projektmanagement-Frameworks – Microsofts Team Data Science Process und dem Domino Data Science Life Cycle von Domino Data Lab – zu einer handlichen Checkliste für deine eigenen Projekte.
Habe diese Infografik immer griffbereit
Lade diese Infografik herunter und halte sie für dein nächstes Data Science-Projekt bereit
So nutzt du diesen Spickzettel
Dieser Spickzettel fasst Best Practices für das Projektmanagement von Data-Science-Projekten zusammen, gesammelt aus Microsofts Team Data Science Process und dem Domino Data Science Life Cycle von Domino Data Lab. Er verbindet CRISP-DM-Prinzipien mit denen der agilen Softwareentwicklung (Agile und Scrum). Nutze diese Checkliste für die Planung deines nächsten Data-Science-Projekts!
Prinzipien für wirksames Data-Science-Projektmanagement
Erfahrungsgemäß haben erfolgreiche Data-Science-Projekte oft folgende Merkmale gemeinsam:
- Messbar: Lassen sich Projekterfolg und Business-Impact quantifizieren?
- Zuverlässig: Welcher Anteil der Projekte hat die Ziele erreicht?
- Skalierbar: Lässt sich der Durchsatz steigern, ohne die Zuverlässigkeit spürbar zu verschlechtern?
Darüber hinaus sollten Datenteams bei der Steuerung von Data-Science-Projekten folgende Prinzipien beachten:
- Iterieren: Projekte verlaufen selten geradlinig. Im Verlauf lernst du Dinge, die Anpassungen erfordern. Im Sinne von Scrum und Agile ist es ausdrücklich erwünscht, bei Bedarf frühere Schritte erneut aufzugreifen.
- Wiederverwenden statt neu bauen: Jedes Projekt von Grund auf zu entwickeln, kostet Zeit und ist ineffizient. Die Wiederverwendung von Komponenten – ob Code, Modell-Features oder Dokumentvorlagen – bewahrt dich davor, das Rad neu zu erfinden.
- Reproduzierbarkeit sicherstellen: Die Erklärung und Begründung deiner Arbeit ist oft aufwändiger als die Arbeit selbst. Methode und Ergebnisse können von Aufsichtsbehörden oder Kundinnen und Kunden geprüft werden. Auch du könntest später darauf zurückkommen. Reproduzierbare Arbeitsweisen sparen hier Zeit und reduzieren das Risiko unentdeckter Fehler.
Checkliste für Data-Science-Projekte
Sowohl Microsoft als auch Domino Data Lab schlagen ähnliche Phasen für Data-Science-Projekte vor. Im Folgenden fassen wir diese Phasen zu einem einheitlichen Rahmen zusammen:
Kontext klären & Ideen entwickeln
| Was ist zu tun? |
Wie geht man vor? |
|
Geschäftsproblem definieren |
Formuliere so eindeutig wie möglich, warum das Projekt durchgeführt wird. |
|
Stakeholder identifizieren |
Rollen können sein: Projektmanager, Data Scientist, Account Manager, Datenadministrator. |
|
Vorarbeiten prüfen |
Sichte bestehende Projekte mit ähnlicher Fragestellung.
|
|
Messgrößen (KPIs/Metriken) für den Erfolg festlegen |
Metriken sollten die SMART-Kriterien erfüllen.
Nicht SMART: "Website-Conversions steigern" SMART: "Design und User Experience der Website optimieren, um die Conversion-Rate bis Ende Q2 um 10% zu erhöhen" |
|
Projektumfang festlegen |
|
|
Projektplan erstellen |
|
|
Projekteinfluss abschätzen |
|
|
Projektaufwand abschätzen |
|
|
Projektrisiken einschätzen |
|
|
Entscheiden, ob das Projekt fortgesetzt wird |
Auf Basis von erwartetem Nutzen im Verhältnis zu Aufwand und Risiken entscheiden, ob du
|
|
Verantwortlichkeiten je Stakeholder festlegen |
Nutze das RACI-Modell. Für jede Aufgabe festlegen, wer
|
|
Kommunikationsstrategie festlegen |
|
|
Datenquellen identifizieren |
|
|
Regulatorische Anforderungen antizipieren |
|
|
Technologie-Stack festlegen |
|
|
Project Charter erstellen |
|
Datensammlung & -exploration
| Was ist zu tun? |
Wie geht man vor? |
|
Data Scientists Zugriff auf alle Datensätze geben |
|
|
Daten ingestieren |
|
|
Daten explorieren |
|
|
Datenqualitätsbericht erstellen |
Für jeden Datensatz:
|
|
Entscheiden, ob das Projekt fortgesetzt wird |
Auf Basis des Datenqualitätsberichts entscheiden, ob du
|
|
Datenpipeline aufbauen |
Im Projektverlauf müssen Daten in der Regel regelmäßig aktualisiert werden. Die Datenpipeline
|
|
Datenpipeline dokumentieren |
|
Modellierung & Testing
Das umfasst sowohl Machine-Learning-Projekte als auch Experimente wie A/B-Tests. Streiche Schritte, die für deinen Use Case keinen Sinn ergeben.
Modellierung
| Was ist zu tun? |
Wie geht man vor? |
|
Hypothese aufstellen |
|
|
Daten in Trainings- und Testmenge aufteilen |
Unbedingt vor dem Feature Engineering aufteilen, um Data Leakage zu vermeiden. |
|
Features entwickeln |
Neue Features mit unter anderem folgenden Techniken erstellen:
|
|
Modell fitten oder Experiment durchführen |
|
|
Ergebnisse bewerten |
Leistung mit Metriken wie Accuracy, Precision und Recall quantifizieren. Wenn die Performance noch nicht ausreicht:
|
|
Über Ergebnisse berichten |
|
Testing
| Was ist zu tun? |
Wie geht man vor? |
|
Testsuite aufsetzen |
Automatische Tests definieren, um die Performance deines Modells/Experiments zu prüfen und Bugs zu erkennen, die beim Iterieren entstehen könnten. Dazu zählen:
|
|
Business Impact validieren |
Mit vorliegenden Modellmetriken lässt sich der erwartete Business-Impact besser quantifizieren. Diskutiere ihn mit Business-Stakeholdern. |
|
Technischen Ansatz validieren |
Prüfen, ob das finale Modell technisch geeignet ist.
|
|
Deployability prüfen |
|
|
Null-Ergebnisse bewahren |
Alles, was nicht in Produktion geht, sollte in einem Wissens-Repository dokumentiert werden, damit künftige Projekte keine Zeit mit denselben Ansätzen verlieren. |
Deployment & User Testing
Deployment
| Was ist zu tun? |
Wie geht man vor? |
|
Datenpipeline entwickeln |
|
|
Modell-Pipeline entwickeln |
|
|
Modell operationalisieren |
Eine API für dein Modell bereitstellen, die von Dashboards, Websites oder anderer Software genutzt werden kann. |
|
Monitoring-Plan entwerfen |
|
|
Per A/B-Test ausrollen |
|
|
A/B-Testergebnisse analysieren und berichten |
|
|
An die meisten oder alle Nutzenden ausrollen |
War der Test erfolgreich, Feature oder Modell an die meisten oder alle Nutzenden ausrollen.
|
User Testing
| Was ist zu tun? |
Wie geht man vor? |
|
Abschlussbericht verfassen |
Projektstatus und Learnings zusammenfassen.
|
|
Kundenfeedback einholen |
|
Monitoring
| Was ist zu tun? |
Wie geht man vor? |
|
Monitoring-Pipeline entwickeln |
Eine Pipeline aufsetzen, die die im Monitoring-Plan definierten Performance- und Safety-Metriken automatisch verfolgt. |
|
Dashboards erstellen |
Dashboards bauen, die die Entwicklung dieser Metriken im Zeitverlauf anzeigen. |
|
Alerts einrichten |
Benachrichtigungen konfigurieren – per E-Mail, Slack etc. – wenn Metriken den zulässigen Bereich verlassen. |
