Weiter zum Inhalt

So bringst du Data-Science-Projekte schnell in die Umsetzung

Die Entwicklung und Bereitstellung robuster Data-Science-Projekte erfordert ein Projektmanagement, das auf Data Science zugeschnitten ist. In einem aktuellen Webinar teilte Brian Campbell seine Best Practices für effektives Projektmanagement. Hier erfährst du, worauf es ankommt.
Aktualisiert 18. Sept. 2026  · 4 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Ein Data-Science-Projekt hat viele Bausteine, die für einen erfolgreichen Rollout reibungslos zusammenspielen müssen. Bei so vielen Abhängigkeiten ist ein agiles Vorgehen für Entwicklung und Bereitstellung entscheidend. Diese Arbeitsweise ermöglicht es Organisationen, schnell zu lernen und rasch zu iterieren. In einem aktuellen DataCamp-Webinar spricht Brian Campbell, Engineering Manager, Internal Engineering bei Lucid Software, über Best Practices für die erfolgreiche Bereitstellung von Data-Science-Projekten.

Frühe Schritte für agiles Arbeiten

Brian erklärt, dass zwei Maßnahmen zu Beginn eines Projekts parallelen Fortschritt bei Entwicklung und Deployment eines Modells ermöglichen: mit Baseline-Modellen arbeiten und einen Prototyp erstellen. Auch wenn diese Ansätze den Zeitplan komplexer machen, führen sie zu deutlich schnelleren und besseren Ergebnissen.

Mit Baseline-Modellen arbeiten

Ein wichtiger Schritt, um Machine-Learning-Projekte erfolgreich auszuliefern, ist das Erstellen eines Baseline-Modells. Ein Baseline-Modell liefert die gleichen Ausgaben wie das finale Modell. Es entsteht jedoch vor dem Großteil der Entwicklung und kann auf Heuristiken oder Zufallsdaten beruhen. Diese Ausgangsbasis setzt die Messlatte, die künftige Iterationen übertreffen müssen.

Wenn das Team neue Modelle entwickelt, lassen sich deren Ergebnisse mit der Baseline vergleichen und daraus lernen. Die Lücke zwischen Baseline und Zielzustand schärft die Anforderungen und hilft, die wertvollsten Daten und Lösungsansätze für das Problem zu identifizieren.

Mit Prototypen arbeiten

Prototypen sind Modelle, die die gleichen Eingaben verarbeiten und Ausgaben im gleichen Format liefern wie das finale Modell. Das kann auf dem Baseline-Modell aufbauen. Sobald der Prototyp steht, kann das Deployment-Team mit der Integration in den Zielkontext beginnen. Der Prototyp ermöglicht parallelen Fortschritt: Data Scientists verbessern das Modell, während das Implementierungsteam daran arbeitet, wie das Modell kundenseitig oder in einem Geschäftsprozess ausgeliefert wird.

Prototypen funktionieren nur, wenn sich das finale Modell genauso verhält wie der Prototyp. Deshalb ist es notwendig, die verfügbaren Daten und das gewünschte Ausgabeformat vor der Prototyperstellung zu verstehen. Das erfordert Wissen über das Projekt über die reine Problemformulierung hinaus und eine enge Zusammenarbeit mit Fachexpertinnen und -experten.

Praxisbeispiel für Baselines und Prototypen

Brian beschreibt, wie sein Team bei Lucid Baselines und Prototypen genutzt hat, um die Entwicklung eines Clustering-Modells für ein Sticky-Note-Produkt zu beschleunigen, das von Produkt-, Design- und Engineering-Teams verwendet wird. Diese Teams führen häufig Design-Thinking-Sessions durch, in denen Moderatorinnen und Moderatoren Haftnotizen ähnlicher Art manuell Kategorien zuordnen. Das Ziel des Systems war es, die Zeit zwischen Brainstorming und Diskussion zu verkürzen, indem Ideen automatisch in Kategorien geclustert und Duplikate entfernt werden.

Das Baseline-Modell nahm zufällige Ideen auf und generierte zufällige Kategorien. Anschließend erstellten sie einen Prototyp dieses Modells, damit die Implementierungsexperten früh im Entwicklungsprozess loslegen konnten. Im Laufe der Zeit verbesserten sie die Baseline, indem sie Natural Language Processing und Machine Learning nutzten, um ähnliche Haftnotizen zusammenzunehmen.

Kommunikation ist bei diesen Modellen entscheidend

Die erste Iteration des Projekts stieß auf Probleme, weil es an kontinuierlicher Zusammenarbeit zwischen Deployment-Team und den Data Scientists am Modell fehlte. Dieser Mangel an Teamarbeit führte zu Leistungsproblemen des Modells, ungenauen Tests und einer schlechten Produkterfahrung. Die Vorteile der parallelen Entwicklung konnten nicht gehoben werden.

Als sie das Projekt neu aufsetzten und effektiv zusammenarbeiteten, lösten sie diese Probleme und schafften realistische Erwartungen. Möglich wurde die Zusammenarbeit durch einen Prototyp, an dem das Deployment-Team parallel zum Data-Science-Team arbeiten konnte.

Wenn du die Learnings aus dem Projekt verstehen und komplexe Data-Science-Vorhaben souverän steuern willst, sieh dir das On-Demand-Webinar an.

Themen
Datenwissenschaft