Heutzutage schaffen es viel zu viele Machine-Learning-Modelle nicht in die Produktion und bleiben im Datalab stecken. Wie in jedem jungen Feld sind Best Practices, Tools, Techniken und Rollen, die moderne Datenteams brauchen, noch nicht ausgereift und standardisiert. Das frustriert Unternehmen, die Machine Learning im großen Stil nutzen wollen, und Datenwissenschaftler, die mehr wollen als nur im Notebook zu experimentieren. MLOps (Machine Learning Operations) ist in den vergangenen Jahren entstanden, um genau diese Herausforderungen beim Deployment anzugehen.
Der Name ist Programm: So wie DevOps die agile, schnelle Anwendungsentwicklung an Geschäftsbedürfnissen ausgerichtet hat, will MLOps die Lücke zwischen Komplexität und dem produktiven Einsatz von Machine-Learning-Modellen schließen.
Wie genau geht MLOps diese Herausforderungen an? In diesem Artikel entzaubern wir zentrale Konzepte von MLOps als aufstrebende Disziplin und beantworten Schlüsselfragen wie
- Was ist MLOps und welche Bausteine braucht eine erfolgreiche MLOps-Praxis?
- Worin unterscheidet sich MLOps von DevOps?
- Wie denkt MLOps den Machine-Learning-Workflow neu?
- Wie kannst du heute mit MLOps starten?
Was ist MLOps?
Alessya Visnjic, CEO von WhyLabs, einem auf Modellüberwachung spezialisierten MLOps-Startup, beschrieb MLOps treffend als „eine Kombination aus Tools, Praktiken, Techniken, Kultur und Mindset, die den zuverlässigen und skalierbaren Einsatz von Machine-Learning-Systemen sicherstellt“.
Im Kern baut MLOps auf DevOps auf, also der modernen Praxis, Unternehmensanwendungen effizient zu entwickeln, bereitzustellen und zu betreiben. Es ist ein funktionsübergreifender, kollaborativer, iterativer Prozess, der Data Science operationalisiert. MLOps behandelt Machine Learning als Ingenieursdisziplin: Modelle gelten als wiederverwendbare Softwareartefakte, die über einen wiederholbaren Prozess ausgerollt werden.
MLOps umfasst außerdem die kontinuierliche Überwachung und das regelmäßige Retraining von Modellen in der Produktion, damit sie bei sich verändernden Daten optimal bleiben – ein Phänomen, das auch als Data Drift bekannt ist.
Kurz gesagt, MLOps hilft Datenteams, ihren Wert zu skalieren, indem es ermöglicht:
- Schnelleres Deployment von mehr Modellen durch automatisierte Prozesse
- Produktivität steigern durch Zusammenarbeit und Modellwiederverwendung
- Risiko und Kosten reduzieren für Modelle, die nie in die Produktion gelangen
- Modelle kontinuierlich überwachen und aktualisieren, wenn Data Drift auftritt
Zurück zu Visnjics Definition: Dafür braucht es sowohl neue Tools für moderne Datenteams als auch ein Umdenken bei vielen Datenwissenschaftlern.
Warum ist MLOps wichtig?
Wir haben bereits gezeigt, wie MLOps die Deploymentschwierigkeiten vieler Datenteams adressiert. Doch was macht Machine Learning so besonders, dass es eine spezialisierte Betriebsfunktion wie MLOps braucht?
Machine-Learning-Anwendungen unterscheiden sich grundlegend von klassischer Software. Beim produktiven Einsatz von ML-Systemen treten unter anderem diese Herausforderungen auf:
- Ownership und Zusammenarbeit: Traditionell entwickeln Datenwissenschaftler ML-Modelle, während IT-Teams sie deployen und betreiben. Die Zusammenarbeit ist oft weniger effizient als möglich und erzeugt Reibung. Beispielsweise werden Data-Science-Teams aus immer mehr Unternehmensbereichen angefragt, um wachsende Problemfelder zu lösen. Aufgrund der Komplexität moderner IT-Systeme beachten Datenwissenschaftler die Produktionsumgebung häufig kaum – dafür ist schließlich die IT zuständig. Umgekehrt fokussiert die IT selten die inneren Details der von Data Science entwickelten Lösungen – was zu falschen Erwartungen an die Deployability vieler Modelle führt. Dieses Muster erzeugt Friktion und Anti-Pattern, die es zu vermeiden gilt – etwa wenn Datenteams in die Denke verfallen: „Wir bauen ein Modell, schicken es an die IT, und die übernimmt dann.“
- Daten prägen ML-Software: Daten sind das Lebenselixier von ML-Systemen. Anders als bei klassischer Software, in der Ingenieure einen klar definierten Prozess von Eingaben zu Ausgaben entwerfen, basieren ML-Systeme auf statistischen Methoden, die unordentliche Realweltdaten aufnehmen und Vorhersagen ausgeben. Das bedeutet: Das Verhalten von ML-Systemen ändert sich mit den Daten. Zudem erfordert die Bewertung von Modellleistung Beobachtung und Analyse. Und der ML-Workflow ist naturgemäß experimentell, unordentlich und verlangt teils andere Kompetenzen als klassische Softwareentwicklung.
- Deployment-Komplexität: ML-Modelle und -Systeme werden immer komplexer. Im Unterschied zu klassischer Software umfasst das Deployment von ML-Modellen die Orchestrierung vieler ineinandergreifender Schritte über unterschiedliche Tools hinweg – von Datenerfassung, -speicherung, -transformation über Feature Engineering bis mehr. Reproduzierbarkeit und Versionierung sind große Herausforderungen: Aufgrund des experimentellen Charakters entstehen viele Modellvarianten auf Basis unterschiedlicher Versionen desselben Datensatzes. Klassische Versionskontrolle muss daher deutlich robuster werden.
MLOps vs. DevOps – worin liegt der Unterschied?
Im vorherigen Abschnitt haben wir erläutert, warum Machine Learning eine spezialisierte Betriebsfunktion braucht. Aber wie unterscheidet sich MLOps in der Praxis von DevOps?
DevOps ist die Verbindung von Development (Dev) und Operations (Ops). Es bündelt zwei Kernfunktionen der IT: Anwendungsentwicklung und Systembetrieb. DevOps zielt darauf ab, Entwicklungszyklen zu verkürzen und die Umsetzungsgeschwindigkeit von Softwareteams zu erhöhen – durch Automatisierung sowie angepasste Prozesse und Arbeitsweisen. Im Kern bringt DevOps zwei Prinzipien in die Softwareentwicklung ein:
- Continuous Integration (CI) – der Prozess, häufige, kleine Änderungen in Versionskontroll-Repositories zu integrieren. So werden Deployment-Probleme reduziert, da Code regelmäßig in Produktion geht.
- Continuous Delivery (CD) – die Automatisierung der Schritte, die nötig sind, um Anwendungen in Produktionsumgebungen auszuliefern.
Aufgrund der Besonderheiten von Machine Learning unterscheiden sich in der Praxis folgende Punkte:
- Continuous Integration wird erweitert: Nicht nur Code, sondern auch Modelle und Daten werden getestet und validiert.
- Continuous Delivery wird erweitert: Neben Anwendungen werden automatisch Datenpipelines ausgeliefert, die ML-Vorhersagen anstoßen.
- Continuous Training kommt hinzu – einzigartig für ML –, bei dem Modelle automatisch für das Deployment neu trainiert werden.
- Continuous Monitoring wird etabliert – es überwacht Qualitätsbrüche in Produktivdaten, die Modellleistung und geschäftliche Kennzahlen, die am ML-Modell hängen.
Der MLOps-Workflow
Den Data-Science-Workflow für MLOps neu denken
Angesichts der zusätzlichen Komplexität beim produktiven Einsatz von ML-Modellen – wie können Datenteams MLOps in ihre Workflows integrieren? Hier ist ein vereinfachter, schrittweiser Ansatz im MLOps-Prozess:
- Build: Nach der Modellerstellung werden Modelle in ein prüfbares Repository unter Versionskontrolle gestellt, um die Wiederverwendung im gesamten Unternehmen zu unterstützen.
- Evaluation: Die Qualität der Modellvorhersagen wird quantifiziert, indem die Leistung des neu trainierten Modells auf einem neuen, unabhängigen Datensatz gemessen wird.
- Productionizing: Das Modell oder die Pipeline wird exportiert, bereitgestellt und in Produktivsysteme und Anwendungen integriert.
- Testing: Kontinuierliches Testen ist bei ML-basierten Anwendungen entscheidend und umfasst das automatische Retraining und Ausliefern der Modelle.
- Deployment: Kontinuierliche Überwachung stellt optimale Performance sicher. Bei sich ändernden Daten kann das Modell neu trainiert oder durch ein neues ersetzt werden.
- Monitoring und Observability: Viele Unternehmen kämpfen damit, ML-Modelle zuverlässig in produktive Umgebungen zu überführen.
Datenrollen für MLOps neu denken
In kleinen Data-Science-Teams tragen Personen oft mehrere Hüte. In größeren, stärker prozessgetriebenen Teams finden sich hingegen verschiedene Rollen und Kompetenzen, die unterschiedliche Teile des MLOps-Workflows verantworten. Typische Rollen sind:
- Data Scientist: Häufig die zentrale Rolle in MLOps-Teams. Data Scientists nutzen Unternehmensdaten, um Wert zu schaffen. Sie verstehen, strukturieren und interpretieren Daten und leiten daraus Erkenntnisse in Form von Vorhersagemodellen ab. Sie erstellen, testen und evaluieren ML-Modelle und übernehmen in manchen Unternehmen auch das Deployment und das Performance-Monitoring in der Produktion.
- Data Engineer: Data Engineers schaffen und betreiben die Umgebung, die nahezu alle Funktionen im Datenteam ermöglicht. Sie entwickeln, bauen, warten und testen Architekturen wie Datenbanken und Verarbeitungssysteme. Kurz gesagt: Sie ermöglichen den Datenfluss von der Extraktion über die Transformation bis zur Bereitstellung.
- Software Engineer: Im MLOps-Prozess integrieren Software Engineers ML-Modelle in Anwendungen und Systeme des Unternehmens. Sie sorgen zudem dafür, dass ML-Modelle reibungslos mit nicht-ML-basierten Anwendungen zusammenspielen.
- Machine Learning Engineer: Machine-Learning-Engineers sitzen an der Schnittstelle von Data Science und Data Engineering. Sie optimieren die von Data Scientists entwickelten Modelle und bringen sie in der vom Data Engineer bereitgestellten Infrastruktur in Produktion.
So startest du mit MLOps
Wie in diesem Artikel gezeigt, ist MLOps noch ein junges Feld – viele Tools, Best Practices und Methoden entstehen erst. In diesem Abschnitt findest du Wege für den Einstieg, Tools zum Ausprobieren und Lernressourcen, mit denen du heute beginnen kannst.
Tools für MLOps
-
Kubeflow: Kubeflow ist eine Tool-Suite zum Ausführen von Machine-Learning-Workflows auf Kubernetes-Clustern. Ziel ist es, die besten Open-Source-ML-Lösungen einfach, portabel und skalierbar auf Kubernetes bereitzustellen. Ursprünglich war Kubeflow die Open-Source-Implementierung von TensorFlow Extended (TFX), einer End-to-End-Plattform für ML-Pipelines in der Produktion. Kubeflow vereinfachte somit das Ausführen von TensorFlow-Jobs auf KubernetesMLFlow: MLflow ist ein Tool zur Industrialisierung des gesamten Entwicklungsprozesses von Machine-Learning-Projekten. Es will die ML-Entwicklung in Unternehmen vereinfachen – durch erleichtertes Monitoring, Reproduktion, Management und Deployment von Modellen.
-
Data Version Control (DVC): DVC (Data Version Control) ist ein Python-Paket, das das Management von Data-Science-Projekten erleichtert. Laut Hauptbeitragendem Dmitry Petrov ist dieses Tool eine Erweiterung von Git für Machine Learning. DVC ist sowohl vergleichbar mit als auch eine Ergänzung zu Git.
-
Pachyderm: Pachyderm ist – ähnlich wie DVC – ein Versionierungstool für Machine Learning und Data Science. Es basiert auf Docker und Kubernetes und unterstützt dadurch das Ausführen und Deployen von ML-Projekten auf jeder Cloud-Plattform. Zusätzlich stellt Pachyderm sicher, dass alle in ein ML-Modell eingespeisten Daten versioniert und nachvollziehbar sind.
Learning-Ressourcen für MLOps
Machine-Learning-Grundlagen
- Machine Learning For Absolute Beginners: A Plain English Introduction (Second Edition) von Oliver Theobald. Wie der Titel sagt, bietet dieses Buch Einsteigerinnen und Einsteigern einen vollständigen Einstieg in Machine Learning – ganz ohne Vorkenntnisse in Mathematik oder Programmierung. Die Sprache bleibt bewusst einfach, um nicht in unverständlichem Jargon zu versinken. Die verschiedenen Algorithmen werden mit klaren, leicht nachvollziehbaren Erklärungen und visuellen Beispielen begleitet. Zudem führt das Buch einfache Programmierkonzepte ein, um ML besser zu kontextualisieren.
- Machine Learning For Dummies von John Paul Mueller und Luca Massaron. Für Neulinge ist die „For Dummies“-Reihe ein guter Startpunkt. Dieses Buch führt in grundlegende Konzepte und Theorien des Machine Learning ein und zeigt, wie man sie in der Praxis anwendet. Es stellt die wichtigsten Programmiersprachen und Tools vor und erklärt, wie aus einem eher esoterischen Konzept ein praktisches Werkzeug wird. Behandelt werden die Sprachen Python und R, mit denen Maschinen Muster erkennen und Ergebnisse analysieren.
- Fundamentals of Machine Learning for Predictive Data Analytics: Algorithms, Worked Examples, and Case Studies von John D. Kelleher, Brian Mac Namee und Aoife D'Arcy. Dieses Buch deckt die grundlegenden ML-Konzepte ab – sowohl theoretisch als auch praktisch. Konkrete Beispiele und Fallstudien erleichtern den Wissenstransfer. Grundkenntnisse in Analytics sind hilfreich. Die verschiedenen ML-Ansätze werden mit Algorithmen, Modellen und praktischen Beispielen erklärt.
- Machine Learning for Hackers von Drew Conway und John Myles White. „Hacker“ meint hier Programmierer, die Code für konkrete Zwecke und Projekte schreiben. Das Buch richtet sich an Leser, die zwar programmieren, aber keine starke Mathematikbasis haben. Statt mathematischer Theorie stehen reale Anwendungen und praxisnahe Studien im Vordergrund. Klassische ML-Probleme werden gezeigt und mit der Programmiersprache R gelöst – von Senatorenvergleichen über Empfehlungssysteme bis Spam-Erkennung.
- DataCamps Machine Learning Scientist mit Python oder R Lernpfad. Egal ob R oder Python: Beide Lernpfade decken Machine Learning von den Basics bis zu fortgeschrittenen Themen wie Deep Learning und Feature Engineering ab.
Data-Engineering-Grundlagen
- Andreas Kretz' Data Engineering Cookbook. Es herrscht viel Unsicherheit darüber, wie man Data Engineer wird. Dieses E-Book von Andreas Kretz enthält ausführliche Fallstudien, Code, Podcasts, Interviews und mehr. Ein Komplettpaket für alle, die Data Engineer werden wollen. Und das Beste: Das E-Book ist kostenlos – du kannst direkt loslegen.
- DW 2.0 - The Architecture for the Next Generation of Data Warehousing von WH Inmon, dem „Vater des Data Warehousing“. Dieses Buch beschreibt die Zukunft des Data Warehousing, die heute bereits technisch möglich ist – architektonisch wie technologisch. Es ist strukturiert aufgebaut und deckt die meisten Themen rund um Datenarchitektur und ihre Herausforderungen ab, inklusive pragmatischer Best Practices zur Rechtfertigung von Investitionen.
- Agile Data Warehouse Design: Collaborative Dimensional Modeling, from Blackboard to Star Schema von Laurent Corr. Ein hervorragendes Buch. Lawrence Corr bietet eine Schritt-für-Schritt-Anleitung, um BI- und Data-Warehouse-Anforderungen zu erfassen und sie mithilfe von „Model Storming“ in performante Modelle zu überführen. Zudem stellt er BEAM vor, einen agilen Ansatz für dimensionales Modellieren zur besseren Kommunikation zwischen DWH-Designern und BI-Stakeholdern.
- DataCamps Data Engineering with Python Karrierepfad. Dieser Lernpfad umfasst Dutzende Kurse zu effektiven Datenarchitekturen, Datenaufnahme, Pipeline-Bau und mehr.
Deep Dive in MLOps
- MLOps Fundamentals Skill Track. Dieser Skill Track deckt den kompletten Lebenszyklus einer ML-Anwendung ab – von Business-Anforderungen über Design, Entwicklung, Deployment bis Betrieb und Wartung.
- MLOps: Operationalizing Data Science von David Sweenor, Dev Kannabiran, Thomas Hill, Steven Hillion, Dan Rope und Michael O'Connell. Sechs Analytics-Expertinnen und -Experten stellen einen Vier-Schritte-Ansatz vor, um ML-Anwendungen bis in die Produktion zu bringen.
- Building Machine Learning Powered Applications von Emmanuel Ameisen. Emmanuel Ameisen zeigt, wie du eine ML-getriebene Anwendung von der ersten Idee bis zum ausgerollten Produkt baust.
- Building Machine Learning Pipelines von Hannes Hapke, Catherine Nelson. Die Autorinnen und Autoren demonstrieren die Automatisierung einer ML-Pipeline mit dem TensorFlow-Ökosystem.
- Practical MLOps von Noah Gift, Alfredo Deza. Dieses Buch macht die Unterschiede zwischen DevOps und MLOps greifbar und zeigt, wie du ML-Modelle operationalisierst. Es stellt Tools und Methoden vor, um MLOps-Projekte in AWS, Microsoft Azure und Google Cloud umzusetzen. Tipp: Schau dir auch Noahs Live-Training „Practical MLOps“ auf DataCamp an.
- Introducing MLOps von Mark Treveil & Dataiku Team. Die Autorinnen und Autoren vermitteln die Schlüsselkonzepte von MLOps, damit Data-Science-Teams ML-Modelle operationalisieren, geschäftlichen Wandel vorantreiben und Modelle über die Zeit verbessern können.
- Google Cloud bietet Artikel, Blogs und Papers mit Best Practices und Prozessen für den Aufbau effizienter ML-Modelle. Im ausgewählten Artikel lernst du MLOps-Prozesse kennen und wie du von manuellen zu automatisierten Abläufen wechselst.
- Nvidias Blog bietet Beiträge zum MLOps-Lebenszyklus und zeigt Erfolgsbeispiele aus der Praxis.
- Ml-ops.org wurde von Dr. Larysa Visengeriyeva, Anja Kammer, Isabel Bär, Alexander Kniesz und Michael Plöd ins Leben gerufen. Die Website bündelt wichtige Informationen zu MLOps und stellt jeden Schritt des End-to-End-Prozesses vor.
Wir hoffen, dieses Set an Ressourcen hilft dir beim Start deiner MLOps-Lernreise. Weitere Artikel und Ressourcen zu MLOps findest du hier:


