

In einem früheren Blogpost haben wir die Bedeutung von Machine Learning (ML) beleuchtet und die fünf wichtigsten Punkte behandelt, die Führungskräfte zu ML wissen sollten. Erinnern wir uns: Überwachtes Lernen dreht sich um Vorhersagen und Klassifikationen. Jetzt gehen wir einen Schritt weiter in die Tiefe.
1. MODELL-INTERPRETIERBARKEIT
Wir haben gesehen, dass Accuracy (der Anteil deiner Daten, die dein Modell korrekt vorhersagt/klassifiziert) nicht immer die beste Kennzahl für den Erfolg eines Modells ist, zum Beispiel bei unausgeglichenen Klassen (wenn etwa 99% der E-Mails Spam und 1% kein Spam sind). Ein weiterer Bereich, in dem Metriken wie Accuracy nicht ausreichen, ist die Interpretierbarkeit deines Modells. Interpretierbarkeit bedeutet im Kern, erklären zu können, warum dein Modell bestimmte Vorhersagen trifft. Das ist in regulierten Märkten wie dem Finanzsektor oft vorgeschrieben. Ebenso ist sie für Algorithmen entscheidend, die das Leben und die Freiheit von Betroffenen beeinflussen, etwa Northpointes COMPAS-Rückfallrisikomodell, dessen Output Richter bei Bewährungsentscheidungen nutzen. Zwischen Genauigkeit und Interpretierbarkeit besteht ein inhärenter Trade-off: Die genauesten Modelle sind oft Black Boxes und nicht interpretierbar. Selbst wenn deine Branche derzeit noch wenig Wert auf Interpretierbarkeit legt, gehört sie in die Diskussion, und Regulierung wird sie in den kommenden Jahren in viele weitere Bereiche bringen.
2. ML-MODELLE IM ECHTBETRIEB ÜBERWACHEN UND PFLEGEN
Wichtig ist auch: Die Arbeit mit Machine Learning endet nicht, sobald dein Modell Vorhersagen trifft oder klassifiziert. Modelle im Einsatz müssen überwacht und gewartet werden. Wenn du etwa Kreditkartenbetrug anhand von Transaktionsdaten vorhersagst, gewinnst du bei jeder Vorhersage, auf die du reagierst, wertvolle Informationen. Außerdem ist die Aktivität, die du überwachst und vorhersagen willst — Kreditkartenbetrug — dynamisch und verändert sich. Dieser Prozess heißt Data Drift und zeigt, wie wichtig es ist, dein Modell zu aktualisieren, da sich die Datenerzeugung laufend wandelt.
3. DEEP LEARNING
Spätestens jetzt fragst du dich vielleicht, wann wir über Deep Learning sprechen — eines der Buzzwords in Data Science und KI. Deep Learning ist eine Form von ML, die sogenannte neuronale Netze einsetzt, lose inspiriert von biologischen neuronalen Netzen im menschlichen Gehirn. Wichtig: Hier endet der Vergleich. Deep Learning ist nicht gleich menschliche Intelligenz.
Die meisten Deep-Learning-Anwendungen liegen im überwachten Lernen, etwa bei Bildklassifikation (Gesichtserkennung, autonomes Fahren, Drohnenbilder zur Ernteschätzung in AgTech) und Natural Language Processing (Google-Übersetzung, Dokumentklassifikation, Sentimentanalyse). Weitere Einsatzfelder sind Zeitreihenprognosen, z. B. in der Finanzwelt. Wichtig ist: Deep-Learning-Systeme sind selten in mehr als einer Aufgabe gut. Ein Algorithmus für Gesichtserkennung taugt nicht zur Klassifikation juristischer Dokumente. Du kannst Deep Learning zwar als eine Form von KI bezeichnen, allerdings im Sinne enger künstlicher Intelligenz, nicht künstlicher allgemeiner Intelligenz — also nicht im Sinne einer über alle Bereiche hinweg dem Menschen ebenbürtigen Intelligenz.
4. TRANSFER LEARNING
In einer Welt, in der konkurrenzfähige ML-Modelle oft auf modernste, domänenspezifische Daten angewiesen sind, ist die Sorge verständlich, selbst nicht genug Daten zu haben oder sie nicht beschaffen zu können. Entwarnung: Ein großer Teil der ML-Zukunft wird auf vortrainierten Modellen basieren — also Modellen, die bereits auf anderen Daten trainiert wurden. Willkommen im Bereich Transfer Learning. Du könntest zum Beispiel ein vortrainiertes Bildklassifikationsmodell kaufen, das Autos erkennt und klassifiziert. Das Spannende am Transfer Learning: Du kannst vortrainierte Modelle für deine konkrete Fragestellung und Domäne nachtrainieren. Wenn du also Lkw klassifizieren willst, nimmst du ein Modell, das Autos klassifiziert, und trainierst es mit Lkw-Bilddaten weiter.
Derzeit entstehen Marktplätze für Algorithmen, etwa Booz Allens Modzy, auf denen man vortrainierte Modelle kaufen und verkaufen kann. Dabei gibt es berechtigte Fragen, zum Beispiel zu Daten- und Algorithmus-Bias sowie Model Governance, wenn Algorithmen gehandelt werden, ohne Zugang zu den Trainingsdatensätzen. [1] Der Markt ist reif für Wachstum, aber ebenso anfällig für Missbrauch und Regulierung.
5. MACHINE LEARNING UND ENTSCHEIDUNGEN
Der letzte Punkt, den ich nicht genug betonen kann: ML — und alle Datenarbeit — muss direkt in die Entscheidungsfindung eingebettet sein. ML existiert nicht im luftleeren Raum, sondern dient Entscheidungen. Das kann automatisiert geschehen (wie bei der Google-Suche), in wissenschaftliche Prozesse eingebettet sein (wenn ein Algorithmus ein MRT für Spezialistinnen und Spezialisten markiert) oder in organisatorische Abläufe integriert werden (etwa bei Entscheidungen zum Umgang mit Kundinnen und Kunden, die voraussichtlich abwandern).
Stelle sicher, dass Datenarbeit stets deine realen Unternehmensfragen widerspiegelt und du Fehler vom Typ III vermeidest, bei denen du zwar die richtige Antwort, aber auf die falsche Frage erhältst. Deshalb gewinnt Data Translation an Bedeutung und es ist so wichtig, in deinen Organisationen eine Datenkultur zu etablieren. Dazu muss die Belegschaft verstehen, was Data Science und ML leisten — und was nicht. Ebenso wichtig ist, gute Fragen an Datenprofis zu stellen und produktive Kommunikationswege zwischen der Datenfunktion und dem restlichen Unternehmen aufzubauen.
Zusammengefasst sind die fünf Dinge, die du über Machine Learning wissen musst (zusätzlich zu den [fünf zuvor genannten]):
- Zwischen Genauigkeit und Interpretierbarkeit besteht ein Trade-off, doch Interpretierbarkeit (die Fähigkeit, erklären zu können, warum ein Modell bestimmte Vorhersagen trifft) wird immer wichtiger, insbesondere für Modelle in regulierten Märkten wie dem Finanzsektor.
- Bereits ausgerollte ML-Modelle müssen überwacht und gewartet werden, um Data Drift zu vermeiden.
- Deep Learning ist bei spezifischen Aufgaben des überwachten Lernens wie Bildklassifikation und Natural Language Processing sehr leistungsfähig.
- Wenn du dir Sorgen machst, genug passende Daten für ein konkretes Geschäftsproblem zu sammeln, ermöglicht das wachsende Feld des Transfer Learning, vortrainierte Modelle für deine Frage und Domäne weiterzutrainieren.
- ML — und alle Datenarbeit — muss der Entscheidungsfindung dienen, reale Unternehmensfragen widerspiegeln und produktive Kommunikationswege zwischen der Datenfunktion und dem restlichen Unternehmen etablieren.
[1]: Seit Veröffentlichung dieses Artikels hat Modzy uns kontaktiert und gibt an, "für alle Modelle im Marktplatz Details zum Modellaufbau zu verlangen, darunter Modellarchitektur, Trainings- und Validierungsdatensätze sowie Performancemetriken, um Transparenz über den Modellaufbau sicherzustellen". Modzy verweist für weitere Informationen hier hin.


