Setze auf stabile Datenfundamente und das richtige Tooling
Gute, verlässliche Daten zu haben, ist schon für sich genommen eine große Herausforderung. Unternehmen, die Machine Learning, Künstliche Intelligenz und Data Science nutzen wollen, sollten Monica Rogatis AI Hierarchy of Needs berücksichtigen – darin steht Machine Learning weit oben als eines der letzten Puzzleteile.

Quelle: Hackernoon
Diese Hierarchie macht deutlich: Bevor Machine Learning überhaupt möglich ist, brauchst du solide Datenfundamente und Tools zum Extrahieren, Laden und Transformieren von Daten (ETL) sowie Werkzeuge zum Bereinigen und Zusammenführen von Daten aus unterschiedlichen Quellen.
Dafür sind starke Data-Engineering-Praktiken nötig – du musst Datenbanken nutzen, verstehen, wie Daten korrekt verarbeitet werden, Workflows planen und Cloud Computing einsetzen.
Bevor du also deine erste Machine-Learning-Engineer einstellst, solltest du deine Funktionen für Data Engineering, Data Science und Datenanalyse aufbauen.
Achte auf Bias in deinen Daten und Algorithmen
Machine Learning ist nur so gut wie die Daten, mit denen du es fütterst. Sind deine Daten verzerrt, ist es dein Modell auch. Ein Beispiel: Amazon entwickelte ein ML-Recruiting-Tool, das die Eignung von Bewerbenden anhand von Lebensläufen vorhersagen sollte – trainiert mit zehn Jahren Daten, die Männer aufgrund der historischen Dominanz von Männern in der Tech-Branche bevorzugten. Dadurch wurde auch das ML-Tool gegenüber Frauen voreingenommen.
Deshalb ist Datenethik in den letzten Jahren zu einem so wichtigen Thema geworden. Mit der Menge an generierten Daten steigt auch der Einfluss ihrer Nutzung rasant. Das erfordert klare Prinzipien und kontinuierliches Monitoring. Wie Cassie Kozyrkov, Chief Decision Scientist bei Google, veranschaulicht: Eine Lehrkraft ist nur so gut wie die Bücher, aus denen sie unterrichtet. Sind die Bücher voreingenommen, sind es die Lektionen auch.
Behalte dein Modell im Blick und verbessere es kontinuierlich
Die Arbeit mit Machine Learning endet nicht, sobald dein Modell in Produktion ist, Vorhersagen trifft oder Klassifikationen durchführt. Auch produktive Modelle müssen überwacht und gepflegt werden.
Wenn du zum Beispiel Kreditkartenbetrug anhand von Transaktionsdaten vorhersagst, erhältst du jedes Mal wertvolle Informationen, wenn dein Modell eine Prognose liefert und du entsprechend handelst. Zudem ist die Aktivität, die du beobachtest und vorhersagen willst – in diesem Fall Kreditkartenbetrug – dynamisch und verändert sich über die Zeit. Dieser Prozess, bei dem sich die generierten Daten fortlaufend verschieben, heißt Data Drift – und er zeigt, wie wichtig es ist, dein Modell regelmäßig zu aktualisieren.

Quelle: DataBricks
