Viele Unternehmen integrieren heute Data-Science-Praktiken im Zuge ihrer digitalen Transformation. Ohne eine klare Datenstrategie und einen belastbaren Plan zur Skalierung von Data Science im Unternehmen werden sie jedoch kaum vom Datenschatz profitieren. McKinsey hat herausgefunden, dass nur acht von 1.000 Unternehmen mit Digitalisierungsinitiativen Data Science über ein paar Pilotprojekte hinaus skalieren konnten.
Obwohl die meisten Unternehmen den Wert datengetriebener Entscheidungen verstehen, behandeln viele Data Science dennoch als isolierte, zentralisierte Supportfunktion, die Anfragen aus verschiedenen Teams abarbeitet. Das widerspricht dem eigentlichen Zweck von Data Science: Sie ist ein Mittel zum Zweck, um Geschäftsziele zu erreichen. Wie Anacondas CEO Peter Wang es ausdrückt, ist Data Science „eine Art der Erkundung und Untersuchung“, um sich im Geschäftsumfeld zu orientieren.
So wie Physiker Mathematik nutzen, um die natürliche Welt zu verstehen, setzen Data Scientists mathematische und rechnerische Werkzeuge ein, um die Geschäftswelt zu verstehen. —Peter Wang, Anaconda CEO
Diese Silobildung wird durch die falsche Annahme verstärkt, dass das Endziel von Data Science immer KI-Modelle sein müssten, die große Produktionsbereiche automatisieren oder verschlanken. Unternehmen, die auf schnelle Rendite hoffen, sind dann enttäuscht, wenn das häufig nicht eintritt.
Diese enge Sicht auf Data Science reduziert ihren Wert auf schwer zu erreichende Predictive Analytics (also die Fähigkeit, mit Daten die Zukunft vorherzusagen) und blendet die notwendige Infrastruktur aus, die für Machine Learning im großen Maßstab nötig ist. Ein großer Teil des Nutzens entsteht jedoch durch vergleichsweise einfache Descriptive Analytics (Daten beschreiben und in die richtigen Hände bringen) und Prescriptive Analytics (datenbasierte Entscheidungen treffen).

Eine erfolgreiche digitale Transformation erfordert, unternehmensweit Kompetenzen in Data Science und Analytics aufzubauen. Dafür braucht es eine smarte, inklusive und skalierbare Datenstrategie – und konsequente Umsetzung.
Hier setzt unser IPTOP-Framework an. IPTOP definiert fünf Säulen (I nfrastructure, P eople, T ools, O rganization und P rocesses), um deine Datenstrategie skalierbar umzusetzen und die digitale Transformation zum Erfolg zu führen. Nimm an unserer kommenden Webinarreihe teil, um mehr zu erfahren.
Infrastructure
Ziel jeder Datenstrategie ist es, Rohdaten in Erkenntnisse und Entscheidungen zu verwandeln. Dafür müssen Unternehmen ihre Daten sicher und effizient erfassen, aufzeichnen und speichern – und zwar so, dass sie für alle zugänglich sind. Daten fallen jedoch in unterschiedlichsten Formaten und Qualitäten an. Die verschiedenen Datenbanken, Data Lakes, Data Warehouses, Skripte und Dashboards, die diesen Weg unterstützen, bilden die Datensowie Analyseinfrastruktur. Eine robuste Dateninfrastruktur aufzubauen, erfordert das Verständnis bewährter Praktiken.
People
Wenn Data Science als Mittel zum Zweck besserer Entscheidungen verstanden wird, können Teams anhand der tatsächlich benötigten Kompetenzen aufgebaut werden. Ein rollenbasierter Ansatz bedeutet, Leistungsziele zu identifizieren, zu bewerten und mit den Kompetenzen zu verknüpfen, die zur Erreichung der Geschäftsziele nötig sind – etwa Churn vorhersagen oder Daten in Dashboards visualisieren. Das führt zu dedizierten Lernpfaden für jede Rolle.
Ein gutes Beispiel ist die Data University von Airbnb – ein internes Trainingsprogramm, das alle Mitarbeitenden mit den Fähigkeiten ausstattet, datenbasierte Entscheidungen zu treffen. Mitarbeitende, die nicht als Data Scientists ausgebildet sind, zu Citizen Data Scientists zu entwickeln, die fundierte Entscheidungen treffen, entlastet das Data-Science-Team und schafft Raum für strategischere Projekte.
Tools
Während die Infrastruktur es ermöglicht, Erkenntnisse aus Daten zu gewinnen, fördern Tools die Einführung einer gemeinsamen Datensprache im gesamten Unternehmen. Werkzeuge für Datenzugriff, Analyse, Visualisierung und Dashboards steigern die Effizienz und verkürzen die Zeit bis zur Erkenntnis. Diese Tools reichen von Open-Source-Programmiersprachen wie Python, R und SQL bis zu Point-and-Click-Lösungen wie Power BI, Tableau und Excel.
Unternehmensspezifische Frameworks, die den Datenzugriff auf Basis dieser Tools vereinfachen, senken die Einstiegshürden für skalierte Data Science erheblich. Bei DataCamp nutzen wir eigene Python- und R-Packages, die den Zugriff auf Data Lakes, das Abfragen und Aggregieren mit einfachen Befehlen abstrahieren. So lassen sich Fragen wie „Welche Bewertung hatte Kurs X in den letzten Y Wochen?“ mit ein oder zwei Codezeilen beantworten. Ähnlich hat Airbnb ein R-Package, das Abfragen und Visualisierungen nach den gewünschten Gestaltungsrichtlinien erleichtert – und so konsistente Analysen und Visualisierungen im gesamten Unternehmen sicherstellt.

Organization
Eine wichtige Dimension jeder Datenstrategie ist, wie Data- und Analytics-Profis organisatorisch aufgestellt sind. Da Reporting-Linien und Agenden die Arbeit in den meisten Unternehmen prägen, muss die Struktur langfristigen Erfolg ermöglichen. Zwischen einem zentralisierten Modell, in dem Data Scientists in einem Team gebündelt sind, und einem dezentralen Modell, in dem sie in verschiedenen Fachbereichen eingebettet sind, gibt es Abwägungen.
Im zentralisierten Modell priorisiert ein zentrales Data-Science-Team Anfragen aus anderen Abteilungen und bearbeitet sie. Fragen kommen rein, Antworten gehen raus. So kann das Team als Center of Excellence agieren, in dem Data Scientists unter einer gemeinsamen Strategie zusammenarbeiten und Wissen teilen. Gleichzeitig entstehen jedoch Silos – inklusive Tools –, was Abstimmung und Kommunikation mit anderen Bereichen erschwert.
Im dezentralen Modell sind Data Scientists in verschiedene Fachbereiche eingebettet. Dadurch hat Data Science einen festen Platz am Tisch und kann die strategische Richtung des Bereichs mitprägen, während die nötige Domänenexpertise aufgebaut wird. Nachteil: Da sie verteilt sind und von Linienmanagerinnen und -managern geführt werden, kann dies Wachstum, Lernen, Weiterentwicklung und die Kollaboration der Data Scientists beeinträchtigen.
Beide Modelle markieren die Enden eines Spektrums. Dazwischen gibt es zahlreiche Hybridansätze, die Elemente aus zentralen und dezentralen Modellen kombinieren und Bereiche so zuschneiden, dass der Wert von Data Science im großen Maßstab maximiert wird.

Processes
Schließlich braucht eine skalierbare Datenstrategie gemeinsame Konventionen, Best Practices und Prozesse. Diese Ausrichtung ist entscheidend, um Zusammenarbeit zu fördern und Silos zu vermeiden. So können alle Teams nahtlos zusammenarbeiten und sich in einer gemeinsamen Datensprache verständigen.
Ein einfacher Einstieg ist eine vordefinierte Projektstruktur samt Vorlage, in der Aufgaben und Unteraufgaben eines Analytics-Projekts inklusive Anforderungen im Voraus abgebildet sind. Microsoft nutzt beispielsweise The Team Data Science Process. Das ermöglicht allen Stakeholdern, Anforderungen klar zu verstehen, Vorlagen für Datenanalysen und Rechenressourcen zu nutzen und Verantwortlichkeiten für die einzelnen Prozessphasen zu erkennen.
Je nach Unternehmen und Branche können vordefinierte Projektvorlagen regulatorischen Anforderungen unterliegen und komplexe Abläufe erfordern. Mit Open-Source-Tools lassen sich Projektstrukturvorlagen erstellen, um die Abstimmung zwischen Teams und Datenprofis zu verbessern.
Mach den Data-Maturity-Check, um den Umgang deines Teams mit Daten besser einschätzen zu können.

