Die erfolgreichsten Unternehmen von heute stützen ihre Entscheidungen stark auf Daten. Viele dieser datenkompetenten Organisationen erzeugen täglich Millionen von Datenzeilen, die von unterschiedlichsten Teams genutzt und analysiert werden. Eine der zentralen Herausforderungen, um Teams den Zugang zu Daten und die Arbeit damit zu ermöglichen, ist sicherzustellen, dass Daten gesammelt, vertrauenswürdig, verlässlich, umsetzbar und auffindbar sind.
Um sich in diesen komplexen Datenlandschaften zurechtzufinden, haben viele Organisationen eigene Technologien entwickelt und als Open Source bereitgestellt – sogenannte Data-Discovery-Tools.
In einem aktuellen Webinar beschreibt Ramnath Vaidyanathan, VP of Product Research bei DataCamp, wie Organisationen den Sprung von datenreaktiv – niemand hat die Kompetenzen oder den Zugriff, um mit Daten zu arbeiten – zu datenkompetent schaffen – alle haben Zugriff und die nötigen Kompetenzen, um mit Daten zu arbeiten und datenbasierte Entscheidungen zu treffen. Unternehmen können ihre Datenreife durch Investitionen in das IPTOP-Framework steigern: Infrastruktur, Menschen, Tools, Organisation und Prozesse. Wenn Unternehmen den Datenzugang über Investitionen in Dateninfrastruktur skalieren, müssen sie mit Data-Discovery-Tools eine einfache Datenauffindbarkeit sicherstellen.
Daten sind wertlos, wenn Menschen keinen Zugriff darauf haben, den Kontext der erhobenen Daten nicht verstehen und nicht finden, was sie brauchen. Genau deshalb sind Data-Discovery-Tools so entscheidend. Ramnath Vaidyanathan, VP of Product Research bei DataCamp

Wie datenkompetente Unternehmen Data-Discovery-Tools nutzen
Viele datengetriebene Unternehmen haben Data-Discovery-Tools in ihre Dateninfrastruktur integriert. Schauen wir uns die Beweggründe und Treiber hinter namhaften Lösungen wie Uber Databook und Lyft Amundsen an.

Herausforderungen bei der Datenerkundung
Ein zentrales Thema bei Data Discovery ist Produktivität und Compliance. Lyft berichtet, dass diese Herausforderungen mit der exponentiellen Zunahme der Datenmenge wuchsen – mit der Prognose, dass dieser Trend mindestens die nächsten zehn Jahre anhalten würde. Bei der Entwicklung von Amundsen stellten sie fest, dass rund 25% der Zeit von Analysten für Datensuche und -auffindung aufgewendet wurden. Zudem stiegen die Compliance-Anforderungen in den bedienten Ländern deutlich an.
Uber äußerte ähnliche Bedenken, als das Unternehmen über die Kernfunktion als Ride-Sharing-App hinaus zu Services wie Uber Eats, Uber Freight und Jump Bikes expandierte. Beim Aufbau von Databook verzeichnete Uber über 15 Millionen Fahrten pro Tag und 18.000 Mitarbeitende in unterschiedlichen Teams. Eine weitere Herausforderung lag darin, dass die Daten in vielen verschiedenen Formen vorlagen, darunter Hive, Presto und Vertica. Analysten mussten effizient auf die verschiedenen Datenquellen zugreifen und sie verstehen können, um Datenkompetenz zu erreichen.
Facebook entwickelte die Data-Discovery-Plattform Nemo, um den Bedarf an hochwertigen, vertrauenswürdigen Daten zu adressieren, da Umfang und Komplexität der Daten über Rollen und Standorte hinweg zunahmen. Aufgrund der mit den analysierten Daten verbundenen Datenschutzthemen sah sich Facebook zudem mit erheblichen Compliance-Anforderungen konfrontiert, die beim Bereitstellen von Tabellen für bestimmte Analysten berücksichtigt werden mussten.
John Bodley von Airbnb sagte in einem Vortrag auf einer Konferenz 2017: „Mit dem Wachstum von Airbnb wachsen auch die Herausforderungen beim Volumen, der Komplexität und der Unübersichtlichkeit von Daten.“ Das führte dazu, dass Mitarbeitende Daten oft als „segmentiert, unzugänglich und ohne Kontext“ empfanden. In der Folge wurden Tabellen doppelt angelegt, und Daten wurden nicht genutzt, wenn man ihnen nicht traute. Airbnb entwickelte Dataportal, um diese Hürden aus dem Weg zu räumen und die Datenerkundung deutlich effizienter zu machen.
Diese Herausforderungen sind weit verbreitet, branchenunabhängig und betreffen jede Organisation, die datenbasierte Entscheidungen skalieren möchte. Die einfache Auffindbarkeit von Daten wird immer wichtiger, je näher Unternehmen der Datenkompetenz kommen.
Die vier zentralen Ziele von Data-Discovery-Tools
Nachdem wir die Herausforderungen verstanden haben, schauen wir, wie verschiedene Data-Discovery-Tools sie adressieren. Uber gliedert die Ziele einer erfolgreichen Data-Discovery-Plattform in vier Komponenten:
- Erweiterbarkeit: Metadaten, Speicher und Entitäten lassen sich leicht zu Tabellen hinzufügen
- Zugänglichkeit: Sämtliche Metadaten sind programmatisch abrufbar
- Skalierbarkeit: Viele gleichzeitige Lesezugriffe werden unterstützt
- Leistungsfähigkeit: Lese- und Schreibzugriffe über mehrere Rechenzentren werden unterstützt
Die Erreichung dieser Ziele steigt mit der Datenreife einer Organisation. Je größer die Datenmenge, desto wichtiger wird jede einzelne Komponente.
Lyft und Airbnb liefern detaillierte Metadaten
Lyfts Engineering-Team argumentiert, dass „Metadaten der Heilige Gral künftiger Anwendungen“ sind. Sie unterteilen Metadaten in zwei Unterkategorien. Die erste ist ein beschreibender Datensatz aus Anwendungskontext (also was Menschen über die Daten wissen müssen, um damit zu arbeiten), Verhalten (wer ein bestimmtes Dataset besitzt und wie es üblicherweise genutzt wird) und Veränderung (wie sich das Dataset im Zeitverlauf ändert). Die zweite Komponente sind die beschriebenen Daten selbst – alle in der Organisation gespeicherten Daten in beliebigen Formaten wie Datenspeicher, Dashboards, Datenströme und mehr.
Bei der Entwicklung von Dataportal, der Data-Discovery-Plattform von Airbnb, waren Metadaten ein zentraler Mehrwert entlang der Datenpipeline. Vor der Einführung von Dataportal vertrauten viele Mitarbeitende den genutzten Daten aufgrund fehlenden Kontexts und fehlender Metadaten nicht. Airbnb betont: „Das Verständnis des gesamten Datenökosystems – von der Erzeugung eines Event-Logs bis zu seiner Nutzung in einer Visualisierung – stiftet mehr Wert als die Summe seiner Teile.“

Quelle: Airbnb
Mit Data Discovery zu hochwertigen Suchergebnissen
Sobald dieser Kontext gegeben ist, braucht es für Data Discovery eine leistungsfähige Suche. So vertrauenswürdig und verständlich einzelne Tabellen auch sind – Data-Discovery-Plattformen helfen nur, wenn Analysten die benötigten Daten schnell finden.
Die Landingpage von Lyft Amundsen erlaubt die Suche nach Tabellen mit natürlichen Sprachabfragen und zeigt die im Unternehmen am häufigsten genutzten Tabellen für den schnellen Zugriff. Außerdem können Analysten Feedback zu Tabellen hinterlassen, um künftige Suchergebnisse zu verbessern.
Facebooks Data-Discovery-Lösung Nemo ermöglicht das Filtern nach Nutzung, Datenschutzauflagen und Aktualität der Daten – und nutzt Facebooks Kompetenz in der Verarbeitung natürlicher Sprache, indem Nutzer Fragen in die Suchleiste eingeben können, um passende Tabellen zu erhalten.
Uber Databook bietet ähnliche Filterfunktionen, etwa nach Name, Owner, Spalte und verschachtelten Spalten. Uber setzt auf Elasticsearch, um Suchergebnisse schnell und präzise zu liefern.
Mit Data Discovery zur Datendemokratisierung
Das Skalieren von Datenkompetenz und Datenauffindbarkeit gehört untrennbar zusammen, denn Analysten brauchen einfachen Datenzugang, um informierte Entscheidungen zu treffen.

Organisationen mit niedriger Datenreife sollten zunächst Datenkompetenzen und -kultur aufbauen und die Dateninfrastruktur skalieren. Mit zunehmender Datenreife und wachsendem Datenzugang werden erweiterbare und skalierbare Data-Discovery-Funktionen jedoch zum Schlüssel, um wirklich datengetrieben zu arbeiten. Für eine vertiefte Diskussion aller Stellhebel zur Steigerung der organisatorischen Datenreife sieh dir unser Webinar zum Weg zur Datenkompetenz an oder mach den Data-Maturity-Check.