
Data Engineering bleibt für Unternehmen oberste Priorität, und 2021 gibt es spannende Entwicklungen im Bereich Dateninfrastruktur. In einem aktuellen Webinar stellte Maksim Percherskiy, Data Engineer bei der World Bank und ehemaliger Chief Data Officer der Stadt San Diego, drei besonders relevante Trends heraus: Data-Orchestrierungsplattformen, Data-Discovery-Engines und Data-Lakehouses.
Data-Orchestrierungsplattformen
Auch wenn Orchestrierungsplattformen zur Verwaltung von Computersystemen und Software seit vielen Jahren im Einsatz sind, ist Data Orchestration ein vergleichsweise neues Konzept: Es abstrahiert den Datenzugriff über Speichersysteme hinweg, virtualisiert Daten und stellt sie datengetriebenen Anwendungen bereit. Data-Orchestrierungsplattformen helfen Unternehmen, wirklich datengetrieben zu arbeiten, indem sie isolierte Daten aus verschiedenen Speicherorten zusammenführen und nutzbar machen. Beispiele sind Apache Airflow, Prefect, Luigi und Stitch. Sie sind mit modernen Ansätzen wie Versionsverwaltung, DevOps und Continuous Integration kompatibel.
Der DataCamp-Kurs Introduction to Airflow in Python ist ein idealer Einstieg, um ETL- und Data-Engineering-Workflows einfach und reproduzierbar zu implementieren und zu planen.
Data-Discovery-Engines
Je mehr Daten anfallen, desto sinnvoller ist es, dass Unternehmen in die Befähigung ihrer Teams investieren: relevante Daten schnell finden, dokumentieren und Doppelarbeit vermeiden. Data-Discovery-Engines wie Amundsen von Lyft und Databook von Uber steigern die Produktivität von Datennutzern, indem sie eine Suchoberfläche für Daten bereitstellen. Diese Tools basieren auf Metadaten, die Produktivität und Compliance unterstützen, weil damit die Dateninfrastruktur mit dem Unternehmenswachstum skalieren kann. Ziel von Data Discovery ist es, Daten stärker nach dem FAIR-Prinzip auszurichten: findable, accessible, interoperable, reusable – also auffindbar, zugänglich, interoperabel und wiederverwendbar.

Data Lakehouse
Data Lakes und Data Warehouses bedienen unterschiedliche Anwendungsfälle, sind für verschiedene Zwecke und Zielgruppen ausgelegt. Data Warehouses werden typischerweise von Analysten genutzt, um Business Intelligence zu erzeugen – sie enthalten flache Dateien, die explizit für diese Arbeit aufbereitet wurden. Data Lakes hingegen werden von Data Engineers aufgebaut und in Datenpipelines eingebunden. Data Scientists arbeiten näher an Data Lakes, da sie breitere und aktuellere Datenbestände enthalten.
Data Lakehouses sind, wie der Name andeutet, eine Kombination aus Data Lake und Data Warehouse. Plattformen wie Snowflake und Databricks' Delta Lake bieten Lösungen, die eine zentrale, verlässliche Datenquelle schaffen und die Vorteile beider Welten verbinden. Data Lakehouses übertragen die Datenstrukturen und Managementfunktionen von Data Warehouses auf Data Lakes, die für Datenspeicherung meist kostengünstiger sind. Gleichzeitig bleiben Schema und Versionierung der Daten erhalten. Mit Data Lakehouses können Data Scientists sowohl Machine Learning als auch Business Intelligence realisieren.

Quelle: Databricks
Alle drei Trends sind entscheidend, um 2021 Dateninfrastrukturen im Unternehmen zu skalieren. Sie sind gleichermaßen hilfreich für Firmen, die rund um Daten gebaut sind, und für diejenigen, die Daten erst noch nachhaltig in ihre Workflows integrieren müssen. Erfahre mehr über die Herausforderungen, vor denen große Unternehmen stehen, um ihre Daten zu operationalisieren und wirklich datengetrieben zu werden.

