Weiter zum Inhalt

Die 3 wichtigsten Trends in der Dateninfrastruktur 2021

Verschaffe deiner Data-Engineering-Funktion einen Vorsprung mit Orchestrierungsplattformen, Data-Discovery-Engines und Data-Lakehouses.
Aktualisiert 18. Sept. 2026  · 3 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Data Engineering bleibt für Unternehmen oberste Priorität, und 2021 gibt es spannende Entwicklungen im Bereich Dateninfrastruktur. In einem aktuellen Webinar stellte Maksim Percherskiy, Data Engineer bei der World Bank und ehemaliger Chief Data Officer der Stadt San Diego, drei besonders relevante Trends heraus: Data-Orchestrierungsplattformen, Data-Discovery-Engines und Data-Lakehouses.

Data-Orchestrierungsplattformen

Auch wenn Orchestrierungsplattformen zur Verwaltung von Computersystemen und Software seit vielen Jahren im Einsatz sind, ist Data Orchestration ein vergleichsweise neues Konzept: Es abstrahiert den Datenzugriff über Speichersysteme hinweg, virtualisiert Daten und stellt sie datengetriebenen Anwendungen bereit. Data-Orchestrierungsplattformen helfen Unternehmen, wirklich datengetrieben zu arbeiten, indem sie isolierte Daten aus verschiedenen Speicherorten zusammenführen und nutzbar machen. Beispiele sind Apache Airflow, Prefect, Luigi und Stitch. Sie sind mit modernen Ansätzen wie Versionsverwaltung, DevOps und Continuous Integration kompatibel.

Der DataCamp-Kurs Introduction to Airflow in Python ist ein idealer Einstieg, um ETL- und Data-Engineering-Workflows einfach und reproduzierbar zu implementieren und zu planen.

Data-Discovery-Engines

Je mehr Daten anfallen, desto sinnvoller ist es, dass Unternehmen in die Befähigung ihrer Teams investieren: relevante Daten schnell finden, dokumentieren und Doppelarbeit vermeiden. Data-Discovery-Engines wie Amundsen von Lyft und Databook von Uber steigern die Produktivität von Datennutzern, indem sie eine Suchoberfläche für Daten bereitstellen. Diese Tools basieren auf Metadaten, die Produktivität und Compliance unterstützen, weil damit die Dateninfrastruktur mit dem Unternehmenswachstum skalieren kann. Ziel von Data Discovery ist es, Daten stärker nach dem FAIR-Prinzip auszurichten: findable, accessible, interoperable, reusable – also auffindbar, zugänglich, interoperabel und wiederverwendbar.

Data Lakehouse

Data Lakes und Data Warehouses bedienen unterschiedliche Anwendungsfälle, sind für verschiedene Zwecke und Zielgruppen ausgelegt. Data Warehouses werden typischerweise von Analysten genutzt, um Business Intelligence zu erzeugen – sie enthalten flache Dateien, die explizit für diese Arbeit aufbereitet wurden. Data Lakes hingegen werden von Data Engineers aufgebaut und in Datenpipelines eingebunden. Data Scientists arbeiten näher an Data Lakes, da sie breitere und aktuellere Datenbestände enthalten.

Data Lakehouses sind, wie der Name andeutet, eine Kombination aus Data Lake und Data Warehouse. Plattformen wie Snowflake und Databricks' Delta Lake bieten Lösungen, die eine zentrale, verlässliche Datenquelle schaffen und die Vorteile beider Welten verbinden. Data Lakehouses übertragen die Datenstrukturen und Managementfunktionen von Data Warehouses auf Data Lakes, die für Datenspeicherung meist kostengünstiger sind. Gleichzeitig bleiben Schema und Versionierung der Daten erhalten. Mit Data Lakehouses können Data Scientists sowohl Machine Learning als auch Business Intelligence realisieren.

Quelle: Databricks

Alle drei Trends sind entscheidend, um 2021 Dateninfrastrukturen im Unternehmen zu skalieren. Sie sind gleichermaßen hilfreich für Firmen, die rund um Daten gebaut sind, und für diejenigen, die Daten erst noch nachhaltig in ihre Workflows integrieren müssen. Erfahre mehr über die Herausforderungen, vor denen große Unternehmen stehen, um ihre Daten zu operationalisieren und wirklich datengetrieben zu werden.

Themen
Datentechnik
Verwandt

Blog

Top 50+ AWS-Interviewfragen und Antworten für 2026

Ein kompletter Guide mit grundlegenden, fortgeschrittenen und szenariobasierten AWS-Interviewfragen – mit Beispielen aus der Praxis.
Zoumana Keita 's photo

Zoumana Keita

15 Min.

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Blog

2022-2023 DataCamp Classrooms Jahresbericht

Zu Beginn des neuen Schuljahres ist DataCamp Classrooms motivierter denn je, das Lernen mit Daten zu demokratisieren. In den letzten 12 Monaten sind über 7.650 neue Klassenzimmer hinzugekommen.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

8 Min.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Mehr AnzeigenMehr Anzeigen