
Wenn es um die Speicherung von Big Data geht, sind Data Lakes und Data Warehouses die zwei beliebtesten Optionen. Data Warehouses dienen der Analyse archivierter strukturierter Daten, während Data Lakes große Datenmengen aller Strukturen aufnehmen.
In diesem Beitrag schauen wir uns die Unterschiede im Detail an. Die folgende Tabelle stellt sie in fünf Kategorien gegenüber.
| Data Lake | Data Warehouse | |
|---|---|---|
| Datentyp | Unstrukturierte und strukturierte Daten aus diversen Unternehmensquellen | Historische Daten, die auf ein relationales Datenbankschema zugeschnitten wurden |
| Zweck | Kostengünstige Speicherung von Big Data | Analysen für geschäftliche Entscheidungen |
| Nutzende | Data Scientists und Data Engineers | Data Analysts und Business Analysts |
| Aufgaben | Datenspeicherung und Big-Data-Analysen, etwa Deep Learning und Echtzeitanalysen | In der Regel schreibgeschützte Abfragen zum Aggregieren und Zusammenfassen von Daten |
| Größe | Speichert alle potenziell nutzbaren Daten – kann Petabytes umfassen! | Speichert nur für die Analyse relevante Daten |
Datentyp
Datenbereinigung ist eine zentrale Datenkompetenz, denn Daten liegen von Natur aus oft chaotisch und unvollständig vor. Rohdaten, die nicht bereinigt wurden, nennt man unstrukturierte Daten – dazu zählt ein Großteil der weltweiten Daten wie Fotos, Chat-Protokolle und PDF-Dateien. Unstrukturierte Daten, die bereinigt und in ein Schema überführt, in Tabellen organisiert und durch Datentypen sowie Beziehungen definiert wurden, heißen strukturierte Daten. Das ist der grundlegende Unterschied zwischen Lakes und Warehouses.
Data Lakes speichern Daten aus einer Vielzahl von Quellen wie IoT-Geräten, Echtzeit-Streams aus sozialen Medien, Nutzungsdaten und Webanwendungs-Transaktionen. Teils sind diese Daten strukturiert, häufig jedoch recht unaufgeräumt, da sie direkt aus der Quelle übernommen werden. Data Warehouses hingegen enthalten historische Daten, die für ein relationales Schema aufbereitet wurden.
Zweck
Data Lakes werden für die kosteneffiziente Speicherung großer Datenmengen aus vielen Quellen genutzt. Die Zulassung beliebiger Datenstrukturen senkt die Kosten, weil Daten dadurch flexibler und skalierbarer sind – sie müssen nicht in ein festes Schema passen. Strukturierte Daten lassen sich jedoch leichter analysieren, da sie bereinigt sind und ein einheitliches Schema für Abfragen bieten. Durch die Beschränkung auf ein Schema sind Data Warehouses sehr effizient, wenn es darum geht, historische Daten für konkrete Entscheidungen zu analysieren.
Du wirst feststellen, dass sich Data Lakes und Data Warehouses im Datenworkflow ergänzen. Eingehende Unternehmensdaten werden zunächst im Data Lake abgelegt. Entsteht eine spezifische Geschäftsfrage, wird ein relevanter Datenausschnitt aus dem Lake extrahiert, bereinigt und in ein Data Warehouse übertragen.
Nutzende
Data Lakes und Data Warehouses sind für unterschiedliche Zielgruppen gedacht. Data Analysts und Business Analysts arbeiten oft in Data Warehouses, die speziell aufbereitete, relevante Daten für ihre Aufgaben enthalten. Der Einsatz von Data Warehouses erfordert in der Regel weniger Programmier- und Data-Science-Kenntnisse.
Data Lakes werden von Data Engineers aufgebaut und betrieben, die sie in Datenpipelines integrieren. Data Scientists arbeiten enger mit Data Lakes, da sie Daten in größerer Breite und mit aktuellerem Bezug enthalten.
Aufgaben
Data Engineers nutzen Data Lakes, um eingehende Daten zu speichern. Data Lakes sind jedoch nicht nur Speicherplätze. Denk daran: Unstrukturierte Daten sind flexibler und skalierbarer – ideal für Big-Data-Analysen. Solche Analysen lassen sich in Data Lakes mit Diensten wie Apache Spark und Hadoop durchführen. Das gilt besonders für Deep Learning, das mit wachsenden Trainingsdaten stark auf Skalierbarkeit angewiesen ist.
Data Warehouses sind für Analystinnen und Analysten meist schreibgeschützt, da sie primär Daten lesen und aggregieren, um Insights zu gewinnen. Weil die Daten bereits bereinigt und archiviert sind, ist ein Einfügen oder Aktualisieren in der Regel nicht nötig.
Größe
Es überrascht nicht, dass Data Lakes deutlich größer sind, weil sie alle potenziell relevanten Daten eines Unternehmens vorhalten. Data Lakes erreichen häufig Petabyte-Größe – das sind 1.000 Terabyte! Data Warehouses sind bei der Datenauswahl wesentlich selektiver.
Fazit
Wenn du zwischen Data Lake und Data Warehouse abwägst, geh diese Kategorien durch und prüfe, was am besten zu deinem Use Case passt. Wenn du tiefer in die Unterschiede einsteigen oder lernen willst, wie man Data Warehouses entwirft, schau dir unseren Kurs Database Design an!
Denk daran: Manchmal ist die Kombination beider Speicherlösungen sinnvoll – besonders beim Aufbau von Datenpipelines. Wie das in der Praxis aussieht, zeigen wir in unseren Kursen Introduction to Data Engineering und Building Data Engineering Pipelines in Python.
