Weiter zum Inhalt

Was ist Data Engineering?

Erfahre, was Data Engineering ist, wie es sich von Data Science unterscheidet, welche Möglichkeiten das Feld bietet und wie du Data Engineering lernst.
Aktualisiert 18. Sept. 2026  · 8 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Einführung

Daten sind überall. In den letzten Jahren hat die wachsende Zahl vernetzter Geräte und ihre Vielzahl an Einsatzszenarien dazu geführt, dass weltweit enorme Datenmengen entstehen, die sich mit klassischen Methoden nicht mehr bewältigen lassen.

Laut Statista sind seit 2021 23,8 Milliarden Geräte mit dem Internet verbunden. 58% davon sind IoT-Geräte (Smart-Home-Geräte, vernetzte selbstfahrende Autos, Industrieanlagen usw.), die übrigen 42% sind Nicht-IoT-Geräte (Laptops, Smartphones usw.). Das bedeutet: Heute stammen Daten aus den unterschiedlichsten Quellen. Beispiele sind:

  1. Nutzeraktivitäten: Jede Aktion erzeugt Daten – selbst Informationen darüber, wo und wie oft wir in einer App tippen, sind wertvoll. Solche Daten müssen gespeichert und an die Rechenzentren der Anwendungen verteilt werden.
  2. „Internet of Things“-Geräte: Diese Geräte produzieren riesige Datenmengen, etwa Sensordaten aus vielen verschiedenen Orten. All diese Daten müssen erfasst und in einen Datenpool für weitere Analysen überführt werden.
  3. Programmlogs: Moderne Anwendungen bestehen aus vielen Komponenten – und jede davon erzeugt Logs. Diese Protokolle werden in eine Data-Engineering-Pipeline eingespeist und weiterverarbeitet.

Die vielen unterschiedlich strukturierten Daten, die weltweit entstehen, müssen anderen Komponenten in der Softwarearchitektur bereitgestellt oder von Business-Analysten und Data Scientists visualisiert und interpretiert werden. Diese Bereitstellung ist jedoch alles andere als trivial. Für eine saubere Datenlieferung gelten zentrale Anforderungen:

  1. Daten müssen in einem standardisierten Format bereitgestellt werden.
  2. Die Daten dürfen keine Widersprüche enthalten.
  3. Duplikate sollten entfernt werden.
  4. Die Daten müssen verlässlich sein.
  5. Die Bereitstellung sollte mit minimaler Verzögerung erfolgen.

Die Auslieferung dieser Informationen ist also ein komplexer Prozess. Erfolgt sie nicht sorgfältig, kann das vor allem für mittelgroße und große Unternehmen schnell problematisch werden. Genau hier kommen Data Engineers ins Spiel.

In diesem Artikel lernst du die Grundlagen des Data Engineerings kennen, darunter:

  1. Was Data Engineering ist – und warum eine robuste Datenpipeline entscheidend ist
  2. Den Unterschied zwischen Data Science und Data Engineering
  3. Warum Data Engineering immer gefragter wird
  4. Welche Kompetenzen gute Data Engineers mitbringen
  5. Wie DataCamp dir hilft, Data Engineer zu werden

Welche Aufgaben hat ein Data Engineer?

Kurz gesagt, Data Engineers:

  1. Sorgen dafür, dass Daten für Data Scientists und Business-Intelligence-Teams (und alle, die mit Daten arbeiten) leicht zugänglich sind.
  2. Optimieren die Big-Data-Systemarchitektur von Unternehmen.
  3. Entwerfen und konfigurieren Datenbanken.
  4. Arbeiten eng mit Business-Intelligence-Engineers, Data Scientists und Data Analysts zusammen.
  5. Erschließen und transformieren Daten. Um all das zu ermöglichen, richten Data Engineers zunächst ETL-Pipelines ein.

Mehr dazu, was ein Data Engineer konkret macht, findest du im ausführlichen Artikel. 

ETL-Pipelines

ETL-Pipelines nehmen in regelmäßigen Abständen komplexe Daten entgegen und verarbeiten sie so, dass sie in nutzbarer Form gespeichert werden können. Das Einrichten und Warten dieser Pipelines liegt in der Verantwortung der Data Engineers.

Es gibt drei Phasen in ETL-Pipelines:

  1. Extract Große Datenmengen aus unterschiedlichen Quellen werden in verschiedenen Formaten gesammelt.
  2. Transform Da die Daten aus uneinheitlichen Quellen stammen und unterschiedliche Formate haben, werden sie so weit wie möglich standardisiert. Das erhöht Auffindbarkeit und Nutzbarkeit für die nächsten Schritte.
  3. Load Sobald die Daten in einem gut auffindbaren und nutzbaren Format vorliegen, werden sie in der Regel in Data Warehouses gespeichert. So stehen sie jederzeit für Analysen bereit.

Data Warehouses

Data Warehouses sind Speicherorte für standardisierte Daten. Sie sind darauf optimiert, sehr große Datenmengen zu filtern und auszulesen. In modernen Data Warehouses lassen sich sowohl strukturierte als auch unstrukturierte Daten speichern, denn auch nicht kategorisierbare Inhalte wie Fotos und Videos sind wichtig.

Data Engineering vs. Data Science

Die Unterschiede zwischen Data Engineers und Data Scientists sind wesentlich. Data Scientists spielen in Unternehmen eine zentrale Rolle, weil sie zu datenbasierten Entscheidungen beitragen. Ihr Erfolg hängt jedoch maßgeblich von der Qualität der verfügbaren Daten ab.

Data Engineers wiederum entwerfen die Systeme, die Data Scientists strukturiert und konsistent mit Daten versorgen. Sobald die Informationen bereitstehen, suchen Data Scientists mithilfe der von den Data Engineers gelieferten Formate nach Mustern und leiten daraus Erkenntnisse ab.

Data Engineers und Data Scientists arbeiten also eng zusammen. Man kann es sich wie im Fußball vorstellen: Der Coach entwickelt die Strategie und stellt die Mannschaft so auf, dass Torchancen entstehen. In diesem Bild ist der Coach der Data Engineer, der Ball sind die Daten und die Torschützinnen und Torschützen sind die Data Scientists. Der Rest des Teams ist die Infrastruktur.

Warum ist Data Engineering so populär geworden?

Laut Analysen auf der Plattform Burning Glass Nova stiegen die Stellenausschreibungen für „Data Engineer“ im Jahr 2019 um 88,3%. Demnach wächst die Nachfrage seit 2016 kontinuierlich. Zudem gibt es fast fünfmal so viele offene Stellen für Data Engineers wie für Data Scientists. Die Gehälter von Data Engineers liegen außerdem etwa 20–30% über denen von Data Scientists.

Wie oben beschrieben, sind Data Scientists das letzte Glied in der Datenverarbeitungskette. Sie sind darauf angewiesen, dass Data Engineers die Daten entsprechend vorbereiten. Je mehr Datenquellen und -typen hinzukommen, desto größer wird der Bedarf an Data Engineers. Daher investieren Unternehmen vermehrt in die Erfassung und Verteilung von Daten.

In Abbildung 4.1 zeigt ein Pyramidenmodell die „Hierarchy of Needs“ der Data Science. Die Aufgaben der Data Engineers bilden die Basis der Pyramide – ein deutlicher Hinweis darauf, wie essenziell ihre Rolle für Unternehmen ist.

Abbildung 4.1: Die Data-Science-Hierarchy of Needs.
Quelle: hackernoon

Welche Skills braucht ein Data Engineer?

Die Kompetenzen von Data Engineers überschneiden sich häufig mit denen von Software Engineers und Data Scientists, wie in Abbildung 5.1 zu sehen ist.

Abbildung 5.1: Datenrollen und Kompetenzprofile
Quelle: RyanSwanstrom

Liegt die Rolle des Data Engineers näher an Software Engineering oder an Data Science?

Die vorherigen Berufe einer Gruppe von Data Engineers sind in Abbildung 5.2 dargestellt. Demnach haben über 40% einen Hintergrund im Software Engineering. Das zeigt nicht nur, wie nah beieinander Data Engineering und Software Engineering liegen, sondern auch, dass Software Engineers heute deutlich häufiger ins Data Engineering wechseln als in andere Bereiche.

Abbildung 5.2: Data Engineers nach vorheriger Rolle (Top 10).
Quelle: stitchdata

Aus unserer Sicht bei DataCamp gehören folgende Kompetenzen zu einem guten Data Engineer:

  1. Software-Engineering-Background Data Engineers brauchen einen Software-Engineering-Hintergrund, um Data-Engineering-Herausforderungen mit Kenntnissen in objektorientierter Programmierung, Datenstrukturen und Algorithmen anzugehen. Erfahrung in Python, Scala oder Java ist Pflicht.
  2. Tools Data Engineers sollten mit Data-Engineering-Tools wie Airflow, Apache oder Kafka sicher umgehen können.
  3. Datenbanktechnologien Ein Data Engineer sollte verschiedene Datenbankarten kennen.
  4. Cloud-Technologien Data Engineers sollten mit mehreren Cloud-Plattformen wie Amazon Web Services, Google Cloud Platform und Microsoft Azure vertraut sein. Erfahrung in Cloud-Architekturen und mit DevOps-Tools ist ebenfalls wichtig, da sie für die Automatisierung der Datenflüsse verantwortlich sind.

Wie lernt man Data Engineering?

Wenn du dich im Bereich Data Engineering weiterentwickeln willst, starte mit diesen empfohlenen DataCamp-Kursen. Mit diesen Kursen und Projekten erhöhst du deine Chancen auf Praktika oder Jobs im Data-Engineering-Umfeld.

  1. Introduction to Python
  2. Intermediate Python
  3. Introduction to Relational Databases in SQL
  4. Introduction to Scala
  5. Introduction to Data Engineering
  6. Introduction to Airflow in Python
  7. AWS Cloud Concepts
  8. Exploring London's Travel Network (Snowflake, Redshift, BigQuery) Projects
  9. Building Data Engineering Pipelines in Python
  10. NoSQL Concepts
  11. ETL in Python
  12. Streaming Concepts
  13. Streaming Data with AWS Kinesis and Lambda

Außerdem ist unsere Data Engineer Certification in der Branche anerkannt und hilft dir, deine Kompetenzen gegenüber Arbeitgebern nachzuweisen.

Wenn dich dieser Karriereweg interessiert, erfährst du in einem separaten Artikel, wie du Data Engineer wirst

Themen
Datentechnik