Lernpfad
Data Engineering hat einen der chaotischsten Lernwege im gesamten Datenbereich. Du brauchst SQL, Python, Orchestrierung mit Airflow, Transformation mit dbt und mindestens eine Cloud-Plattform – und das kostenlose Material dazu liegt verstreut auf unterschiedlichen Websites mit stark schwankender Qualität.
Die gute Nachricht: Das meiste, was du für den Jobeinstieg brauchst, gibt es kostenlos oder zumindest mit kostenlosem Einstieg. Die schlechte: Das freie Material ist verstreut, uneinheitlich und teils hinter den Versionen der Tools zurück, die du im Job tatsächlich nutzt. Diese Übersicht zeigt dir einen sinnvollen Weg hindurch.
Diese Liste richtet sich an zwei Gruppen: komplette Einsteiger, die eine sinnvolle Reihenfolge brauchen, und Analysten oder Entwickler, die schon SQL können und in Pipelines wechseln wollen. Egal, ob du noch keine einzige Zeile Python geschrieben hast oder bereits ETL-Jobs auslieferst – hier findest du deinen nächsten Schritt.
Ich habe die Auswahl nach praktischer Tiefe, gutem Aufeinanderaufbauen und echter Empfehlungshäufigkeit durch arbeitende Data Engineers auf r/dataengineering und in Hiring-Threads getroffen. Wo eine Ressource klare Grenzen hat – etwa Versionsrückstände oder Paywalls hinter dem Wort "free" – sage ich es. Für die Karriereseite lohnt auch unser Guide how to become a data engineer.
TL;DR
| Ressource | Typ | Niveau | Am besten geeignet für |
|---|---|---|---|
| Understanding Data Engineering | DataCamp-Kurs | Einsteiger | Vokabular und mentales Modell, bevor du Tools anfasst |
| DataCamp Tutorials und Blogs | Tutorials/Blogs | Einsteiger bis Fortgeschritten | Gezielt Lücken schließen (Airflow, dbt, ETL, SQL) |
| SQL-Übung (Mode, SQLBolt, SQLZoo) | Interaktive Tutorials | Einsteiger bis Fortgeschritten | SQL-Routine aufbauen und Interview-Fitness |
| Python-Grundlagen (Docs, Automate the Boring Stuff) | Dokumentation/Buch | Einsteiger | Skripting und Automatisierung vor den Pipelines |
| Data Engineering Zoomcamp | Offener GitHub-Kurs | Mittelstufe | Ein End-to-end-Portfolio-Projekt über den modernen Stack |
| dbt Learn | Herstellerkurs | Mittelstufe | Analytics Engineering und die Transformationsschicht |
| Apache Airflow Docs + Astronomer Guides | Docs/Guides | Mittelstufe | Orchestrierung und DAG-Authoring |
| Databricks Academy Free Training | Herstellerkurse | Einsteiger bis Mittelstufe | Delta Lake und Lakehouse-Grundlagen |
| Microsoft Learn (DP-900, DP-203) | Hersteller-Lernpfade | Einsteiger bis Fortgeschritten | Strukturierte Azure-Datenservices und Zertifizierungsvorbereitung |
| Google Cloud Skills Boost + AWS Skill Builder | Hersteller-Lernpfade | Mittelstufe bis Fortgeschritten | Cloud-spezifische, produktionsnahe Laborumgebungen |
Die besten Ressourcen, um Data Engineering zu lernen
Die Reihenfolge ist so gewählt, dass Einsteiger von oben nach unten lesen können: erst Konzepte und Grundlagen, dann Orchestrierung und Cloud-Plattformen.
1. Understanding Data Engineering (DataCamp-Kurs)
Das ist der richtige Start, wenn du noch nicht genau weißt, was ein Data Engineer den ganzen Tag macht. Unser Kurs Understanding Data Engineering ist eine 2-stündige, konzeptionelle Einführung zu Datenpipelines, Speicheroptionen und dem Unterschied zwischen Batch- und Stream-Verarbeitung – ganz ohne Code.
Er ist bewusst nicht technisch – genau das ist der Punkt. Du verstehst danach das Vokabular, das alle anderen Ressourcen hier stillschweigend voraussetzen: ETL versus ELT, Data Warehouses versus Lakes und wo Orchestrierung hineingehört.
Die klare Grenze: Du baust hier noch nichts. Sieh es als Karte, nicht als Reise, und kombiniere es mit den praktischen Ressourcen unten.
- Niveau: Einsteiger
- Format: Interaktiver Kurs, 2 Stunden
- Am besten für: Alle, die klären wollen, ob Data Engineering der richtige Weg ist, bevor sie Zeit in Tools investieren
Kurs starten: Understanding Data Engineering.
2. DataCamp Tutorials und Blogs
Sobald du baust, sind unsere kostenlosen Tutorials und Blogs der schnellste Weg, eine konkrete Lücke zu schließen, ohne gleich einen ganzen Kurs zu buchen. Sie sind genau für die Momente geschrieben, in denen du an einem Tool hängst.
Ein paar Empfehlungen: Unser Apache Airflow Tutorial führt das Authoring von DAGs von A bis Z durch, und unser dbt-Tutorial deckt Modelle, Tests und Dokumentation mit lauffähigen Beispielen ab. Fürs Interview ist unser Beitrag mit SQL-Interviewfragen eine wirklich nützliche Wiederholungsliste.
Ehrlich gesagt: Eine Sammlung von Tutorials ist kein Lernprogramm. Du brauchst etwas anderes für die Reihenfolge, deshalb sind sie hier als Begleiter zu strukturierten Kursen und nicht als Ersatz eingeordnet.
- Niveau: Einsteiger bis Fortgeschritten
- Format: Kostenlose, schriftliche Tutorials und Blogs, jeweils 10 bis 30 Minuten
- Am besten für: Gezielte Lücken bei Airflow, dbt, SQL oder ETL schließen, während du einen größeren Kurs durcharbeitest
Tutorials lesen: DataCamp Data Engineering Tutorials.
3. SQL-Praxis: Mode, SQLBolt, SQLZoo und LeetCode
SQL ist die mit Abstand wichtigste Kompetenz für Data Engineers, und das beste kostenlose Übungsmaterial verteilt sich auf vier Websites, von denen jede eine Sache richtig gut macht. Es gibt keinen eindeutigen Sieger, kombiniere sie am besten.
Die von r/dataengineering am häufigsten empfohlene Kombi folgt dieser Reihenfolge:
- DataCamp für SQL-Kurse, Webinare und Tutorials. Viele Kurskapitel sind gratis, Tutorials und Blogs immer.
- SQLBolt für die absoluten Basics mit interaktiven Browser-Lektionen ganz ohne Anmeldung.
- Mode Analytics SQL Tutorial für praktisches Querying gegen echte Analytics-Datensätze – näher an der Realität.
- SQLZoo für fortschreitende Übungsaufgaben mit steigender Schwierigkeit.
- LeetCode SQL Track für Interviewaufgaben von leicht bis schwer, allerdings steckt vieles hinter dem Premium-Abo.
W3Schools SQL taugt als schnelle Referenz, ist aber zu oberflächlich zum Lernen. Die echte Grenze all dieser Angebote: Keines bringt dir SQL-Performance-Tuning im großen Maßstab bei – das lernst du erst am echten Warehouse.
- Niveau: Einsteiger bis Fortgeschritten
- Format: Interaktive Browser-Übungen, kostenlos (LeetCode hat eine kostenpflichtige Premium-Stufe)
- Am besten für: SQL-Routine von Grund auf aufbauen und Vorbereitung auf technische Interviews
Mit der Praxis starten: SQL for Absolute Beginners.
4. Python-Grundlagen: Docs, Automate the Boring Stuff
Data Engineering läuft auf Python. Bevor Airflow oder Spark dran sind, solltest du dich mit Skripten, Dateien und Funktionen wohlfühlen. Die besten kostenlosen Python-Grundlagen sind wirklich frei – ohne versteckte Audit-Tricks.
Für komplette Einsteiger ist Automate the Boring Stuff with Python ein komplettes Buch unter Creative-Commons-Lizenz, dessen Fokus auf Dateiverarbeitung, Web Scraping und Tabellenautomatisierung perfekt zu echten Ingestion-Aufgaben passt.
Wenn du Skripte schreiben kannst, deckt Corey Schafers YouTube-Kanal Python plus Tools wie Git und Docker in einer Qualität ab, die viele Bezahlkurse nicht erreichen. Das offizielle Python.org-Tutorial ist die autoritative Referenz, wenn du ganz genau wissen willst, wie etwas funktioniert. Der Haken bei Docs und YouTube: Beides bietet keinen vorgegebenen Lernpfad – Disziplin ist gefragt.
- Niveau: Einsteiger
- Format: Kostenloses Buch, Videos, interaktive Übungen und offizielle Doku
- Am besten für: Sicheres Skripting, bevor du zu Pipeline-Tools greifst
Buch lesen: Automate the Boring Stuff with Python.
5. Data Engineering Zoomcamp (DataTalks.Club)
Das ist die Ressource, die ich Quereinsteigern für ein echtes Portfolio-Projekt empfehle – und die auf Reddit und LinkedIn am konstantesten als bester kostenloser End-to-end-Data-Engineering-Kurs bezeichnet wird. Es ist ein community-gepflegtes, offenes 9-Wochen-Bootcamp-Lernprogramm, komplett auf GitHub.
Die Module decken den modernen Stack in der Reihenfolge ab, wie du ihn im Job triffst: Data Ingestion, Orchestrierung mit Airflow, Warehousing auf BigQuery und Postgres, Batch und Streaming mit Kafka, Transformation mit dbt und Infrastruktur mit Terraform. Alles läuft gegen echte Datensätze und Cloud-Deployments, und das kostenlose Zertifikat gibt es für erledigte Hausaufgaben plus Capstone.
Zwei ehrliche Hinweise. Es ist ein Kurs auf Mittelstufenniveau, der grundlegendes Python, grundlegendes SQL und etwas Kommandozeilenroutine voraussetzt, und der Zeitaufwand ist mit 5 bis 10 Stunden pro Woche über 9+ Wochen real. Weil er community-gepflegt ist, weisen GitHub-Issues regelmäßig darauf hin, dass die BigQuery-UI sowie Airflow- oder dbt-Versionen von den Screenshots abweichen, und die Terraform-Abschnitte sind steil, wenn du DevOps noch nie angefasst hast.
- Niveau: Mittelstufe
- Format: Offener GitHub-Kurs, 9+ Wochen, kostenlos inkl. Zertifikat
- Am besten für: Ein End-to-end-Portfolio-Projekt, das den gesamten modernen Stack abdeckt
Kurs starten: Data Engineering Zoomcamp auf GitHub.
6. dbt Learn
dbt Learn ist die Adresse für die Transformationsschicht, und die zentralen Selbstlernkurse sind kostenlos. Wenn du schon SQL kannst und in Analytics Engineering einsteigen willst, bist du hier richtig.
Der Fundamentals-Kurs behandelt Modeling, Tests und Dokumentation, separate Module führen dbt auf BigQuery, Snowflake und Redshift durch. Es gibt neuere Module zu dbt mit Iceberg und offenen Tabellenformaten – gut zu wissen, wenn dein Zielunternehmen ein Lakehouse betreibt.
Die klare Grenze ist der Umfang. dbt Learn lehrt nur die Transformations- und Modellebene, setzt also funktionierendes SQL und ein Grundverständnis von dimensionalem Modeling voraus und behandelt Orchestrierung oder Ingestion gar nicht.
- Niveau: Mittelstufe
- Format: Selbstlernkurse des Herstellers, Kerninhalte kostenlos
- Am besten für: Analytics Engineering und den dbt-Transformations-Workflow meistern
Jetzt starten: dbt Learn.
7. Apache Airflow Docs und Astronomer Guides
Airflow ist das Orchestrierungstool, dem du im Data-Engineering-Job mit hoher Wahrscheinlichkeit begegnest, und die offizielle Dokumentation ist kostenlos und gründlich. Die Docs decken Kernkonzepte, DAG-Authoring, Operatoren, Scheduling und Deployments ab.
Allein gelesen wirken die Docs teils abstrakt – hier helfen die ergänzenden Guides von Astronomer.io. Sie liefern Deploymentschemata, Testansätze und konkrete ETL-Beispiele, die in der Referenz fehlen, und sind kostenlos, auch wenn Astronomers Managed-Cloud kostenpflichtig ist.
Der ehrliche Nachteil ist die Lernkurve. Die Docs setzen flüssiges Lesen von Python voraus, und die Produktions-Deployments stützen sich auf Kubernetes- und Helm-Wissen. Daher ist dies Pflichtlektüre, sobald du die Basics hast – nicht der erste Halt. Wenn du einen sanfteren Einstieg willst, starte zunächst mit unserem Airflow-Tutorial.
- Niveau: Mittelstufe
- Format: Kostenlose offizielle Docs plus kostenlose Hersteller-Guides
- Am besten für: Orchestrierung und DAG-Authoring lernen, sobald du Python kannst
Docs lesen: Apache Airflow Documentation.
8. Databricks Academy Free Training
Die Databricks Academy bietet kostenlose Selbstlernkurse, die einen klaren Einstieg in die Lakehouse-Welt geben – ein Thema, das immer öfter in Stellenausschreibungen auftaucht. Die Registrierung ist kostenlos, mehrere Einführungskurse sind enthalten.
Zur kostenlosen Stufe gehören "Get Started with Databricks" zu Workspace und Notebooks, SQL-Analysten- und BI-Basics sowie eine Einführung in Delta Lake. Für Einsteiger ist Delta Lake am wertvollsten, weil es erklärt, warum es Lakehouses gibt – nicht nur, wie man durch die UI klickt.
Der Haken: Die tieferen, rollenbasierten Data-Engineering-Tracks liegen oft hinter Bezahlplänen oder sind nur über ein Arbeitgeberkonto freigeschaltet. Sieh die kostenlosen Kurse als Grundlagen, nicht als vollständigen Engineering-Pfad.
- Niveau: Einsteiger bis Mittelstufe
- Format: Selbstlernkurse des Herstellers, kostenlos nach Registrierung
- Am besten für: Delta Lake und Lakehouse-Grundlagen
Jetzt starten: Databricks Academy.
9. Microsoft Learn: DP-900 und DP-203
Microsoft Learn hostet vollständig kostenlose Inhalte für zwei Azure-Datenpfade und ist der strukturierteste freie Einstieg in die Datenservices einer einzelnen Cloud. Es gibt keinen Audit-Trick; die Lernmodule sind wirklich frei.
Die Pfade teilen sich nach Niveau:
- Azure Data Fundamentals (DP-900) ist ein Einsteigerpfad zu Datenbanken, Analytics und zentralen Azure-Datenservices.
- Azure Data Engineer Associate (DP-203) ist ein Pfad von Mittelstufe bis Fortgeschritten zu Azure Synapse, Data Factory, Databricks, Delta Lake und Stream Analytics.
Ein kostenloses Azure-Konto gibt dir zeitlich begrenzte Credits – gelistet mit $200 für 30 Tage – plus eine dauerhaft kostenlose Stufe für bestimmte Services. So kannst du üben, ohne direkt zu zahlen. Hauptkritik aus der Community: Beide Pfade sind stark auf Prüfungen ausgerichtet – hervorragend für die Zertifizierung, aber teils mehr „teachen to the test“ als für unordentliche Real-World-Probleme.
- Niveau: Einsteiger (DP-900) bis Fortgeschritten (DP-203)
- Format: Kostenlose Hersteller-Lernpfade auf Microsoft Learn
- Am besten für: Strukturierter, zertifizierungsorientierter Einstieg in Azure-Datenservices
Jetzt starten: Microsoft Learn DP-900 Pfad.
10. Google Cloud Skills Boost und AWS Skill Builder
Wenn du schon weißt, auf welcher Cloud du arbeiten willst, bieten Google und AWS produktionsnahe Laborumgebungen, an die kein kostenloser MOOC herankommt. Das sind die mit Abstand realitätsnächsten kostenlosen Ressourcen.
Google Cloud Skills Boost hostet den Professional Data Engineer Lernpfad mit Labs zu BigQuery, Dataflow, Dataproc, Pub/Sub und Composer. AWS Skill Builder bietet einen Data Engineering on AWS Lernplan zu S3, Glue, EMR, Redshift, Kinesis, Lambda und Lake Formation.
Die kostenlosen Stufen sind real, aber begrenzt. Auf beiden Plattformen erfordern einige fortgeschrittene Labs und Quests ein Abo oder Credits, und Labs gegen echte Services können geringe Kosten verursachen, wenn du die Freikontingente überschreitest – etwa bei Glue oder Redshift. Bei Google sind $300 Credits über 90 Tage für neue Nutzer gelistet, und Lernende berichten auf beiden Plattformen, dass Lab-Anleitungen gelegentlich der aktuellen Console-UI hinterherhinken.
- Niveau: Mittelstufe bis Fortgeschritten
- Format: Kostenlose Hersteller-Lernpfade und Labs, mit Bezahlstufen für fortgeschrittene Inhalte
- Am besten für: Cloud-spezifische Praxis in produktionsähnlichen Umgebungen
Jetzt starten: Google Cloud Skills Boost Data Engineer Pfad und AWS Skill Builder.
Vorgeschlagener Lernpfad
Diese Ressourcen bauen aufeinander auf. So würde ich starten, wenn ich bei null anfinge.
Phase 1: Konzepte und Grundlagen
Starte mit unserem Kurs Understanding Data Engineering, um das Vokabular zu lernen. Baue dann die zwei Kompetenzen auf, die jeder Job verlangt: SQL und Python. Arbeite SQLBolt durch, dann das Mode SQL Tutorial fürs Querying, und lies Automate the Boring Stuff fürs Skripting.
Übereile diese Phase nicht. Fast alle, die später im Zoomcamp straucheln, fehlen hier solides SQL oder Python. Wenn du ein Abo erwägst, ist DataCamps Professional Data Engineer in Python Lernpfad hier sehr zu empfehlen.
Phase 2: Ein End-to-end-Projekt bauen
Wenn du SQL und Python sicher schreibst, verwandelt das Data Engineering Zoomcamp Wissen in ein Portfolio. Du berührst Ingestion, Orchestrierung, Warehousing und Transformation in einem verbundenen Projekt – genau das, was Hiring-Manager sehen wollen.
Stütze dich auf die Airflow-Docs und unser dbt-Tutorial, wenn ein Zoomcamp-Modul schneller ist, als dir lieb ist.
Phase 3: Auf eine Plattform spezialisieren
Nach dem Zoomcamp wählst du die Cloud, die deine Zieljobs nutzen, und gehst mit dem Herstellerpfad in die Tiefe: Microsoft Learn für Azure, Google Cloud Skills Boost für GCP oder AWS Skill Builder für AWS. Wenn Lakehouses in deinen Zielrollen erwähnt werden, ergänze das Delta-Lake-Material der Databricks Academy.
Wenn du eher ins Analytics Engineering willst als ins Pipeline Engineering, tausche den Cloud-Pfad gegen die fortgeschrittenen Module von dbt Learn.
So wählst du die richtige Ressource
Der richtige Einstieg hängt davon ab, was du schon kannst und wohin du willst. Hier ist eine kurze Entscheidungshilfe.
- Kompletter Einsteiger, noch unsicher: Starte mit DataCamps Understanding Data Engineering. Das sind 2 Stunden und kostet nichts, um es herauszufinden.
- Du kannst SQL und willst vom Analysten zum Engineer wechseln: Überspringe die SQL-Seiten und geh zu dbt Learn und dem Data Engineering Zoomcamp.
- Du hast null Python: Mach Automate the Boring Stuff oder DataCamps kostenlose Python-Ressourcen vor allem anderen hier.
- Du kennst deine Ziel-Cloud bereits: Geh direkt zu Microsoft Learn, Google Cloud Skills Boost oder AWS Skill Builder für diese Plattform.
- Du bereitest Interviews vor: Kombiniere einen kostenlosen SQL-Track mit unserem SQL-Interviewfragen-Blog.
- Du willst ein jobtaugliches Portfolio statt einem Zertifikat: Das Zoomcamp ist eine gute kostenlose Option, weil es ein echtes Projekt liefert. Schau dir zusätzlich DataCamps Liste mit Data-Engineering-Projekten an.
Wichtig, klar gesagt: "Free to audit" und "free" sind nicht dasselbe. Einige beliebte mehrteilige Zertifikate werben mit kostenlos, geben dir aber nur die Videos; bewertete Aufgaben und Zertifikat stecken hinter einem Abo von rund $49 pro Monat. Die Ressourcen in dieser Liste sind entweder vollständig kostenlos oder mit klarem Hinweis auf kostenpflichtige Teile – deshalb habe ich offene Kurse, Hersteller-Dokumentation und Tutorials Audit-Zertifikaten vorgezogen.
Abschließende Gedanken
Für die meisten, die bei null starten, sind unser Kurs Understanding Data Engineering plus ein solider SQL-Grind der richtige erste Schritt – denn alles andere baut darauf auf.
Wohin du als Nächstes abzweigst, hängt von dir ab. Ein Analyst auf dem Weg ins Engineering sollte dbt Learn priorisieren, während jemand mit einer klaren Cloud-Zielrolle nach den Grundlagen direkt den kostenlosen Herstellerpfad wählen sollte.
Ein paar ehrliche Hinweise: Community-Material wie das Zoomcamp hinkt realen Tool-Versionen hinterher. Erwarte, dass BigQuery-UI sowie Airflow- oder dbt-Versionen von Screenshots abweichen. Kostenlose Herstellerstufen sind zeitlich begrenzt – Azure listet $200 über 30 Tage, Google $300 über 90 Tage – und Cloud-Labs können geringe Kosten verursachen, wenn du das Freikontingent bei Services wie Glue oder Redshift überschreitest.
Die ehrliche Antwort auf "Reicht kostenlos?" lautet: Ja, für die Kompetenzen schon – aber du brauchst Disziplin, um die verstreuten Teile selbst zusammenzufügen. Wenn du lieber einem durchgängigen Pfad folgst, deckt unser Data Engineer Career Track dasselbe in einem Stück ab.
FAQs
Can you learn data engineering for free?
Ja, du kannst nahezu jede Data-Engineering-Kompetenz kostenlos mit offenen Kursen, Hersteller-Dokumentation und Tutorials lernen. DataCamp hat jede Menge freie Ressourcen, dbt Learn und die Apache Airflow Docs kosten nichts, und SQL-Seiten wie SQLBolt und Mode sind gratis. Die eine Kostenstelle, die sich nicht komplett vermeiden lässt, ist Infrastruktur: Cloud-Labs auf GCP, AWS oder Azure können geringe Gebühren verursachen, sobald du die zeitlich begrenzten Free Credits überschreitest. Darüber hinaus fehlt dem kostenlosen Lernen vor allem Struktur – du brauchst also Disziplin, um die verstreuten Ressourcen zu einem stimmigen Lernpfad zu verbinden.
Do I need to know Python and SQL before learning data engineering?
Du brauchst mindestens grundlegendes Python und solides SQL, bevor die meisten Data-Engineering-Kurse Sinn ergeben. dbt Learn und die Airflow-Docs setzen beides voraus. Wenn du bei null startest, arbeite zuerst Automate the Boring Stuff für Python und DataCamps SQL-Tutorials durch. SQL ist am wichtigsten, denn es taucht im Warehousing, in der Transformation und in fast jedem technischen Interview auf.
How long does it take to learn data engineering from free resources?
Ein realistischer Zeitplan vom Einsteiger bis zur Jobreife liegt bei etwa 4 bis 8 Monaten mit konsequentem Teilzeit-Lernen. Rechne mit 4 bis 8 Wochen für solide SQL- und Python-Grundlagen, dann 9+ Wochen für das Data Engineering Zoomcamp mit 5 bis 10 Stunden pro Woche, gefolgt von ein paar weiteren Wochen Spezialisierung auf eine Cloud-Plattform. Dein Tempo hängt stark von Vorerfahrung im Programmieren und deiner wöchentlichen Lernzeit ab.
Can I get a data engineering job using only free resources?
Seien wir ehrlich: Nur kostenlose Kurse abzuschließen, garantiert dir keinen Job – aber sie reichen aus, um die Kompetenzen aufzubauen, die Arbeitgeber suchen. Entscheidend ist, das Gelernte in ein Portfolio mit echten End-to-end-Projekten zu überführen. Arbeitgeber achten auf praktische Umsetzung. Koppel das kostenlose Lernen mit zwei bis drei Portfolio-Projekten, die echte Daten ingestieren, orchestrieren und transformieren. Ergänze dazu den Herstellerpfad der Cloud, die deine Zielrollen nutzen – dann bist du wettbewerbsfähig.
Autorin und Redakteurin im Bereich der Bildungstechnologie. Engagiert bei der Erforschung von Datentrends und begeistert davon, Data Science zu lernen.
