Track
Ścieżka nauki inżynierii danych należy do najbardziej chaotycznych w całej branży data. Potrzebujesz SQL, Pythona, orkiestracji z Airflow, transformacji z dbt oraz przynajmniej jednej platformy chmurowej — a darmowe materiały do każdego z tych tematów są porozrzucane po różnych stronach i mają różną jakość.
Dobra wiadomość jest taka, że większość tego, czego potrzebujesz, by być gotowym do pracy, jest dostępna za darmo lub z darmowym startem. Zła — że te darmowe treści są rozproszone, nierówne, a część z nich odstaje od wersji narzędzi, których faktycznie użyjesz w pracy. Ten przegląd ma dać ci przez to wszystko sensowną ścieżkę.
Ta lista jest dla dwóch typów czytelników: całkowitego początkującego, który chce rozsądnej kolejności startowej, oraz analityka lub developera, który zna już SQL i chce wejść w potoki danych. Niezależnie od tego, czy nigdy nie napisałeś linijki Pythona, czy już wysyłasz zadania ETL — znajdziesz tu pozycję na swój kolejny krok.
Wybrałem je za praktyczną głębię, to jak dobrze się na siebie nakładają i jak często działający inżynierowie danych faktycznie je polecają na r/dataengineering i w wątkach rekrutacyjnych. Tam, gdzie zasób ma realne ograniczenia — czy to opóźnienie wersji, czy paywall schowany za słowem „free” — mówię o tym wprost. Możesz też przeczytać nasz przewodnik po tym, jak zostać inżynierem danych, żeby zobaczyć perspektywę kariery.
TL;DR
| Zasób | Typ | Poziom | Najlepsze do |
|---|---|---|---|
| Understanding Data Engineering | Kurs DataCamp | Początkujący | Zdobycie słownictwa i modelu myślowego przed pracą z narzędziami |
| Samouczki i blogi DataCamp | Samouczki/blogi | Od początkującego do zaawansowanego | Łatanie konkretnych luk (Airflow, dbt, ETL, SQL) |
| Ćwiczenia z SQL (Mode, SQLBolt, SQLZoo) | Interaktywne samouczki | Od początkującego do zaawansowanego | Budowanie płynności w SQL i przygotowanie do rozmów |
| Podstawy Pythona (dokumentacja, Automate the Boring Stuff) | Dokumentacja/książka | Początkujący | Skrypty i automatyzacja przed potokami |
| Data Engineering Zoomcamp | Otwarty kurs na GitHubie | Średnio zaawansowany | Pełny projekt do portfolio w nowoczesnym stosie |
| dbt Learn | Kurs dostawcy | Średnio zaawansowany | Analytics engineering i warstwa transformacji |
| Dokumentacja Apache Airflow + poradniki Astronomer | Dokumentacja/poradniki | Średnio zaawansowany | Orkiestracja i tworzenie DAG-ów |
| Darmowe szkolenia Databricks Academy | Kursy dostawcy | Od początkującego do średnio zaawansowanego | Delta Lake i podstawy lakehouse |
| Microsoft Learn (DP-900, DP-203) | Ścieżki nauki dostawcy | Od początkującego do zaawansowanego | Ustrukturyzowane usługi danych Azure i przygotowanie do certyfikacji |
| Google Cloud Skills Boost + AWS Skill Builder | Ścieżki nauki dostawcy | Średnio zaawansowany do zaawansowanego | Chmurospecyficzne, produkcyjne środowiska labowe |
Najlepsze materiały do nauki inżynierii danych
Ułożyłem je tak, by początkujący mógł czytać od góry do dołu — zaczynając od koncepcji i fundamentów, a potem przechodząc do orkiestracji i platform chmurowych.
1. Understanding Data Engineering (kurs DataCamp)
To właściwy punkt startu, jeśli jeszcze nie wiesz, co inżynier danych robi na co dzień. Nasz kurs Understanding Data Engineering to 2‑godzinne wprowadzenie koncepcyjne, które omawia potoki danych, opcje przechowywania oraz różnice między przetwarzaniem wsadowym i strumieniowym — bez kodowania.
Jest celowo nietechniczny — i o to chodzi. Wyjdziesz z niego ze zrozumieniem słownictwa, które każdy inny zasób z tej listy zakłada, że już znasz: ETL vs ELT, hurtownie vs jeziora danych i rola orkiestracji.
Oczywiste ograniczenie jest takie, że nie nauczy cię niczego zbudować. Traktuj go jak mapę, nie podróż, i połącz z praktycznymi materiałami poniżej.
- Poziom: Początkujący
- Format: Interaktywny kurs, 2 godziny
- Najlepsze do: Sprawdzenia, czy inżynieria danych to dla ciebie, zanim poświęcisz czas na narzędzia
Rozpocznij kurs: Understanding Data Engineering.
2. Samouczki i blogi DataCamp
Gdy już coś budujesz, nasze darmowe samouczki i blogi to najszybszy sposób, by załatać konkretną lukę bez zobowiązania się do pełnego kursu. Są pisane dokładnie na te momenty, gdy utkniesz na jednym narzędziu.
Kilka poleceń: nasz samouczek Apache Airflow prowadzi przez tworzenie DAG‑ów od A do Z, a samouczek dbt obejmuje modele, testy i dokumentację z uruchamialnymi przykładami. Na etapie rozmów nasz wpis z pytaniami rekrutacyjnymi z SQL to naprawdę przydatna lista do powtórki.
Szczere zastrzeżenie: zbiór samouczków to nie program nauki. Potrzebujesz czegoś, co nada kolejność — dlatego traktuję je jako uzupełnienie kursów strukturalnych, a nie zamiennik.
- Poziom: Od początkującego do zaawansowanego
- Format: Darmowe samouczki i blogi, 10–30 minut każdy
- Najlepsze do: Uzupełniania luk w Airflow, dbt, SQL lub ETL podczas pracy z większym kursem
Czytaj samouczki: DataCamp samouczki z inżynierii danych.
3. Praktyka SQL: Mode, SQLBolt, SQLZoo i LeetCode
SQL to najważniejsza umiejętność inżyniera danych, a najlepsze darmowe ćwiczenia są rozrzucone po czterech serwisach, z których każdy robi jedną rzecz dobrze. Nie ma tu jednego zwycięzcy, więc połączyłbym je.
Kombinacja najczęściej polecana na r/dataengineering ma jasną kolejność:
- DataCamp — kursy, webinary i samouczki SQL. Wiele rozdziałów kursów jest darmowych, a samouczki i blogi są zawsze za darmo.
- SQLBolt — absolutne podstawy, interaktywne lekcje w przeglądarce bez rejestracji.
- Mode Analytics SQL Tutorial — praktyczne zapytania na realnych zbiorach analitycznych, bliższe rzeczywistej pracy.
- SQLZoo — progresywne łamigłówki, które stopniowo rosną trudnością.
- LeetCode — ścieżka SQL z zadaniami w stylu rekrutacyjnym od łatwych do trudnych, choć wiele zadań jest za subskrypcją premium.
W3Schools SQL sprawdza się jako szybka ściągawka, ale jest zbyt płytkie do nauki. Realne ograniczenie wszystkich tych źródeł: żadne nie nauczy cię strojenia wydajności SQL w skali — to złapiesz dopiero na prawdziwej hurtowni.
- Poziom: Od początkującego do zaawansowanego
- Format: Interaktywne ćwiczenia w przeglądarce, darmowe (LeetCode ma płatny tier premium)
- Najlepsze do: Budowania płynności w SQL od zera i przygotowania do rozmów technicznych
Zacznij ćwiczyć: SQL for Absolute Beginners.
4. Podstawy Pythona: dokumentacja, Automate the Boring Stuff
Inżynieria danych działa na Pythonie, więc przed Airflow czy Sparkiem musisz czuć się swobodnie w skryptach, plikach i funkcjach. Najlepsze darmowe podstawy Pythona są naprawdę darmowe — bez sztuczek z „auditem”.
Dla zupełnych początkujących Automate the Boring Stuff with Python to pełna książka dostępna bezpłatnie na licencji Creative Commons, a jej nacisk na obsługę plików, web scraping i automatyzację arkuszy świetnie przekłada się na realne zadania ingestii.
Gdy umiesz już pisać skrypty, kanał Corey’a Schafera na YouTube obejmuje Pythona oraz narzędzia jak Git i Docker — często w jakości, której nie dorównują płatne kursy, a oficjalny samouczek na Python.org to autorytatywne odniesienie, gdy chcesz poznać dokładne zachowanie. Haczyk z dokumentacją i YouTube jest taki, że żadne nie da ci ocenianej ścieżki — potrzebna będzie dyscyplina.
- Poziom: Początkujący
- Format: Darmowa książka, wideo, interaktywne ćwiczenia i oficjalna dokumentacja
- Najlepsze do: Wejścia na komfortowy poziom skryptowania przed narzędziami potoków
Przeczytaj książkę: Automate the Boring Stuff with Python.
5. Data Engineering Zoomcamp (DataTalks.Club)
To zasób, który poleciłbym osobie zmieniającej branżę do zrobienia realnego projektu do portfolio — i ten, który najczęściej bywa nazywany najlepszym darmowym, całościowym kursem inżynierii danych na Reddicie i LinkedInie. To utrzymywana przez społeczność, otwarta, 9‑tygodniowa ścieżka w stylu bootcampu, hostowana w całości na GitHubie.
Moduły pokrywają nowoczesny stos w kolejności, w jakiej spotkasz go w pracy: ingestia danych, orkiestracja z Airflow, hurtownie na BigQuery i Postgresie, wsad i stream z Kafką, transformacje w dbt i infrastruktura z Terraformem. Wszystko działa na realnych zbiorach i wdrożeniach chmurowych, a darmowy certyfikat dostajesz za prace domowe i projekt końcowy.
Dwa szczere ostrzeżenia. To kurs średnio zaawansowany, zakłada podstawy Pythona, podstawy SQL i pewną swobodę w terminalu, a zaangażowanie czasowe jest realne — 5–10 godzin tygodniowo przez 9+ tygodni. Ponieważ utrzymuje go społeczność, w issue na GitHubie regularnie pojawia się, że interfejs BigQuery i wersje Airflow lub dbt odbiegają od zrzutów ekranu, a sekcje o Terraformie są stromym wejściem, jeśli nigdy nie dotykałeś DevOpsu.
- Poziom: Średnio zaawansowany
- Format: Otwarty kurs na GitHubie, 9+ tygodni, darmowy łącznie z certyfikatem
- Najlepsze do: Zbudowania jednego end‑to‑end projektu obejmującego cały nowoczesny stos
Rozpocznij kurs: Data Engineering Zoomcamp na GitHubie.
6. dbt Learn
dbt Learn to zasób do warstwy transformacji, a jego główne kursy w tempie własnym są darmowe. Jeśli znasz już SQL i chcesz wejść w analytics engineering, to właściwy kierunek.
Kurs Fundamentals obejmuje modelowanie, testy i dokumentację, a osobne moduły prowadzą przez dbt na BigQuery, Snowflake i Redshift. Są też nowsze moduły o dbt z Iceberg i otwartymi formatami tabel, co warto znać, jeśli docelowa firma korzysta z lakehouse.
Jasne ograniczenie to zakres. dbt Learn uczy jedynie warstwy transformacji i modelowania, więc zakłada działający SQL i podstawowe zrozumienie modelowania wymiarowego, a w ogóle nie dotyka orkiestracji ani ingestii.
- Poziom: Średnio zaawansowany
- Format: Kursy dostawcy w tempie własnym, darmowe treści podstawowe
- Najlepsze do: Analytics engineering i opanowanie przepływu transformacji w dbt
Zacznij naukę: dbt Learn.
7. Dokumentacja Apache Airflow i poradniki Astronomer
Airflow to narzędzie orkiestracji, na które niemal na pewno trafisz w pracy inżyniera danych, a jego oficjalna dokumentacja jest darmowa i wyczerpująca. Obejmuje kluczowe koncepcje, tworzenie DAG‑ów, operatory, harmonogramowanie i opcje wdrożeń.
Sama dokumentacja może być abstrakcyjna — tu pomagają dodatkowe poradniki Astronomer.io. Dodają wzorce wdrożeń, podejścia do testowania i konkretne przykłady ETL, których brakuje w dokumentacji referencyjnej, i są darmowe, choć zarządzana chmura Astronomera jest płatna.
Szczerze o minusach: krzywa nauki jest stroma. Dokumentacja zakłada swobodę w Pythonie, a sekcje o wdrożeniach produkcyjnych opierają się na wiedzy o Kubernetesie i Helmie, więc to lektura obowiązkowa, gdy masz już podstawy, a nie pierwszy przystanek. Jeśli chcesz łagodniejszego startu, zacznij najpierw od naszego samouczka Airflow.
- Poziom: Średnio zaawansowany
- Format: Darmowa oficjalna dokumentacja plus darmowe poradniki dostawcy
- Najlepsze do: Nauki orkiestracji i tworzenia DAG‑ów, gdy znasz już Pythona
Czytaj dokumentację: Dokumentacja Apache Airflow.
8. Darmowe szkolenia Databricks Academy
Databricks Academy oferuje darmowe kursy w tempie własnym, które są czystym wprowadzeniem do świata lakehouse — coraz częściej pojawiającego się w ogłoszeniach. Rejestracja jest darmowa i odblokowuje kilka kursów wprowadzających.
Darmowy tier obejmuje „Get Started with Databricks” o przestrzeni roboczej i notatnikach, podstawy dla analityków SQL i BI oraz wprowadzenie do Delta Lake. Dla początkującego najcenniejsza jest Delta Lake, bo tłumaczy, po co istnieją lakehouse’y, a nie tylko jak klikać w UI.
Haczyk: głębsze, rolowe ścieżki dla inżynierów danych często są za płatnymi planami lub dostępne tylko przez konto pracodawcy. Traktuj darmowe kursy jako fundamenty, nie pełną ścieżkę inżynierską.
- Poziom: Od początkującego do średnio zaawansowanego
- Format: Kursy dostawcy w tempie własnym, darmowe po rejestracji
- Najlepsze do: Podstaw Delta Lake i lakehouse
Zacznij naukę: Databricks Academy.
9. Microsoft Learn: DP-900 i DP-203
Microsoft Learn hostuje w pełni darmowe treści dla dwóch ścieżek danych na Azure i to najbardziej ustrukturyzowana darmowa droga do usług danych jednej chmury. Nie ma tu sztuczek — moduły nauki są naprawdę darmowe.
Ścieżki dzielą się wg poziomu:
- Azure Data Fundamentals (DP-900) — ścieżka dla początkujących, obejmuje bazy danych, analitykę i kluczowe usługi danych Azure.
- Azure Data Engineer Associate (DP-203) — ścieżka od średnio zaawansowanej do zaawansowanej, obejmuje Azure Synapse, Data Factory, Databricks, Delta Lake i Stream Analytics.
Darmowe konto Azure daje kredyty ograniczone czasowo — wymienione jako 200 USD na 30 dni plus zawsze‑darmowy tier dla części usług — więc możesz ćwiczyć bez kosztów. Główna krytyka społeczności: obie ścieżki są bardzo nastawione na egzaminy, więc świetnie przygotowują do certyfikacji, ale czasem uczą „pod test”, a nie pod bałagan realnych problemów.
- Poziom: Początkujący (DP-900) do zaawansowanego (DP-203)
- Format: Darmowe ścieżki nauki dostawcy na Microsoft Learn
- Najlepsze do: Ustrukturyzowanego, certyfikacyjnego wejścia w usługi danych Azure
Zacznij naukę: Ścieżka Microsoft Learn DP-900.
10. Google Cloud Skills Boost i AWS Skill Builder
Jeśli wiesz już, że chcesz pracować na konkretnej chmurze, Google i AWS oferują środowiska labowe klasy produkcyjnej, którym żaden darmowy MOOC nie dorównuje. To najbliższe darmowe odpowiedniki temu, co faktycznie będziesz obsługiwać w pracy.
Google Cloud Skills Boost hostuje ścieżkę Professional Data Engineer z labami z BigQuery, Dataflow, Dataproc, Pub/Sub i Composer. AWS Skill Builder oferuje plan Data Engineering on AWS obejmujący S3, Glue, EMR, Redshift, Kinesis, Lambdę i Lake Formation.
Darmowe tiery są realne, ale ograniczone. Na obu platformach niektóre zaawansowane laby i questy wymagają subskrypcji lub kredytów, a uruchamianie labów na prawdziwych usługach może generować drobne koszty po przekroczeniu darmowego limitu — np. przy użyciu Glue lub Redshift. Google podaje 300 USD w kredytach na 90 dni dla nowych użytkowników, a uczący się na obu platformach zgłaszają, że instrukcje labów czasem odbiegają od aktualnego UI konsoli.
- Poziom: Średnio zaawansowany do zaawansowanego
- Format: Darmowe ścieżki nauki i laby dostawców, z płatnymi tierami dla treści zaawansowanych
- Najlepsze do: Praktyki specyficznej dla chmury w środowiskach zbliżonych do produkcyjnych
Zacznij naukę: Ścieżka Data Engineer w Google Cloud Skills Boost i AWS Skill Builder.
Sugerowana ścieżka nauki
Te zasoby się na sobie opierają, więc oto kolejność, jaką wybrałbym, zaczynając od zera.
Etap 1: Zdobądź koncepcje i fundamenty
Zacznij od kursu Understanding Data Engineering, by poznać słownictwo, a potem zbuduj dwie umiejętności potrzebne w każdej pracy: SQL i Pythona. Przerób SQLBolt, potem Mode SQL Tutorial do zapytań, a do skryptów przeczytaj Automate the Boring Stuff.
Nie spiesz się na tym etapie. Prawie wszyscy, którzy później męczą się z Zoomcampem, mają braki w solidnym SQL lub Pythonie tutaj. Jeśli kusi cię subskrypcja, ścieżka Professional Data Engineer in Python na DataCamp jest tu mocno polecana.
Etap 2: Zbuduj jeden projekt end‑to‑end
Gdy swobodnie piszesz w SQL i Pythonie, Data Engineering Zoomcamp to miejsce, gdzie zamieniasz wiedzę na portfolio. Zmusza cię do dotknięcia ingestii, orkiestracji, hurtowni i transformacji w jednym, spójnym projekcie — dokładnie tego chce zobaczyć hiring manager.
Wspieraj się dokumentacją Airflow i naszym samouczkiem dbt, kiedy moduł Zoomcampu pędzi szybciej, niż byś chciał.
Etap 3: Wyspecjalizuj się na platformie
Po Zoomcampie wybierz chmurę, której używają twoje docelowe oferty, i wejdź głęboko w ścieżkę dostawcy: Microsoft Learn dla Azure, Google Cloud Skills Boost dla GCP lub AWS Skill Builder dla AWS. Jeśli w rolach pojawiają się lakehouse’y, dodaj materiał o Delta Lake z Databricks Academy.
Jeśli celujesz bardziej w analytics engineering niż pipeline engineering, zamiast chmury postaw na zaawansowane moduły dbt Learn.
Jak wybrać właściwy zasób
Właściwy start zależy całkowicie od tego, co już umiesz i dokąd chcesz dojść. Oto szybki przewodnik decyzyjny.
- Całkowity początkujący, niepewny, czy to dla ciebie: Zacznij od kursu Understanding Data Engineering na DataCamp. To 2 godziny i nic nie kosztuje, by się przekonać.
- Znasz SQL i chcesz przejść z analityka na inżyniera: Pomiń serwisy SQL i idź do dbt Learn oraz Data Engineering Zoomcamp.
- Nie znasz Pythona: Zrób Automate the Boring Stuff albo darmowe materiały z Pythona na DataCamp przed wszystkim innym z tej listy.
- Wiesz już, na jakiej chmurze chcesz pracować: Idź prosto do Microsoft Learn, Google Cloud Skills Boost lub AWS Skill Builder dla tej platformy.
- Przygotowujesz się do rozmów: Połącz darmową ścieżkę SQL z naszym blogiem o pytaniach rekrutacyjnych z SQL.
- Chcesz portfolio gotowe do pracy, nie certyfikat: Zoomcamp to dobra darmowa opcja, bo daje realny projekt; możesz też sprawdzić listę projektów z inżynierii danych na DataCamp.
Warto to powiedzieć wprost: „free to audit” i „free” to nie to samo. Kilka popularnych wielokursowych certyfikatów reklamuje się jako darmowe, ale daje wyłącznie wideo, a oceniane zadania i certyfikat są za subskrypcją ok. 49 USD/mies. Zasoby na tej liście są w pełni darmowe lub z darmowym startem, z wyraźnie zaznaczonymi płatnymi częściami — dlatego kieruję bardziej w stronę otwartych kursów, dokumentacji dostawców i samouczków niż certyfikatów „audit‑only”.
Na koniec
Dla większości zaczynających od zera nasz kurs Understanding Data Engineering plus solidny grind z SQL to właściwy pierwszy ruch, bo wszystko inne zakłada tę bazę.
To, gdzie pójdziesz dalej, zależy od ciebie. Analityk przechodzący do inżynierii powinien priorytetyzować dbt Learn, a ktoś celujący w rolę na konkretnej chmurze — od razu przejść do darmowej ścieżki nauki tego dostawcy, gdy fundamenty są na miejscu.
Kilka szczerych zastrzeżeń. Materiały utrzymywane przez społeczność, jak Zoomcamp, odstają od realnych wersji narzędzi, więc spodziewaj się, że UI BigQuery i wersje Airflow lub dbt będą inne niż na zrzutach ekranu. Darmowe tiery dostawców są ograniczone czasowo — Azure podaje 200 USD na 30 dni, a Google 300 USD na 90 dni — a laby w chmurze mogą generować drobne koszty po przekroczeniu darmowych limitów w usługach jak Glue czy Redshift.
Szczera odpowiedź na „czy darmowe wystarczy?” brzmi: tak, jeśli chodzi o umiejętności, ale będziesz potrzebować dyscypliny, by samemu poskładać rozproszone elementy. Jeśli wolisz jedną ustrukturyzowaną ścieżkę, nasz Data Engineer career track obejmuje ten sam zakres w jednym miejscu.
FAQs
Czy można nauczyć się inżynierii danych za darmo?
Tak, niemal każdej umiejętności z inżynierii danych możesz nauczyć się za darmo, korzystając z otwartych kursów, dokumentacji dostawców i samouczków. DataCamp ma mnóstwo darmowych zasobów, dbt Learn i dokumentacja Apache Airflow nic nie kosztują, a serwisy SQL, jak SQLBolt i Mode, są darmowe. Jedyny koszt, którego nie da się całkiem uniknąć, to infrastruktura — uruchamianie labów chmurowych na GCP, AWS lub Azure może generować drobne opłaty po przekroczeniu limitów darmowych kredytów. Poza tym główną luką w darmowej nauce jest struktura, więc potrzebujesz dyscypliny, by poskładać rozproszone zasoby w spójną ścieżkę.
Czy muszę znać Pythona i SQL, zanim zacznę uczyć się inżynierii danych?
Potrzebujesz przynajmniej podstaw Pythona i solidnego SQL, zanim większość kursów z inżynierii danych zacznie mieć sens. dbt Learn i dokumentacja Airflow zakładają działającą znajomość obu. Jeśli zaczynasz od zera, najpierw przerób Automate the Boring Stuff do Pythona i samouczki SQL na DataCamp. SQL jest najważniejszy, bo pojawia się w hurtowniach, transformacjach i niemal każdej rozmowie technicznej.
Ile czasu zajmuje nauka inżynierii danych z darmowych zasobów?
Realistyczna oś czasu od początkującego do gotowego do pracy to około 4–8 miesięcy regularnej nauki po godzinach. Licz około 4–8 tygodni na zbudowanie solidnych podstaw SQL i Pythona, potem 9+ tygodni na Data Engineering Zoomcamp przy 5–10 godzinach tygodniowo, a następnie kilka tygodni specjalizacji na platformie chmurowej. Tempo mocno zależy od wcześniejszego doświadczenia programistycznego i tego, ile czasu możesz poświęcić co tydzień.
Czy mogę dostać pracę w inżynierii danych, ucząc się wyłącznie z darmowych zasobów?
Powiedzmy wprost: samo ukończenie darmowych kursów nie gwarantuje pracy, ale wystarczy, by zbudować umiejętności, których szukają pracodawcy. Kluczem jest przełożenie nauki na portfolio z prawdziwymi projektami end‑to‑end. Pracodawców obchodzi umiejętność zastosowania, więc połącz darmową naukę z dwoma–trzema projektami w portfolio, które ingestują, orkiestrują i transformują realne dane. Dodaj ścieżkę dostawcy chmury dla platformy używanej w twoich docelowych rolach, a będziesz konkurencyjny.