Track
Инжиниринг данных — одна из самых запутанных областей для обучения во всём мире данных. Нужны SQL, Python, оркестрация с Airflow, трансформация с dbt и как минимум одна облачная платформа — и бесплатные материалы по каждому из этих пунктов разбросаны по разным сайтам и сильно различаются по качеству.
Хорошая новость: большая часть того, что нужно, чтобы стать готовым к работе, доступна бесплатно или с бесплатным стартом. Плохая: бесплатные материалы разбросаны, неравномерны, и часть из них отстаёт от версий инструментов, с которыми вы действительно столкнётесь на работе. Эта подборка нужна, чтобы провести вас через всё это.
Список рассчитан на двух читателей: абсолютного новичка, которому нужен разумный порядок старта, и аналитика или разработчика, который уже знает SQL и хочет перейти к конвейерам. Написали ли вы хоть одну строку на Python или уже запускаете ETL-задания — здесь есть пункт для следующего шага.
Я отобрал материалы по практической глубине, тому, насколько хорошо они наслаиваются друг на друга, и тому, как часто практикующие инженеры данных реально рекомендуют их на r/dataengineering и в ветках по найму. Там, где у ресурса есть заметное ограничение — задержка по версиям или платный доступ за словом «бесплатно», — я это отметил. Также вы можете прочитать наше руководство как стать инженером данных — о карьерной стороне вопроса.
Итоги вкратце
| Ресурс | Тип | Уровень | Лучше всего подходит для |
|---|---|---|---|
| Understanding Data Engineering | Курс DataCamp | Новичок | Освоение терминов и ментальной модели до знакомства с инструментами |
| Учебники и блоги DataCamp | Туториалы/блоги | От начального до продвинутого | Закрытие конкретных пробелов (Airflow, dbt, ETL, SQL) |
| Практика SQL (Mode, SQLBolt, SQLZoo) | Интерактивные туториалы | От начального до продвинутого | Прокачка беглости в SQL и готовности к интервью |
| Основы Python (документация, Automate the Boring Stuff) | Документация/книга | Новичок | Скриптинг и автоматизация до конвейеров |
| Data Engineering Zoomcamp | Открытый курс на GitHub | Средний | Сквозной портфельный проект на современной базе инструментов |
| dbt Learn | Курс вендора | Средний | Analytics engineering и слой трансформации |
| Документация Apache Airflow + гайды Astronomer | Документация/руководства | Средний | Оркестрация и создание DAG |
| Бесплатное обучение Databricks Academy | Курсы вендора | От начального до среднего | Основы Delta Lake и lakehouse |
| Microsoft Learn (DP-900, DP-203) | Учебные пути вендора | От начального до продвинутого | Структурированное изучение сервисов Azure и подготовка к сертификации |
| Google Cloud Skills Boost + AWS Skill Builder | Учебные пути вендора | От среднего до продвинутого | Облачные, производственные лабораторные окружения |
Лучшие ресурсы для изучения инженерии данных
Я выстроил их так, чтобы новичок мог идти сверху вниз: сначала концепции и основы, затем — оркестрация и облака.
1. Understanding Data Engineering (курс DataCamp)
Это правильная отправная точка, если вы пока не знаете, чем инженер данных занимается весь день. Наш курс Understanding Data Engineering — это 2-часовое концептуальное введение, которое охватывает конвейеры данных, варианты хранения и различия между пакетной и потоковой обработкой — без кода.
Он намеренно нетехнический — в этом смысл. Вы поймёте терминологию, которую все остальные ресурсы из списка предполагают по умолчанию: ETL против ELT, хранилища данных против озёр и место оркестрации в этом всем.
Очевидное ограничение: он не научит вас что-то строить. Считайте это картой, а не путешествием, и сочетайте с практикой из ресурсов ниже.
- Уровень: новичок
- Формат: интерактивный курс, 2 часа
- Лучше всего подходит для: тем, кто решает, подходит ли им инжиниринг данных, прежде чем тратить время на инструменты
Начните курс: Understanding Data Engineering.
2. Учебники и блоги DataCamp
Когда вы уже что-то строите, наши бесплатные учебники и блоги — самый быстрый способ закрыть конкретный пробел без полноценного курса. Они написаны для момента, когда вы застряли на одном инструменте.
Пара рекомендаций: наш туториал по Apache Airflow пошагово проводит через создание DAG, а туториал по dbt охватывает модели, тесты и документацию с запускаемыми примерами. Для подготовки к собеседованию пост с вопросами по SQL — действительно полезный список для повторения.
Честная оговорка: сборник туториалов — это не учебный план. Нужен другой ресурс для порядка, поэтому я предлагаю использовать их как дополнение к структурированным курсам, а не замену.
- Уровень: от начального до продвинутого
- Формат: бесплатные письменные туториалы и блоги, по 10–30 минут
- Лучше всего подходит для: закрытия конкретных пробелов по Airflow, dbt, SQL или ETL в рамках более крупного курса
Читайте туториалы: туториалы по инженерии данных DataCamp.
3. Практика SQL: Mode, SQLBolt, SQLZoo и LeetCode
SQL — самый важный навык инженера данных, и лучшая бесплатная практика распределена по четырём сайтам, каждый из которых хорошо делает своё дело. Единственного победителя нет, стоит комбинировать.
Комбинация, которую чаще всего рекомендуют на r/dataengineering, выглядит так:
- DataCamp — для курсов, вебинаров и туториалов по SQL. Многие главы курсов бесплатны, а учебники и блоги всегда бесплатны.
- SQLBolt — для самых азов, с интерактивными уроками в браузере и без регистрации.
- Mode Analytics SQL Tutorial — для практических запросов по реальным аналитическим наборам данных, что ближе к реальной работе.
- SQLZoo — для прогрессивных задач-пазлов с нарастающей сложностью.
- Трек SQL на LeetCode — для задач в стиле интервью от простых к сложным, хотя многие из них за премиум-подпиской.
W3Schools SQL подойдёт как быстрая справка, но слишком поверхностен для обучения. Реальный недостаток всех этих ресурсов — они не учат тюнингу производительности SQL на масштабе; это приходит только при работе с настоящим хранилищем.
- Уровень: от начального до продвинутого
- Формат: интерактивные упражнения в браузере, бесплатно (у LeetCode есть платный премиум)
- Лучше всего подходит для: развития беглости в SQL с нуля и подготовки к техинтервью
Начните практику: SQL for Absolute Beginners.
4. Основы Python: документация, Automate the Boring Stuff
Инжиниринг данных держится на Python, поэтому до Airflow или Spark нужно уверенно владеть скриптингом, файлами и функциями. Лучшие основы Python действительно бесплатны, без уловок с «аудитом».
Для абсолютных новичков Automate the Boring Stuff with Python — полноценная книга, доступная бесплатно по Creative Commons, и её фокус на работе с файлами, веб-скрапинге и автоматизации таблиц отлично ложится на реальные задачи по загрузке данных.
Когда вы уже пишете скрипты, канал Corey Schafer на YouTube покрывает Python и инструменты вроде Git и Docker на уровне, который не дотягивают многие платные курсы, а официальный учебник на Python.org — авторитетная справка, когда нужно точное поведение. Минус документации и YouTube — отсутствие выстроенного пути, потребуется дисциплина.
- Уровень: новичок
- Формат: бесплатная книга, видео, интерактивные упражнения и официальная документация
- Лучше всего подходит для: достижения уверенного уровня в скриптинге до знакомства с инструментами конвейеров
Читайте книгу: Automate the Boring Stuff with Python.
5. Data Engineering Zoomcamp (DataTalks.Club)
Этот ресурс я бы рекомендовал тем, кто меняет карьеру и хочет реальный портфельный проект — его чаще всего называют лучшим бесплатным сквозным курсом по инженерии данных на Reddit и LinkedIn. Это поддерживаемый сообществом, открытый 9-недельный буткэмп-курикулум, полностью размещённый на GitHub.
Модули охватывают современный стек в порядке, в котором вы встретите его на работе: загрузка данных, оркестрация с Airflow, витрины на BigQuery и Postgres, пакетная и потоковая обработка с Kafka, трансформация с dbt и инфраструктура с Terraform. Всё работает на реальных наборах данных и облачных развёртываниях, а бесплатный сертификат выдаётся за выполнение домашек и капстоуна.
Две честные оговорки. Это курс среднего уровня, предполагающий базовый Python, базовый SQL и некоторый комфорт с командной строкой, а трудозатраты реальны — по 5–10 часов в неделю в течение 9+ недель. Поскольку им управляет сообщество, в GitHub Issues регулярно отмечают, что интерфейс BigQuery и версии Airflow или dbt ушли вперёд от скриншотов, а разделы Terraform — крутой подъём, если вы никогда не трогали DevOps.
- Уровень: средний
- Формат: открытый курс на GitHub, 9+ недель, бесплатно, включая сертификат
- Лучше всего подходит для: создания одного сквозного портфельного проекта, охватывающего весь современный стек
Начните курс: Data Engineering Zoomcamp на GitHub.
6. dbt Learn
dbt Learn — ресурс по слою трансформации; его основные курсы в формате self-paced бесплатны. Если вы уже знаете SQL и хотите перейти в analytics engineering, вам сюда.
Курс Fundamentals охватывает моделирование, тесты и документацию, а отдельные модули показывают работу dbt с BigQuery, Snowflake и Redshift. Появились новые модули по dbt с Iceberg и открытыми табличными форматами — полезно, если ваша целевая компания использует lakehouse.
Очевидное ограничение — охват. dbt Learn обучает только слою трансформации и моделирования, предполагает рабочий SQL и базовое понимание многомерного моделирования и не затрагивает оркестрацию или загрузку вовсе.
- Уровень: средний
- Формат: курсы вендора в собственном темпе, основное содержимое бесплатно
- Лучше всего подходит для: analytics engineering и освоения трансформационного конвейера в dbt
Начните обучение: dbt Learn.
7. Документация Apache Airflow и гайды Astronomer
Airflow — оркестратор, с которым вы почти наверняка столкнётесь на работе, и его официальная документация бесплатна и подробна. В ней есть основные концепции, создание DAG, операторы, расписания и варианты деплоя.
Одна документация может казаться абстрактной — здесь выручат дополнительные руководства Astronomer.io. Они добавляют паттерны деплоя, подходы к тестированию и конкретные ETL-примеры, которых нет в референсе, и тоже бесплатны, хоть облачная платформа Astronomer платная.
Честный минус — кривая обучения. Документация предполагает уверенное чтение Python, а разделы о продакшен-деплое опираются на знания Kubernetes и Helm, так что это обязательное чтение после освоения баз, а не с нуля. Если нужен более мягкий вход, начните с нашего туториала по Airflow.
- Уровень: средний
- Формат: бесплатная официальная документация плюс бесплатные гайды вендора
- Лучше всего подходит для: изучения оркестрации и создания DAG, когда вы уже знаете Python
Читайте документацию: документация Apache Airflow.
8. Бесплатные тренинги Databricks Academy
Databricks Academy предлагает бесплатные курсы в собственном темпе — хороший вход в мир lakehouse, который всё чаще встречается в вакансиях. Регистрация бесплатна, и несколько вводных курсов доступны сразу.
В бесплатный уровень входит «Get Started with Databricks» про рабочее пространство и ноутбуки, основы для SQL-аналитиков и BI, и введение в Delta Lake. Для новичка материал по Delta Lake — самая полезная часть, потому что объясняет, зачем нужны lakehouse, а не только как кликать в UI.
Но более глубокие, ролевые треки по инженерии данных часто за paywall или доступны только через аккаунт работодателя. Считайте бесплатные курсы фундаментом, а не полной дорожкой инженера.
- Уровень: от начального до среднего
- Формат: курсы вендора в собственном темпе, бесплатно по регистрации
- Лучше всего подходит для: основы Delta Lake и lakehouse
Начните обучение: Databricks Academy.
9. Microsoft Learn: DP-900 и DP-203
Microsoft Learn размещает полностью бесплатный контент по двум трекам данных в Azure — это самый структурированный бесплатный путь в экосистему одного облака. Никаких уловок с «аудитом»: учебные модули действительно бесплатны.
Пути разделены по уровню:
- Azure Data Fundamentals (DP-900) — начальный путь, охватывающий базы данных, аналитику и ключевые сервисы данных Azure.
- Azure Data Engineer Associate (DP-203) — средний/продвинутый путь по Azure Synapse, Data Factory, Databricks, Delta Lake и Stream Analytics.
Бесплатный аккаунт Azure даёт ограниченные по времени кредиты — указано $200 на 30 дней плюс всегда-бесплатный уровень для отдельных сервисов — так что можно практиковаться без затрат. Главное замечание сообщества: оба пути сильно ориентированы на экзамен, поэтому это отличная подготовка к сертификации, но иногда они «учат под тест», а не под реальные, «грязные» задачи.
- Уровень: от начального (DP-900) до продвинутого (DP-203)
- Формат: бесплатные учебные пути вендора на Microsoft Learn
- Лучше всего подходит для: структурированного, сертификационно-ориентированного входа в сервисы данных Azure
Начните обучение: путь Microsoft Learn DP-900.
10. Google Cloud Skills Boost и AWS Skill Builder
Если вы уже знаете, в каком облаке хотите работать, и Google, и AWS предлагают производственные лабораторные окружения, которым не равен ни один бесплатный MOOC. Это самые близкие к реальной работе бесплатные ресурсы.
Google Cloud Skills Boost содержит путь Professional Data Engineer с лабами по BigQuery, Dataflow, Dataproc, Pub/Sub и Composer. AWS Skill Builder предлагает план Data Engineering on AWS, охватывающий S3, Glue, EMR, Redshift, Kinesis, Lambda и Lake Formation.
Бесплатные уровни реальны, но ограничены. На обеих платформах часть продвинутых лаб и квестов требует подписки или кредитов, а запуск лаб на реальных сервисах может приводить к небольшим списаниям при превышении бесплатного уровня — например, в Glue или Redshift. У Google для новых пользователей заявлено $300 кредитов на 90 дней, и на обеих платформах пользователи отмечают, что инструкции лаб иногда отстают от текущего UI консоли.
- Уровень: от среднего до продвинутого
- Формат: бесплатные учебные пути и лабы вендора, с платными уровнями для продвинутого контента
- Лучше всего подходит для: облачной, практической работы в окружениях, близких к продакшену
Начните обучение: путь Google Cloud Skills Boost для Data Engineer и AWS Skill Builder.
Предложенный маршрут обучения
Эти ресурсы наслаиваются друг на друга, поэтому вот порядок, которого я бы придерживался, начиная с нуля.
Этап 1: Освойте концепции и основы
Начните с нашего курса Understanding Data Engineering, чтобы выучить терминологию, затем прокачайте два навыка, нужных в каждой работе: SQL и Python. Пройдите SQLBolt, затем Mode SQL Tutorial для запросов, и прочтите Automate the Boring Stuff для скриптинга.
Не торопитесь. Почти все, кому потом тяжело на Zoomcamp, недотянули SQL или Python именно здесь. Если подумаете о подписке, трек DataCamp Professional Data Engineer in Python здесь очень рекомендован.
Этап 2: Соберите один сквозной проект
Когда вы уверенно пишете на SQL и Python, Data Engineering Zoomcamp — место, где знания превращаются в портфолио. Он заставляет вас потрогать загрузку, оркестрацию, витрины и трансформацию в одном проекте — именно этого хочет нанимающий менеджер.
Опирайтесь на документацию Airflow и наш туториал по dbt, когда модуль Zoomcamp идёт быстрее, чем вам хотелось бы.
Этап 3: Специализируйтесь на платформе
После Zoomcamp выберите облако, которое используют целевые вакансии, и углубляйтесь по пути вендора: Microsoft Learn для Azure, Google Cloud Skills Boost для GCP или AWS Skill Builder для AWS. Если в описаниях ролей встречается lakehouse, добавьте материалы по Delta Lake из Databricks Academy.
Если вы нацелены на analytics engineering, а не на pipeline engineering, замените облачный путь на продвинутые модули dbt Learn.
Как выбрать правильный ресурс
Правильная отправная точка полностью зависит от того, что вы уже знаете и куда хотите прийти. Краткий гид по выбору:
- Полный новичок и не уверены, ваше ли это: начните с Understanding Data Engineering от DataCamp. Это 2 часа и бесплатно — чтобы понять.
- Вы знаете SQL и хотите перейти из аналитика в инженера: пропустите SQL-сайты и идите на dbt Learn и Data Engineering Zoomcamp.
- У вас нулевой Python: пройдите Automate the Boring Stuff или бесплатные ресурсы по Python от DataCamp прежде всего остального.
- Вы уже знаете целевое облако: сразу идите на Microsoft Learn, Google Cloud Skills Boost или AWS Skill Builder по этой платформе.
- Готовитесь к интервью: сочетайте бесплатный трек по SQL с нашим блогом с вопросами по SQL для интервью.
- Вам нужен готовый к трудоустройству портфель, а не сертификат: Zoomcamp — хороший бесплатный вариант, потому что даёт реальный проект; также посмотрите список проектов по инженерии данных от DataCamp.
Важно сказать прямо: «free to audit» и «бесплатно» — не одно и то же. Некоторые популярные многокурсовые сертификаты рекламируются как бесплатные, но дают только видео; проверяемые задания и сертификат — за подпиской около $49 в месяц. Ресурсы в этом списке либо полностью бесплатны, либо с бесплатным стартом и чётко помеченными платными частями, поэтому я сделал ставку на открытые курсы, документацию вендоров и туториалы, а не на «аудит-версии» сертификатов.
Заключение
Для большинства начинающих с нуля наш курс Understanding Data Engineering плюс упорная работа над SQL — правильный первый шаг, потому что всё остальное опирается на эту базу.
Дальше путь зависит от вас. Аналитику, переходящему в инженерию, стоит приоритизировать dbt Learn, а тому, кто нацелен на роль в конкретном облаке, — сразу идти по бесплатному пути вендора после освоения основ.
Пара честных оговорок. Материалы, поддерживаемые сообществом, как Zoomcamp, отстают от реальных версий инструментов, так что ожидайте, что UI BigQuery и версии Airflow или dbt будут отличаться от скриншотов. Бесплатные уровни у вендоров ограничены по времени: у Azure — $200 на 30 дней, у Google — $300 на 90 дней, а облачные лабы могут привести к небольшим списаниям при превышении бесплатных лимитов в сервисах вроде Glue или Redshift.
Честный ответ на вопрос «хватит ли бесплатного?» — да, для навыков хватит, но потребуется дисциплина, чтобы самостоятельно собрать разбросанные части в единое целое. Если вам комфортнее идти по одному структурированному маршруту, наш карьерный трек Data Engineer покрывает то же в одном месте.
FAQs
Можно ли выучить инженерию данных бесплатно?
Да, почти все навыки инженера данных можно выучить бесплатно, используя открытые курсы, документацию вендоров и туториалы. У DataCamp много бесплатных ресурсов, dbt Learn и документация Apache Airflow ничего не стоят, а сайты по SQL вроде SQLBolt и Mode — бесплатны. Единственная статья расходов, которую сложно избежать полностью, — инфраструктура: запуск облачных лабораторий в GCP, AWS или Azure может приводить к небольшим списаниям, когда вы превышаете ограниченные по времени бесплатные кредиты. Кроме того, главный пробел в бесплатном обучении — это структура, поэтому вам понадобится дисциплина, чтобы собрать разрозненные ресурсы в связный путь.
Нужно ли знать Python и SQL перед изучением инженерии данных?
Вам нужны как минимум базовый Python и уверенный SQL, прежде чем большинство курсов по инженерии данных будут иметь смысл. И dbt Learn, и документация Airflow предполагают рабочие знания обоих. Если вы начинаете с нуля, сначала пройдите Automate the Boring Stuff по Python и туториалы DataCamp по SQL. SQL важнее всего, потому что он нужен в витринах, трансформации и почти в каждом техническом интервью.
Сколько времени занимает изучение инженерии данных по бесплатным ресурсам?
Реалистичный срок от новичка до готовности к работе — примерно 4–8 месяцев при стабильных занятиях в свободное время. Закладывайте 4–8 недель на прочные основы SQL и Python, затем 9+ недель на Data Engineering Zoomcamp по 5–10 часов в неделю, а после — ещё несколько недель на специализацию по облачной платформе. Скорость сильно зависит от вашего прошлого опыта программирования и того, сколько времени вы можете уделять еженедельно.
Можно ли получить работу инженером данных, используя только бесплатные ресурсы?
Будем откровенны: прохождение только бесплатных курсов само по себе не гарантирует работу, но их достаточно, чтобы выстроить навыки, за которые нанимают. Ключ — превратить изученное в портфолио с реальными сквозными проектами. Работодателей волнует прикладная способность, поэтому сочетайте бесплатное обучение с двумя-тремя проектами, которые загружают, оркестрируют и трансформируют реальные данные. Добавьте путь вендора для платформы, которую используют целевые роли, — и вы будете конкурентоспособны.