Build your ultimate AI agent
Описание курса
Готовы работать с реальными данными в больших масштабах? Этот курс научит вас преобразовывать крупные наборы данных с помощью Spark SQL и PySpark в Databricks. Вы освоите формирование и очистку данных, научитесь выполнять агрегации с оптимизированными соединениями и применять оконные функции для продвинутой аналитики. Кроме того, вы настроите потоковую обработку файлов с отказоустойчивыми контрольными точками и сохранение результатов в виде таблиц Delta. В итоге вы сможете самостоятельно оркестрировать многошаговые производственные пайплайны с помощью Databricks Workflows и Lakeflow Declarative Pipelines.
Предварительные требования
Программа
Структура курса
1
Загрузка и подготовка данных
В этой главе вы научитесь работать с ноутбуками Databricks, загружать CSV-данные в Spark DataFrames и преобразовывать данные с помощью PySpark и SQL.
- Работа с ноутбуками Databricks50 XP
- Знакомство с ноутбуками Databricks50 XP
- Загрузка первого набора данных100 XP
- Изучение журналов драйвера100 XP
- Преобразование данных с помощью PySpark и SQL50 XP
- Работа с данными в PySpark100 XP
- Анализ данных с помощью SQL100 XP
- Временные представления: как они работают50 XP
2
Очистка данных и оптимизация
Вы узнаете, как задавать явные схемы, выстраивать пайплайн очистки данных и оптимизировать производительность запросов с помощью широковещательных соединений.
3
Аналитика и производственные пайплайны
Вы научитесь вычислять нарастающие итоги и рейтинги с помощью оконных функций, строить потоковые пайплайны и разворачивать производственные рабочие процессы.
Преобразование данных с помощью Spark SQL в Databricks
Курс
завершён

