700+ courses, half price
Описание курса
Переведите свои навыки работы с Polars на производственный уровень. Научитесь читать планы запросов и раскрывать весь потенциал оптимизатора, эффективно работать с источниками данных в форматах Parquet, CSV и базами данных, а также использовать продвинутые типы данных: List, Struct, Categorical и Enum. Вы также освоите потоковую передачу больших запросов на диск, пакетную обработку данных и построение тестируемых конвейеров со встроенными проверками. По завершении курса вы будете готовы создавать высокопроизводительные рабочие процессы обработки данных, способные работать с наборами данных любого размера.
Предварительные требования
Программа
План курса
1
Глубокое погружение в оптимизацию запросов
Узнайте, как сохранять запросы в ленивом режиме для максимальной оптимизации, читать и интерпретировать планы запросов, а также активировать ускоренные пути выполнения с помощью профилирования и отсортированных данных.
- Эффективное выполнение запросов50 XP
- Ленивый предварительный просмотр данных100 XP
- Подсчёт цифровых выдач100 XP
- Совместный сбор двух отчётов100 XP
- Оптимизация и планы запросов50 XP
- Чтение наивного плана100 XP
- Чтение оптимизированного плана100 XP
- Что на самом деле делает оптимизация запросов50 XP
- Использование оптимизации в полной мере50 XP
- Ленивый pivot: преобразование в широкий формат100 XP
- Профилирование ленивого запроса100 XP
- Ускоренная фильтрация по отсортированным данным100 XP
2
Эффективный ввод и вывод данных
Научитесь читать и записывать файлы Parquet, разбирать «грязные» CSV-файлы, сканировать многофайловые и hive-партиционированные наборы данных, а также выполнять запросы к базам данных из Polars.
3
Продвинутые типы данных для оптимального анализа
В этой главе рассматривается работа со столбцами типов List и Struct, кодирование повторяющихся строк с помощью типов данных Categorical и Enum, а также снижение потребления памяти за счёт числового приведения типов.
4
Работа с Polars в масштабе
Узнайте, как использовать потоковый и GPU-движки, сохранять результаты больших запросов непосредственно на диск с партиционированием, а также тестировать конвейеры с помощью встроенных проверок Polars.
Масштабирование и оптимизация конвейеров данных с Polars
Курс
завершён

