700+ courses, half price
コースの説明
Polars のスキルを本番環境レベルに引き上げましょう。クエリプランの読み方や最適化機能の活用方法、Parquet・CSV・データベースソースとの効率的な連携、List・Struct・Categorical・Enum などの高度なデータ型の利用について学びます。また、大規模なクエリをディスクにストリーミングし、データをバッチ処理し、組み込みのアサーションを使ってテスト可能なパイプラインを構築する方法も習得します。コース終了後は、あらゆる規模のデータセットに対応できる高性能なデータワークフローを構築できるようになります。
前提条件
カリキュラム
コース概要
1
クエリ最適化の詳細
最大限の最適化を実現するためにクエリをレイジーに保つ方法、クエリプランの読み方と解釈、プロファイリングとソート済みデータを活用した高速処理の方法を学びます。
2
効率的なデータの入出力
Parquet ファイルの読み書き、複雑な CSV の解析、マルチファイルおよびハイブパーティション形式のデータセットのスキャン、Polars からのデータベースへのクエリ実行について学びます。
3
最適な分析のための高度なデータ型
List 列と Struct 列の操作、繰り返し文字列の Categorical・Enum データ型へのエンコード、数値のダウンキャストによるメモリ使用量の削減について学びます。
4
大規模環境での Polars の活用
ストリーミングエンジンと GPU エンジンの使用方法、パーティション分割を伴う大規模なクエリ結果のディスクへの直接書き出し、Polars の組み込みアサーションを使ったパイプラインのテストについて学びます。
Polars によるデータパイプラインのスケーリングと最適化
コース修了

