Build your ultimate AI agent
Mô tả khóa học
Đưa kỹ năng Polars của bạn lên quy mô sản xuất. Học cách đọc kế hoạch truy vấn và khai thác tối đa bộ tối ưu hóa, làm việc hiệu quả với nguồn dữ liệu Parquet, CSV và cơ sở dữ liệu, và tận dụng các dtype nâng cao như List, Struct, Categorical và Enum. Bạn cũng sẽ stream các truy vấn lớn xuống đĩa, xử lý dữ liệu theo lô, và xây dựng pipeline có thể kiểm thử với các assertion tích hợp sẵn. Kết thúc khóa học, bạn sẽ đủ khả năng xây dựng quy trình dữ liệu hiệu năng cao xử lý được bộ dữ liệu ở mọi kích thước.
Yêu cầu tiên quyết
Chương trình học
Đề cương khóa học
1
Đi sâu vào tối ưu hóa truy vấn
Học cách giữ truy vấn ở chế độ lazy để tối ưu tối đa, đọc và diễn giải kế hoạch truy vấn, và mở khóa các đường chạy nhanh bằng profiling và dữ liệu đã sắp xếp.
- Thực thi truy vấn hiệu quả50 XP
- Xem nhanh dữ liệu theo cách lười (lazy)100 XP
- Tổng hợp lượt mượn kỹ thuật số100 XP
- Thu thập hai báo cáo cùng lúc100 XP
- Tối ưu hóa và kế hoạch truy vấn50 XP
- Đọc naive plan100 XP
- Đọc kế hoạch đã tối ưu100 XP
- Truy vấn được tối ưu thực sự làm gì50 XP
- Khai thác tối đa khả năng tối ưu hóa50 XP
- Pivot lười sang định dạng rộng100 XP
- Hồ sơ hiệu năng cho một truy vấn lazy100 XP
- Lọc nhanh trên dữ liệu đã sắp xếp100 XP
2
Nhập và xuất dữ liệu hiệu quả
Học cách đọc và ghi tệp Parquet, phân tích CSV lộn xộn, quét bộ dữ liệu nhiều tệp và phân vùng dạng hive, và truy vấn cơ sở dữ liệu trực tiếp từ Polars.
3
Dtypes nâng cao cho phân tích tối ưu
Chương này đề cập đến làm việc với cột List và Struct, mã hóa chuỗi lặp lại dưới dạng dtype Categorical và Enum, và giảm sử dụng bộ nhớ thông qua downcast kiểu số.
4
Làm việc với Polars ở quy mô lớn
Học cách dùng engine streaming và GPU, ghi trực tiếp kết quả truy vấn lớn xuống đĩa với phân vùng, và kiểm thử pipeline bằng các assertion tích hợp của Polars.
Mở rộng và tối ưu hóa pipeline dữ liệu với Polars
Hoàn
thành khóa học

