After doing these courses, I feel confident creating professional visualizations and dashboards
Descrizione del corso
Porta le tue competenze con Polars a livello di produzione. Impara a leggere i piani di query e a sfruttare al massimo l'ottimizzatore, a lavorare in modo efficiente con sorgenti Parquet, CSV e database, e a usare dtypes avanzati come List, Struct, Categorical ed Enum. Inoltre, eseguirai in streaming query di grandi dimensioni su disco, elaborerai i dati in batch e costruirai pipeline testabili con asserzioni integrate. Alla fine sarai in grado di creare workflow di dati ad alte prestazioni in grado di gestire insiemi di dati di qualsiasi dimensione.
Prerequisiti
Curriculum
Programma del corso
1
Approfondimento sull'ottimizzazione delle query
Scopri come mantenere le query lazy per la massima ottimizzazione, leggere e interpretare i piani di query e sbloccare fast path con il profiling e i dati ordinati.
- Esecuzione efficace delle query50 XP
- Anteprima dei dati in modo lazy100 XP
- Riepilogo dei prestiti digitali100 XP
- Raccogliere due report insieme100 XP
- Ottimizzazione e piani di query50 XP
- Leggere il piano ingenuo100 XP
- Leggere il piano ottimizzato100 XP
- Cosa fa davvero l'ottimizzazione delle query50 XP
- Sfruttare al massimo l'ottimizzazione50 XP
- Pivot lazy in formato wide100 XP
- Profilazione di una query lazy100 XP
- Filtro fast-path su dati ordinati100 XP
2
Input e output dei dati efficienti
Impara a leggere e scrivere file Parquet, a fare il parsing di CSV disordinati, a effettuare lo scan di insiemi di dati multifile e con partizioni hive e a interrogare database da Polars.
3
Dtypes avanzati per analisi ottimali
Questo capitolo tratta il lavoro con colonne List e Struct, la codifica di stringhe ripetute come dtypes Categorical ed Enum e la riduzione dell'uso di memoria tramite downcasting numerico.
4
Lavorare con Polars su larga scala
Impara a usare i motori di streaming e GPU, a riversare direttamente su disco i risultati di query di grandi dimensioni con partizionamento e a testare le pipeline con le asserzioni integrate di Polars.
Scalare e ottimizzare le pipeline di dati con Polars
Corso
completato

