Build your ultimate AI agent
Deskripsi Kursus
Siap menangani data dunia nyata dalam skala besar? Kursus ini mengajarkan Anda mentransformasi himpunan data besar menggunakan Spark SQL dan PySpark di Databricks. Pelajari cara membentuk dan membersihkan data, menjalankan agregasi dengan join yang dioptimalkan, serta menerapkan window function untuk analitik lanjut. Anda juga akan menyiapkan streaming berbasis file dengan checkpoint tahan gangguan dan menyimpan hasil sebagai tabel Delta. Pada akhir kursus, Anda akan mengorkestrasi pipeline produksi multi-langkah dengan Databricks Workflows dan Lakeflow Declarative Pipelines.
Prasyarat
Kurikulum
Garis besar kursus
1
Memuat dan Membentuk Data
Dalam bab ini, Anda akan belajar bekerja dengan notebook Databricks, memuat data CSV ke dalam Spark DataFrame, dan membentuk data menggunakan PySpark dan SQL.
2
Pembersihan Data dan Optimasi
Pelajari cara mendefinisikan skema secara eksplisit, membangun pipeline pembersihan data, dan mengoptimalkan kinerja kueri dengan broadcast join.
3
Analitik dan Pipeline Produksi
Pelajari cara menghitung total berjalan dan peringkat dengan window function, membangun pipeline streaming, dan menerapkan workflow produksi.
Transformasi Data dengan Spark SQL di Databricks
Kursus
Selesai

