Build your ultimate AI agent
รายละเอียดคอร์ส
พร้อมรับมือกับข้อมูลขนาดใหญ่ในโลกจริงแล้วหรือยัง? คอร์สนี้จะสอนวิธีแปลงชุดข้อมูลขนาดใหญ่โดยใช้ Spark SQL และ PySpark ใน Databricks ตั้งแต่การจัดรูปแบบและทำความสะอาดข้อมูล การรวมข้อมูลด้วย join ที่ปรับแต่งประสิทธิภาพแล้ว ไปจนถึงการใช้ window function สำหรับการวิเคราะห์ขั้นสูง นอกจากนี้ยังครอบคลุมการตั้งค่า streaming แบบไฟล์พร้อม checkpoint ที่รองรับความเสียหาย และการบันทึกผลลัพธ์เป็น Delta table เมื่อจบคอร์ส จะสามารถจัดการ pipeline การผลิตแบบหลายขั้นตอนด้วย Databricks Workflows และ Lakeflow Declarative Pipelines ได้
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
การโหลดและจัดรูปแบบข้อมูล
บทนี้จะเรียนรู้วิธีใช้งาน Databricks notebooks โหลดข้อมูล CSV เข้าสู่ Spark DataFrames และจัดรูปแบบข้อมูลโดยใช้ PySpark และ SQL
2
การทำความสะอาดข้อมูลและการปรับแต่งประสิทธิภาพ
เรียนรู้วิธีกำหนด schema อย่างชัดเจน สร้าง pipeline สำหรับทำความสะอาดข้อมูล และปรับแต่งประสิทธิภาพคิวรีด้วย broadcast join
3
การวิเคราะห์และ Pipeline การผลิต
เรียนรู้วิธีคำนวณผลรวมสะสมและการจัดอันดับด้วย window function สร้าง streaming pipeline และนำ workflow ขึ้นสู่การใช้งานจริง
การแปลงข้อมูลด้วย Spark SQL ใน Databricks
เรียนจบแล้ว

