Build your ultimate AI agent
รายละเอียดคอร์ส
คอร์สนี้เหมาะอย่างยิ่งสำหรับวิศวกรข้อมูล นักวิทยาศาสตร์ข้อมูล และผู้ปฏิบัติงานด้านแมชชีนเลิร์นนิงที่ต้องการทำงานกับชุดข้อมูลขนาดใหญ่อย่างมีประสิทธิภาพ ไม่ว่าคุณจะกำลังเปลี่ยนจากเครื่องมืออย่าง Pandas หรือเพิ่งเริ่มต้นกับเทคโนโลยีบิ๊กดาต้าเป็นครั้งแรก คอร์สนี้จะมอบพื้นฐานที่มั่นคงเกี่ยวกับ PySpark และการประมวลผลข้อมูลแบบกระจายให้กับคุณ
ทำไมต้อง Spark? ทำไมตอนนี้?
ค้นพบความเร็วและความสามารถในการขยายระบบของ Apache Spark เฟรมเวิร์กอันทรงพลังที่ออกแบบมาเพื่อจัดการกับบิ๊กดาต้า ผ่านบทเรียนแบบโต้ตอบและแบบฝึกหัดลงมือปฏิบัติ คุณจะได้เห็นว่า การประมวลผลในหน่วยความจำของ Spark ทำให้มีข้อได้เปรียบเหนือเฟรมเวิร์กแบบดั้งเดิมอย่าง Hadoop ได้อย่างไร คุณจะเริ่มต้นด้วยการตั้งค่าเซสชัน Spark และเจาะลึกองค์ประกอบหลักอย่าง Resilient Distributed Datasets (RDDs) และ DataFrames เรียนรู้การกรอง การจัดกลุ่ม และการเชื่อมชุดข้อมูลได้อย่างง่ายดาย พร้อมทำงานกับตัวอย่างจากโลกจริงยกระดับทักษะ Python และ SQL ของคุณสำหรับ Big Data
เรียนรู้วิธีใช้ PySpark SQL เพื่อสืบค้นและจัดการข้อมูลด้วยไวยากรณ์ SQL ที่คุ้นเคย จัดการกับสคีมา ชนิดข้อมูลที่ซับซ้อน และฟังก์ชันที่ผู้ใช้กำหนดเอง (UDFs) พร้อมทั้งพัฒนาทักษะด้านการแคชและการเพิ่มประสิทธิภาพสำหรับระบบแบบกระจายสร้างรากฐานบิ๊กดาต้าของคุณ
เมื่อจบหลักสูตรนี้ คุณจะมีความมั่นใจในการจัดการ สืบค้น และประมวลผลบิ๊กดาต้าโดยใช้ PySpark ด้วยทักษะพื้นฐานเหล่านี้ คุณจะพร้อมก้าวไปสำรวจหัวข้อขั้นสูงอย่างแมชชีนเลิร์นนิงและการวิเคราะห์บิ๊กดาต้าข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
Apache Spark และ PySpark เบื้องต้น
แนะนำ PySpark และการประมวลผลแบบกระจายในเบื้องต้น ส่วนนี้จะแนะนำ PySpark, PySpark DataFrame และ RDD
- PySpark เบื้องต้น50 XP
- การสร้าง SparkSession100 XP
- โหลดข้อมูลสำมะโนประชากร100 XP
- PySpark DataFrames เบื้องต้น50 XP
- ความสามารถในการขยายขนาดและประสิทธิภาพ50 XP
- การอ่านไฟล์ CSV และการทำ Aggregation100 XP
- การกรองข้อมูลตามบริษัท100 XP
- เพิ่มเติมเกี่ยวกับ Spark DataFrames50 XP
- การอนุมาน Schema และการกรองข้อมูล100 XP
- การเขียน Schema โดยตรง100 XP
2
PySpark ใน Python
ต่อยอดจาก DataFrame และชนิดข้อมูลที่ซับซ้อน ส่วนนี้จะขยายความสามารถของ DataFrame ใน PySpark และแนะนำแนวคิด Spark SQL เพิ่มเติม
3
PySpark SQL เบื้องต้น
เจาะลึกการใช้ Spark SQL และ PySpark สำหรับการประมวลผลข้อมูลที่รองรับการขยายขนาด โดยผสานความเรียบง่ายของ SQL เข้ากับพลังการประมวลผลแบบกระจายของ PySpark เพื่อจัดการชุดข้อมูลขนาดใหญ่ได้อย่างมีประสิทธิภาพ
PySpark เบื้องต้น
เรียนจบแล้ว

