ข้ามไปยังเนื้อหาหลัก

คอร์ส

PySpark เบื้องต้น

ขั้นกลาง4 ชม.

เชี่ยวชาญ PySpark เพื่อจัดการบิ๊กดาต้าได้ง่ายๆ—เรียนรู้การประมวลผล คิวรี และปรับแต่งชุดข้อมูลขนาดใหญ่เพื่อการวิเคราะห์ทรงพลัง!

Python4 ชม.11 วิดีโอ36 แบบฝึกหัด2,850 XP33,404หนังสือรับรองความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
เมื่อดำเนินการต่อ ถือว่าคุณยอมรับ ข้อกำหนดการใช้งานและ นโยบายความเป็นส่วนตัว และยอมรับว่าข้อมูลของคุณจะถูกจัดเก็บในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในบริษัทหลายพันแห่ง

กำลังฝึกอบรมทีมอยู่ใช่ไหม?

ทดลองใช้สำหรับองค์กร

รายละเอียดคอร์ส

คอร์สนี้เหมาะอย่างยิ่งสำหรับวิศวกรข้อมูล นักวิทยาศาสตร์ข้อมูล และผู้ปฏิบัติงานด้านแมชชีนเลิร์นนิงที่ต้องการทำงานกับชุดข้อมูลขนาดใหญ่อย่างมีประสิทธิภาพ ไม่ว่าคุณจะกำลังเปลี่ยนจากเครื่องมืออย่าง Pandas หรือเพิ่งเริ่มต้นกับเทคโนโลยีบิ๊กดาต้าเป็นครั้งแรก คอร์สนี้จะมอบพื้นฐานที่มั่นคงเกี่ยวกับ PySpark และการประมวลผลข้อมูลแบบกระจายให้กับคุณ

ทำไมต้อง Spark? ทำไมตอนนี้?

ค้นพบความเร็วและความสามารถในการขยายระบบของ Apache Spark เฟรมเวิร์กอันทรงพลังที่ออกแบบมาเพื่อจัดการกับบิ๊กดาต้า ผ่านบทเรียนแบบโต้ตอบและแบบฝึกหัดลงมือปฏิบัติ คุณจะได้เห็นว่า การประมวลผลในหน่วยความจำของ Spark ทำให้มีข้อได้เปรียบเหนือเฟรมเวิร์กแบบดั้งเดิมอย่าง Hadoop ได้อย่างไร คุณจะเริ่มต้นด้วยการตั้งค่าเซสชัน Spark และเจาะลึกองค์ประกอบหลักอย่าง Resilient Distributed Datasets (RDDs) และ DataFrames เรียนรู้การกรอง การจัดกลุ่ม และการเชื่อมชุดข้อมูลได้อย่างง่ายดาย พร้อมทำงานกับตัวอย่างจากโลกจริง

ยกระดับทักษะ Python และ SQL ของคุณสำหรับ Big Data

เรียนรู้วิธีใช้ PySpark SQL เพื่อสืบค้นและจัดการข้อมูลด้วยไวยากรณ์ SQL ที่คุ้นเคย จัดการกับสคีมา ชนิดข้อมูลที่ซับซ้อน และฟังก์ชันที่ผู้ใช้กำหนดเอง (UDFs) พร้อมทั้งพัฒนาทักษะด้านการแคชและการเพิ่มประสิทธิภาพสำหรับระบบแบบกระจาย

สร้างรากฐานบิ๊กดาต้าของคุณ

เมื่อจบหลักสูตรนี้ คุณจะมีความมั่นใจในการจัดการ สืบค้น และประมวลผลบิ๊กดาต้าโดยใช้ PySpark ด้วยทักษะพื้นฐานเหล่านี้ คุณจะพร้อมก้าวไปสำรวจหัวข้อขั้นสูงอย่างแมชชีนเลิร์นนิงและการวิเคราะห์บิ๊กดาต้า

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงร่างคอร์ส

3

PySpark SQL เบื้องต้น

เจาะลึกการใช้ Spark SQL และ PySpark สำหรับการประมวลผลข้อมูลที่รองรับการขยายขนาด โดยผสานความเรียบง่ายของ SQL เข้ากับพลังการประมวลผลแบบกระจายของ PySpark เพื่อจัดการชุดข้อมูลขนาดใหญ่ได้อย่างมีประสิทธิภาพ
เริ่มบท

PySpark เบื้องต้น

เรียนคอร์สจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp for Mobile

เรียนรู้ได้ทุกที่ด้วยคอร์สบนมือถือและโจทย์เขียนโค้ด 5 นาทีประจำวัน