ข้ามไปยังเนื้อหาหลัก

คอร์ส

PySpark เบื้องต้น

ระดับกลาง4 ชม.

เชี่ยวชาญ PySpark เพื่อจัดการบิ๊กดาต้าได้ง่ายๆ—เรียนรู้การประมวลผล คิวรี และปรับแต่งชุดข้อมูลขนาดใหญ่เพื่อการวิเคราะห์ทรงพลัง!

Python4 ชม.11 วิดีโอ36 แบบฝึกหัด2,850 XP31,028ใบแสดงความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
การดำเนินการต่อหมายความว่าคุณยอมรับ เงื่อนไขการใช้งาน, ของเรา นโยบายความเป็นส่วนตัว และข้อมูลของคุณถูกจัดเก็บไว้ในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในหลายพันบริษัท

รายละเอียดคอร์ส

คอร์สนี้เหมาะอย่างยิ่งสำหรับวิศวกรข้อมูล นักวิทยาศาสตร์ข้อมูล และผู้ปฏิบัติงานด้านแมชชีนเลิร์นนิงที่ต้องการทำงานกับชุดข้อมูลขนาดใหญ่อย่างมีประสิทธิภาพ ไม่ว่าคุณจะกำลังเปลี่ยนจากเครื่องมืออย่าง Pandas หรือเพิ่งเริ่มต้นกับเทคโนโลยีบิ๊กดาต้าเป็นครั้งแรก คอร์สนี้จะมอบพื้นฐานที่มั่นคงเกี่ยวกับ PySpark และการประมวลผลข้อมูลแบบกระจายให้กับคุณ

ทำไมต้อง Spark? ทำไมตอนนี้?

ค้นพบความเร็วและความสามารถในการขยายระบบของ Apache Spark เฟรมเวิร์กอันทรงพลังที่ออกแบบมาเพื่อจัดการกับบิ๊กดาต้า ผ่านบทเรียนแบบโต้ตอบและแบบฝึกหัดลงมือปฏิบัติ คุณจะได้เห็นว่า การประมวลผลในหน่วยความจำของ Spark ทำให้มีข้อได้เปรียบเหนือเฟรมเวิร์กแบบดั้งเดิมอย่าง Hadoop ได้อย่างไร คุณจะเริ่มต้นด้วยการตั้งค่าเซสชัน Spark และเจาะลึกองค์ประกอบหลักอย่าง Resilient Distributed Datasets (RDDs) และ DataFrames เรียนรู้การกรอง การจัดกลุ่ม และการเชื่อมชุดข้อมูลได้อย่างง่ายดาย พร้อมทำงานกับตัวอย่างจากโลกจริง

ยกระดับทักษะ Python และ SQL ของคุณสำหรับ Big Data

เรียนรู้วิธีใช้ PySpark SQL เพื่อสืบค้นและจัดการข้อมูลด้วยไวยากรณ์ SQL ที่คุ้นเคย จัดการกับสคีมา ชนิดข้อมูลที่ซับซ้อน และฟังก์ชันที่ผู้ใช้กำหนดเอง (UDFs) พร้อมทั้งพัฒนาทักษะด้านการแคชและการเพิ่มประสิทธิภาพสำหรับระบบแบบกระจาย

สร้างรากฐานบิ๊กดาต้าของคุณ

เมื่อจบหลักสูตรนี้ คุณจะมีความมั่นใจในการจัดการ สืบค้น และประมวลผลบิ๊กดาต้าโดยใช้ PySpark ด้วยทักษะพื้นฐานเหล่านี้ คุณจะพร้อมก้าวไปสำรวจหัวข้อขั้นสูงอย่างแมชชีนเลิร์นนิงและการวิเคราะห์บิ๊กดาต้า

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงสร้างคอร์ส

3

PySpark SQL เบื้องต้น

เจาะลึกการใช้ Spark SQL และ PySpark สำหรับการประมวลผลข้อมูลที่รองรับการขยายขนาด โดยผสานความเรียบง่ายของ SQL เข้ากับพลังการประมวลผลแบบกระจายของ PySpark เพื่อจัดการชุดข้อมูลขนาดใหญ่ได้อย่างมีประสิทธิภาพ
เริ่มบทเรียน

PySpark เบื้องต้น

เรียนจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp บนมือถือ

ก้าวหน้าได้ทุกที่ด้วยคอร์สมือถือและแบบฝึกหัดการเขียนโค้ด 5 นาทีประจำวันของเรา

PySpark เบื้องต้น | DataCamp