ข้ามไปยังเนื้อหาหลัก

คอร์ส

Machine Learning with PySpark

ขั้นสูง4 ชม.

เรียนรู้วิธีสร้างการคาดการณ์จากข้อมูลด้วย Apache Spark โดยใช้ decision trees, logistic regression, linear regression, ensembles และ pipelines

Python4 ชม.16 วิดีโอ56 แบบฝึกหัด4,550 XP29,823ใบแสดงความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
การดำเนินการต่อหมายความว่าคุณยอมรับ เงื่อนไขการใช้งาน, ของเรา นโยบายความเป็นส่วนตัว และข้อมูลของคุณถูกจัดเก็บไว้ในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในหลายพันบริษัท

รายละเอียดคอร์ส

เรียนรู้การใช้ Apache Spark สำหรับแมชชีนเลิร์นนิง

Spark เป็นเครื่องมืออเนกประสงค์ที่ทรงพลังสำหรับการทำงานกับ Big Data Spark จัดการการกระจายงานประมวลผลไปยังคลัสเตอร์อย่างโปร่งใส ซึ่งหมายความว่าการดำเนินงานรวดเร็ว แต่ยังช่วยให้คุณมุ่งเน้นไปที่การวิเคราะห์แทนที่จะต้องกังวลเกี่ยวกับรายละเอียดทางเทคนิค ในคอร์สนี้ คุณจะได้เรียนรู้วิธีนำข้อมูลเข้าสู่ Spark จากนั้นจะเจาะลึกไปยังอัลกอริทึม Spark Machine Learning พื้นฐานทั้งสาม: การถดถอยเชิงเส้น, การถดถอยโลจิสติก/ตัวจำแนก, และการสร้างไปป์ไลน์

สร้างและทดสอบต้นไม้ตัดสินใจ

การสร้างต้นไม้ตัดสินใจของคุณเองเป็นวิธีที่ยอดเยี่ยมในการเริ่มสำรวจโมเดลแมชชีนเลิร์นนิง คุณจะใช้ขั้นตอนวิธีที่เรียกว่า ‘Recursive Partitioning’ เพื่อแบ่งข้อมูลออกเป็นสองคลาส และค้นหาตัวทำนายในข้อมูลของคุณที่ทำให้การแยกสองคลาสมีข้อมูลเชิงลึกมากที่สุด จากนั้นทำซ้ำกระบวนการนี้กับโหนดถัดไป จากนั้นคุณสามารถใช้แผนผังการตัดสินใจของคุณเพื่อทำการคาดการณ์ด้วยข้อมูลใหม่ได้

เชี่ยวชาญ Logistic Regression และ Linear Regression ใน PySpark

การถดถอยโลจิสติกและการถดถอยเชิงเส้นเป็นเทคนิคการเรียนรู้ของเครื่องที่จำเป็น ซึ่งรองรับโดย PySpark คุณจะได้เรียนรู้การสร้างและประเมินโมเดลโลจิสติกรีเกรสชัน ก่อนจะต่อยอดไปสู่การสร้างโมเดลลิเนียร์รีเกรสชัน เพื่อช่วยให้คุณปรับแต่งตัวแปรทำนายของคุณให้เหลือเฉพาะตัวเลือกที่เกี่ยวข้องที่สุด

เมื่อจบหลักสูตรนี้ คุณจะมั่นใจในการนำความรู้ด้านแมชชีนเลิร์นนิงที่เพิ่งได้เรียนรู้ไปประยุกต์ใช้ได้ ด้วยงานปฏิบัติและชุดข้อมูลฝึกหัดที่มีอยู่ตลอดทั้งหลักสูตร

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงสร้างคอร์ส

1

บทนำ

Spark เป็น Framework สำหรับการทำงานกับ Big Data ในบทนี้จะได้รู้จักพื้นฐานของ Spark และ Machine Learning จากนั้นจะได้เรียนรู้วิธีเชื่อมต่อกับ Spark ด้วย Python และโหลดข้อมูล CSV
เริ่มบทเรียน
3

การถดถอย

ต่อมาจะได้เรียนรู้การสร้างโมเดล Linear Regression รวมถึงวิธีเพิ่มคุณค่าให้ข้อมูลด้วยการสร้าง Predictor ใหม่ และแนวทางที่เชื่อถือได้สำหรับการคัดเลือก Predictor ที่เกี่ยวข้องมากที่สุด
เริ่มบทเรียน
4

Ensembles และ Pipeline

ในบทสุดท้ายจะได้เรียนรู้วิธีทำให้โมเดลมีประสิทธิภาพมากขึ้น โดยใช้ Pipeline เพื่อให้โค้ดอ่านง่ายและดูแลรักษาได้สะดวกขึ้น จากนั้นจะใช้ Cross-Validation เพื่อทดสอบโมเดลและเลือก Parameter ที่เหมาะสม และปิดท้ายด้วยการทดลองใช้โมเดลแบบ Ensemble 2 ประเภท
เริ่มบทเรียน

Machine Learning with PySpark

เรียนจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp บนมือถือ

ก้าวหน้าได้ทุกที่ด้วยคอร์สมือถือและแบบฝึกหัดการเขียนโค้ด 5 นาทีประจำวันของเรา

Machine Learning with PySpark | DataCamp