Build your ultimate AI agent
รายละเอียดคอร์ส
เรียนรู้การใช้ Apache Spark สำหรับแมชชีนเลิร์นนิง
Spark เป็นเครื่องมืออเนกประสงค์ที่ทรงพลังสำหรับการทำงานกับ Big Data Spark จัดการการกระจายงานประมวลผลไปยังคลัสเตอร์อย่างโปร่งใส ซึ่งหมายความว่าการดำเนินงานรวดเร็ว แต่ยังช่วยให้คุณมุ่งเน้นไปที่การวิเคราะห์แทนที่จะต้องกังวลเกี่ยวกับรายละเอียดทางเทคนิค ในคอร์สนี้ คุณจะได้เรียนรู้วิธีนำข้อมูลเข้าสู่ Spark จากนั้นจะเจาะลึกไปยังอัลกอริทึม Spark Machine Learning พื้นฐานทั้งสาม: การถดถอยเชิงเส้น, การถดถอยโลจิสติก/ตัวจำแนก, และการสร้างไปป์ไลน์สร้างและทดสอบต้นไม้ตัดสินใจ
การสร้างต้นไม้ตัดสินใจของคุณเองเป็นวิธีที่ยอดเยี่ยมในการเริ่มสำรวจโมเดลแมชชีนเลิร์นนิง คุณจะใช้ขั้นตอนวิธีที่เรียกว่า ‘Recursive Partitioning’ เพื่อแบ่งข้อมูลออกเป็นสองคลาส และค้นหาตัวทำนายในข้อมูลของคุณที่ทำให้การแยกสองคลาสมีข้อมูลเชิงลึกมากที่สุด จากนั้นทำซ้ำกระบวนการนี้กับโหนดถัดไป จากนั้นคุณสามารถใช้แผนผังการตัดสินใจของคุณเพื่อทำการคาดการณ์ด้วยข้อมูลใหม่ได้เชี่ยวชาญ Logistic Regression และ Linear Regression ใน PySpark
การถดถอยโลจิสติกและการถดถอยเชิงเส้นเป็นเทคนิคการเรียนรู้ของเครื่องที่จำเป็น ซึ่งรองรับโดย PySpark คุณจะได้เรียนรู้การสร้างและประเมินโมเดลโลจิสติกรีเกรสชัน ก่อนจะต่อยอดไปสู่การสร้างโมเดลลิเนียร์รีเกรสชัน เพื่อช่วยให้คุณปรับแต่งตัวแปรทำนายของคุณให้เหลือเฉพาะตัวเลือกที่เกี่ยวข้องที่สุดเมื่อจบหลักสูตรนี้ คุณจะมั่นใจในการนำความรู้ด้านแมชชีนเลิร์นนิงที่เพิ่งได้เรียนรู้ไปประยุกต์ใช้ได้ ด้วยงานปฏิบัติและชุดข้อมูลฝึกหัดที่มีอยู่ตลอดทั้งหลักสูตร
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
บทนำ
Spark เป็น Framework สำหรับการทำงานกับ Big Data ในบทนี้จะได้รู้จักพื้นฐานของ Spark และ Machine Learning จากนั้นจะได้เรียนรู้วิธีเชื่อมต่อกับ Spark ด้วย Python และโหลดข้อมูล CSV
2
การจำแนกประเภท
เมื่อคุ้นเคยกับการนำข้อมูลเข้า Spark แล้ว จะก้าวไปสู่การสร้างโมเดลจำแนกประเภท 2 แบบ ได้แก่ Decision Tree และ Logistic Regression พร้อมทั้งเรียนรู้แนวทางการเตรียมข้อมูลหลายรูปแบบ
3
การถดถอย
ต่อมาจะได้เรียนรู้การสร้างโมเดล Linear Regression รวมถึงวิธีเพิ่มคุณค่าให้ข้อมูลด้วยการสร้าง Predictor ใหม่ และแนวทางที่เชื่อถือได้สำหรับการคัดเลือก Predictor ที่เกี่ยวข้องมากที่สุด
4
Ensembles และ Pipeline
ในบทสุดท้ายจะได้เรียนรู้วิธีทำให้โมเดลมีประสิทธิภาพมากขึ้น โดยใช้ Pipeline เพื่อให้โค้ดอ่านง่ายและดูแลรักษาได้สะดวกขึ้น จากนั้นจะใช้ Cross-Validation เพื่อทดสอบโมเดลและเลือก Parameter ที่เหมาะสม และปิดท้ายด้วยการทดลองใช้โมเดลแบบ Ensemble 2 ประเภท
Machine Learning with PySpark
เรียนจบแล้ว

