หลังจากเรียนคอร์สเหล่านี้ รู้สึกมั่นใจในการสร้างการแสดงผลข้อมูลและแดชบอร์ดระดับมืออาชีพ
รายละเอียดคอร์ส
โลกความเป็นจริงเต็มไปด้วยความซับซ้อน และงานของเราคือทำให้มันสมเหตุสมผล ชุดข้อมูลตัวอย่างอย่าง MTCars และ Iris ผ่านการคัดสรรและทำความสะอาดมาอย่างดีแล้ว แต่แม้กระนั้นก็ยังต้องแปลงข้อมูลให้อยู่ในรูปแบบที่เหมาะสมก่อนที่อัลกอริทึม machine learning จะดึงข้อมูลเชิงลึก พยากรณ์ จำแนก หรือจัดกลุ่มได้อย่างมีประสิทธิภาพ คอร์สนี้จะเจาะลึกในรายละเอียดที่นักวิทยาศาสตร์ข้อมูลใช้เวลาถึง 70-80% ของการทำงาน นั่นคือ การจัดการข้อมูลและ feature engineering เมื่อชุดข้อมูลมีขนาดใหญ่ขึ้นเรื่อย ๆ มาใช้ PySpark เพื่อจัดการกับปัญหา Big Data นี้กันเถอะ!
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงร่างคอร์ส
1
การวิเคราะห์ข้อมูลเชิงสำรวจ
ทำความเข้าใจปัญหาก่อนลงมือทำ จากนั้นเรียนรู้วิธีตรวจสอบชุดข้อมูลทั้งในเชิงสถิติและเชิงภาพ
- จะเริ่มต้นจากตรงไหน50 XP
- จะเริ่มต้นจากตรงไหน?50 XP
- ตรวจสอบเวอร์ชัน100 XP
- โหลดข้อมูล100 XP
- การกำหนดปัญหา50 XP
- เราจะทำนายอะไร?100 XP
- ตรวจสอบการโหลดข้อมูล100 XP
- การตรวจสอบประเภทข้อมูล100 XP
- การตรวจสอบข้อมูลด้วยภาพ / EDA50 XP
- การใช้ Corr()100 XP
- การใช้การแสดงผลด้วยกราฟ: distplot100 XP
- การใช้การแสดงผลด้วยภาพ: lmplot100 XP
2
การจัดการข้อมูลด้วย Spark Functions
ข้อมูลจริงแทบไม่เคยสะอาดพร้อมสำหรับการวิเคราะห์ ในบทนี้จะเรียนรู้วิธีลบข้อมูลที่ไม่จำเป็นออก จัดการกับค่าที่หายไป และเพิ่มข้อมูลเสริมเข้าสู่การวิเคราะห์
3
Feature Engineering
ในบทนี้จะเรียนรู้วิธีสร้าง feature ใหม่ให้โมเดล machine learning ใช้ในการเรียนรู้ ไม่ว่าจะเป็นการสร้าง feature โดยรวมฟิลด์ต่าง ๆ เข้าด้วยกัน ดึงค่าจากคอลัมน์ที่ยุ่งเหยิง หรือเข้ารหัสข้อมูลเพื่อผลลัพธ์ที่ดีขึ้น
4
การสร้างโมเดล
ในบทนี้จะเรียนรู้วิธีเลือกประเภทของโมเดลที่ต้องการ จากนั้นนำข้อมูลไปใช้กับโมเดลและประเมินผล สุดท้ายจะเรียนรู้วิธีตีความผลลัพธ์และบันทึกโมเดลไว้ใช้ในภายหลัง
Feature Engineering with PySpark
เรียนคอร์สจบแล้ว

