ข้ามไปยังเนื้อหาหลัก

คอร์ส

Feature Engineering with PySpark

ขั้นสูง4 ชม.

เข้าใจลึกเรื่อง data wrangling และ feature engineering—ทักษะหลักที่นักวิทยาศาสตร์ข้อมูลใช้เวลาส่วนใหญ่

Python4 ชม.16 วิดีโอ60 แบบฝึกหัด5,000 XP17,982หนังสือรับรองความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
เมื่อดำเนินการต่อ ถือว่าคุณยอมรับ ข้อกำหนดการใช้งานและ นโยบายความเป็นส่วนตัว และยอมรับว่าข้อมูลของคุณจะถูกจัดเก็บในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในบริษัทหลายพันแห่ง

กำลังฝึกอบรมทีมอยู่ใช่ไหม?

ทดลองใช้สำหรับองค์กร

รายละเอียดคอร์ส

โลกความเป็นจริงเต็มไปด้วยความซับซ้อน และงานของเราคือทำให้มันสมเหตุสมผล ชุดข้อมูลตัวอย่างอย่าง MTCars และ Iris ผ่านการคัดสรรและทำความสะอาดมาอย่างดีแล้ว แต่แม้กระนั้นก็ยังต้องแปลงข้อมูลให้อยู่ในรูปแบบที่เหมาะสมก่อนที่อัลกอริทึม machine learning จะดึงข้อมูลเชิงลึก พยากรณ์ จำแนก หรือจัดกลุ่มได้อย่างมีประสิทธิภาพ คอร์สนี้จะเจาะลึกในรายละเอียดที่นักวิทยาศาสตร์ข้อมูลใช้เวลาถึง 70-80% ของการทำงาน นั่นคือ การจัดการข้อมูลและ feature engineering เมื่อชุดข้อมูลมีขนาดใหญ่ขึ้นเรื่อย ๆ มาใช้ PySpark เพื่อจัดการกับปัญหา Big Data นี้กันเถอะ!

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงร่างคอร์ส

2

การจัดการข้อมูลด้วย Spark Functions

ข้อมูลจริงแทบไม่เคยสะอาดพร้อมสำหรับการวิเคราะห์ ในบทนี้จะเรียนรู้วิธีลบข้อมูลที่ไม่จำเป็นออก จัดการกับค่าที่หายไป และเพิ่มข้อมูลเสริมเข้าสู่การวิเคราะห์
เริ่มบท
3

Feature Engineering

ในบทนี้จะเรียนรู้วิธีสร้าง feature ใหม่ให้โมเดล machine learning ใช้ในการเรียนรู้ ไม่ว่าจะเป็นการสร้าง feature โดยรวมฟิลด์ต่าง ๆ เข้าด้วยกัน ดึงค่าจากคอลัมน์ที่ยุ่งเหยิง หรือเข้ารหัสข้อมูลเพื่อผลลัพธ์ที่ดีขึ้น
เริ่มบท
4

การสร้างโมเดล

ในบทนี้จะเรียนรู้วิธีเลือกประเภทของโมเดลที่ต้องการ จากนั้นนำข้อมูลไปใช้กับโมเดลและประเมินผล สุดท้ายจะเรียนรู้วิธีตีความผลลัพธ์และบันทึกโมเดลไว้ใช้ในภายหลัง
เริ่มบท

Feature Engineering with PySpark

เรียนคอร์สจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp for Mobile

เรียนรู้ได้ทุกที่ด้วยคอร์สบนมือถือและโจทย์เขียนโค้ด 5 นาทีประจำวัน