Build your ultimate AI agent
รายละเอียดคอร์ส
การทำงานกับข้อมูลนั้นไม่ใช่เรื่องง่าย และยิ่งยากขึ้นไปอีกเมื่อต้องจัดการกับข้อมูลหลายล้านหรือหลายพันล้านแถว
เคยได้รับโค้ดประมวลผลข้อมูลที่เขียนบนแล็ปท็อปด้วยข้อมูลที่สะอาดเกือบสมบูรณ์แบบไหม?
มีโอกาสสูงที่จะต้องรับผิดชอบในการนำกระบวนการข้อมูลเบื้องต้นจากต้นแบบไปสู่การใช้งานจริง
บางทีก็ต้องเผชิญกับชุดข้อมูลในโลกจริงที่มีฟิลด์ขาดหาย รูปแบบแปลกประหลาด และปริมาณข้อมูลมหาศาล แม้ทั้งหมดนี้จะเป็นเรื่องใหม่สำหรับคุณ คอร์สนี้จะช่วยให้เรียนรู้สิ่งที่จำเป็นในการเตรียมกระบวนการข้อมูลโดยใช้ Python ร่วมกับ Apache Spark
จะได้เรียนรู้คำศัพท์ วิธีการ และแนวปฏิบัติที่ดีในการสร้างแพลตฟอร์มประมวลผลข้อมูลที่มีประสิทธิภาพ บำรุงรักษาง่าย และเข้าใจได้
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
รายละเอียดของ DataFrame
ทบทวนพื้นฐาน DataFrame และความสำคัญของการทำความสะอาดข้อมูล
2
การจัดการ DataFrame ในสถานการณ์จริง
สำรวจเทคนิคต่าง ๆ สำหรับการปรับเปลี่ยนเนื้อหาใน DataFrame ด้วย Spark
3
การเพิ่มประสิทธิภาพ
ยกระดับงานทำความสะอาดข้อมูลด้วยการเพิ่มประสิทธิภาพหรือลดการใช้ทรัพยากร
4
การประมวลผลที่ซับซ้อนและ data pipeline
เรียนรู้การประมวลผลข้อมูลในโลกจริงที่มีความซับซ้อนด้วย Spark รวมถึงพื้นฐานของ pipeline
การทำความสะอาดข้อมูลด้วย PySpark
เรียนจบแล้ว

