Build your ultimate AI agent
รายละเอียดคอร์ส
ในช่วงหลายปีที่ผ่านมา Big Data กลายเป็นหัวข้อที่ได้รับความสนใจอย่างกว้างขวาง และปัจจุบันก็กลายเป็นเรื่องปกติสำหรับหลายองค์กรไปแล้ว แล้ว Big Data คืออะไรกันแน่? คอร์สนี้จะพาไปเรียนรู้พื้นฐานของ Big Data ผ่าน PySpark โดย Spark เป็น framework สำหรับการประมวลผลแบบ cluster ที่รวดเร็วเป็นพิเศษ รองรับการประมวลผลข้อมูลขนาดใหญ่ได้อย่างมีประสิทธิภาพ และสามารถรันโปรแกรมได้เร็วกว่า Hadoop ถึง 100 เท่าในหน่วยความจำ หรือ 10 เท่าบนดิสก์ คอร์สนี้ใช้ PySpark ซึ่งเป็น Python package สำหรับ Spark พร้อมไลบรารีระดับสูงที่ทรงพลัง เช่น SparkSQL และ MLlib (สำหรับการเรียนรู้ของเครื่อง) จะได้สำรวจผลงานของ William Shakespeare วิเคราะห์ข้อมูล FIFA 2018 และทำ clustering บนชุดข้อมูลจีโนม เมื่อจบคอร์สนี้ จะมีความเข้าใจเชิงลึกเกี่ยวกับ PySpark และการนำไปใช้วิเคราะห์ Big Data ในรูปแบบต่าง ๆ
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
แนะนำการวิเคราะห์ Big Data ด้วย Spark
บทนี้จะแนะนำโลกของ Big Data พร้อมทั้งแนวคิดและ framework ต่าง ๆ ที่ใช้ในการประมวลผล Big Data รวมถึงเหตุผลที่ Apache Spark ได้รับการยอมรับว่าเป็น framework ที่ดีที่สุดสำหรับ Big Data
2
การเขียนโปรแกรมด้วย PySpark RDD
abstraction หลักที่ Spark มอบให้คือ resilient distributed dataset (RDD) ซึ่งเป็นชนิดข้อมูลพื้นฐานและหัวใจสำคัญของ engine นี้ บทนี้จะแนะนำ RDD และแสดงวิธีสร้างและรัน RDD ผ่าน RDD Transformations และ Actions
3
PySpark SQL และ DataFrames
ในบทนี้ จะได้เรียนรู้เกี่ยวกับ Spark SQL ซึ่งเป็นโมดูลของ Spark สำหรับการประมวลผลข้อมูลแบบมีโครงสร้าง โดยมี abstraction สำหรับการเขียนโปรแกรมที่เรียกว่า DataFrames และยังทำหน้าที่เป็น distributed SQL query engine ได้ด้วย บทนี้แสดงให้เห็นว่า Spark SQL ช่วยให้ใช้งาน DataFrames ใน Python ได้อย่างไร
4
Machine Learning ด้วย PySpark MLlib
PySpark MLlib คือไลบรารีการเรียนรู้ของเครื่องที่รองรับการขยายขนาดของ Apache Spark ใน Python ประกอบด้วยอัลกอริทึมและเครื่องมือการเรียนรู้ที่ใช้กันทั่วไป ตลอดบทสุดท้ายนี้ จะได้เรียนรู้อัลกอริทึม Machine Learning ที่สำคัญ พร้อมสร้างระบบแนะนำภาพยนตร์และตัวกรองสแปม รวมถึงนำ k-means clustering มาใช้งาน
Big Data Fundamentals with PySpark
เรียนจบแล้ว

