Build your ultimate AI agent
รายละเอียดคอร์ส
สำรวจข้อดีของ R, Spark และ sparklyr
R ได้รับการปรับให้เหมาะสมเป็นหลักเพื่อช่วยให้คุณเขียนโค้ดวิเคราะห์ข้อมูลได้อย่างรวดเร็วและอ่านเข้าใจง่าย Apache Spark ได้รับการออกแบบมาเพื่อวิเคราะห์ชุดข้อมูลขนาดใหญ่มหาศาลได้อย่างรวดเร็ว แพ็กเกจ sparklyr ช่วยให้คุณเขียนโค้ด R ด้วย dplyr ที่ทำงานบนคลัสเตอร์ Spark ได้ มอบข้อดีของทั้งสองโลกให้คุณ คอร์ส 4 ชั่วโมงนี้จะสอนคุณวิธีจัดการ Spark DataFrames โดยใช้ทั้งอินเทอร์เฟซ dplyr และอินเทอร์เฟซดั้งเดิมของ Spark รวมถึงการลองใช้เทคนิค machine learningโหลดข้อมูลเข้าสู่ Spark และจัดการ Spark DataFrames
คุณจะเริ่มต้นคอร์ส Spark นี้ด้วยการสำรวจว่า Spark และ R ทำงานร่วมกันได้อย่างไรอย่างมีประสิทธิภาพ พร้อมฝึกการโหลดข้อมูล เพื่อเตรียมสำหรับการทำความสะอาด การแปลงข้อมูล และการวิเคราะห์ คุณจะใช้ Spark frames และไวยากรณ์ dplyr เพื่อจัดการข้อมูลของคุณด้วยการกรองและจัดเรียงแถว รวมถึงการปรับเปลี่ยนและสรุปคอลัมน์เจาะลึกการวิเคราะห์บิ๊กดาต้าด้วย Spark MLib
หลักสูตรนี้มุ่งเน้นการพัฒนาทักษะและความมั่นใจของคุณในการวิเคราะห์ชุดข้อมูลขนาดใหญ่จำนวนมหาศาล บทสุดท้ายจะพาคุณไปสำรวจฟีเจอร์การแปลงข้อมูลสำหรับแมชชีนเลิร์นนิงของ Spark และเปิดโอกาสให้คุณได้ฝึกใช้รูทีนแมชชีนเลิร์นนิงของ sparklyr โดยนำไปใช้สร้างการคาดการณ์ด้วย gradient boosted trees และ random forests. "ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
จุดเริ่มต้น: เริ่มใช้ Spark ด้วย dplyr Syntax
เรียนรู้ว่า Spark และ R เสริมกันอย่างไร วิธีนำเข้าและส่งออกข้อมูลจาก Spark รวมถึงการจัดการ Spark DataFrames ด้วย dplyr syntax
- เริ่มต้นใช้งาน50 XP
- คู่ที่เข้ากันได้อย่างลงตัว50 XP
- ระวัง! ข้างหน้าคือดินแดนแห่งความท้าทาย50 XP
- รูปแบบการทำงาน: เชื่อมต่อ — ทำงาน — ตัดการเชื่อมต่อ100 XP
- การคัดลอกข้อมูลเข้าสู่ Spark100 XP
- ข้อมูลขนาดใหญ่ tibble ขนาดเล็ก100 XP
- สำรวจโครงสร้างของ tibbles100 XP
- การเลือกคอลัมน์100 XP
- การกรองแถวข้อมูล100 XP
- การจัดเรียงแถว100 XP
- การเพิ่มและแก้ไขคอลัมน์ด้วย mutate100 XP
- การสรุปค่าของคอลัมน์100 XP
2
เครื่องมือสำคัญ: การใช้ dplyr ขั้นสูง
เรียนรู้การใช้งาน
dplyr interface กับ Spark เพิ่มเติม ครอบคลุมการเลือกฟิลด์ขั้นสูง การคำนวณสถิติรายกลุ่ม และการ join DataFrames3
Native Interface: จัดการ Spark DataFrames โดยตรง
เรียนรู้ฟีเจอร์การแปลงข้อมูลสำหรับ machine learning ของ Spark และฟังก์ชันสำหรับจัดการ native DataFrames โดยตรง
4
กรณีศึกษา: รัน Machine Learning Models บน Spark
กรณีศึกษาที่จะได้ฝึกใช้ routines machine learning ของ
sparklyr โดยสร้างโมเดลทำนายปีที่เพลงถูกปล่อยออกมาR
แนะนำ Spark ด้วย sparklyr ใน R
เรียนจบแล้ว

