700+ courses, half price
รายละเอียดคอร์ส
ชุดข้อมูลมักมีขนาดใหญ่กว่า RAM ที่มีอยู่ ซึ่งเป็นปัญหาสำหรับนักเขียนโปรแกรม R เนื่องจากตัวแปรทั้งหมดจะถูกเก็บไว้ในหน่วยความจำโดยค่าเริ่มต้น คอร์สนี้จะสอนเครื่องมือสำหรับประมวลผล สำรวจ และวิเคราะห์ข้อมูลโดยตรงจากดิสก์ รวมถึงการใช้แนวทาง split-apply-combine และการเขียนโค้ดที่รองรับข้อมูลขนาดใหญ่ด้วยแพ็กเกจ bigmemory และ iotools ตลอดคอร์สนี้จะใช้ข้อมูลจาก Federal Housing Finance Agency ซึ่งเป็นชุดข้อมูลสาธารณะที่บันทึกสินเชื่อบ้านทั้งหมดที่ถือครองหรือแปลงเป็นหลักทรัพย์โดย Federal National Mortgage Association (Fannie Mae) และ Federal Home Loan Mortgage Corporation (Freddie Mac) ระหว่างปี 2009-2015
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงร่างคอร์ส
1
การทำงานกับชุดข้อมูลขนาดใหญ่ขึ้นเรื่อย ๆ
บทนี้จะอธิบายว่าทำไมจึงต้องใช้เทคนิคใหม่เมื่อชุดข้อมูลมีขนาดใหญ่กว่า RAM ที่มีอยู่ จะเห็นว่าการนำเข้าและส่งออกข้อมูลด้วยฟังก์ชันพื้นฐานของ R อาจทำได้ช้า พร้อมแนะนำวิธีแก้ปัญหาที่ทำได้ง่าย และปิดท้ายด้วยการแนะนำแพ็กเกจ bigmemory
- การประมวลผลข้อมูลแบบ Scalable คืออะไร?50 XP
- ทำไมโค้ดถึงทำงานช้า?50 XP
- เวลาในการประมวลผลเปลี่ยนแปลงไปตามขนาดข้อมูลอย่างไร?100 XP
- การทำงานกับออบเจกต์ "Out-of-Core" โดยใช้ Bigmemory Project50 XP
- การอ่านออบเจกต์ big.matrix100 XP
- การแนบออบเจกต์ big.matrix100 XP
- การสร้างตารางด้วย big.matrix objects100 XP
- สรุปข้อมูลด้วย bigsummary100 XP
- การอ้างอิงเทียบกับการคัดลอก50 XP
- การคัดลอก matrix และ big.matrix100 XP
2
การประมวลผลและวิเคราะห์ข้อมูลด้วย bigmemory
เมื่อมีประสบการณ์ใช้ bigmemory แล้ว บทนี้จะพาไปสำรวจเทคนิคการวิเคราะห์และสำรวจข้อมูลเบื้องต้น โดยเฉพาะการสร้างตารางและการใช้แนวทาง split-apply-combine
3
การทำงานกับ iotools
จะได้ใช้แพ็กเกจ iotools ที่รองรับทั้งข้อมูลตัวเลขและข้อความ พร้อมทำความรู้จักกับแนวคิดการประมวลผลแบบ chunk-wise
4
กรณีศึกษา: การวิเคราะห์เบื้องต้นของข้อมูลด้านที่อยู่อาศัย
จากบทก่อนหน้าที่ได้แนะนำข้อมูลด้านที่อยู่อาศัยและแสดงวิธีคำนวณกับข้อมูลที่มีขนาดใกล้เคียงหรือใหญ่กว่า RAM ของเครื่อง บทนี้จะทำการวิเคราะห์เบื้องต้นของข้อมูลดังกล่าว โดยเปรียบเทียบแนวโน้มต่าง ๆ ตามช่วงเวลา
R
การประมวลผลข้อมูลขนาดใหญ่ใน R
เรียนคอร์สจบแล้ว

