Build your ultimate AI agent
Descrierea cursului
Seturile de date sunt adesea mai mari decât memoria RAM disponibilă, ceea ce creează probleme pentru programatorii R, deoarece implicit toate variabilele sunt stocate în memorie. Vei învăța instrumente pentru procesarea, explorarea și analiza datelor direct de pe disc. Vei implementa și abordarea split-apply-combine și vei învăța cum să scrii cod scalabil folosind pachetele bigmemory și iotools. În cadrul acestui curs, vei lucra cu datele Agenției Federale pentru Finanțarea Locuințelor – un set de date public care înregistrează toate creditele ipotecare deținute sau securitizate de Federal National Mortgage Association (Fannie Mae) și Federal Home Loan Mortgage Corporation (Freddie Mac) în perioada 2009–2015.
Cerințe prealabile
Curriculum
Structura cursului
1
Lucrul cu seturi de date din ce în ce mai mari
În acest capitol, vom explica de ce este nevoie de tehnici noi atunci când seturile de date depășesc memoria RAM disponibilă. Vom arăta că importul și exportul datelor cu funcțiile de bază din R pot fi lente și vom prezenta câteva soluții simple. În final, vom face cunoștință cu pachetul bigmemory.
- Ce este procesarea scalabilă a datelor?50 XP
- De ce rulează codul tău lent?50 XP
- Cum variază timpul de procesare în funcție de dimensiunea datelor?100 XP
- Lucrul cu obiecte „Out-of-Core" folosind proiectul Bigmemory50 XP
- Citirea unui obiect big.matrix100 XP
- Atașarea unui obiect big.matrix100 XP
- Crearea tabelelor cu obiecte big.matrix100 XP
- Sumar de date cu bigsummary100 XP
- Referințe vs. Copii50 XP
- Copierea matricelor și a matricelor de tip big.matrix100 XP
2
Procesarea și analiza datelor cu bigmemory
Acum că ai dobândit experiență cu bigmemory, vom parcurge câteva tehnici simple de explorare și analiză a datelor. În special, vom vedea cum să creăm tabele și cum să implementăm abordarea split-apply-combine.
3
Lucrul cu iotools
Vom folosi pachetul iotools, care poate procesa atât date numerice, cât și șiruri de caractere, și vom introduce conceptul de procesare pe fragmente (chunk-wise processing).
4
Studiu de caz: O analiză preliminară a datelor imobiliare
În capitolele anterioare, am prezentat datele imobiliare și am arătat cum să lucrezi cu date care sunt aproximativ egale sau mai mari decât cantitatea de RAM disponibilă pe o singură mașină. În acest capitol, vom realiza o analiză preliminară a datelor, comparând diverse tendințe în timp.
R
Procesarea scalabilă a datelor în R
Curs
finalizat

