Build your ultimate AI agent
Kursbeskrivning
Datamängder är ofta större än tillgängligt RAM-minne, vilket skapar problem för R-programmerare eftersom alla variabler som standard lagras i minnet. Du lär dig verktyg för att bearbeta, utforska och analysera data direkt från disk. Du implementerar också split-apply-combine-metoden och lär dig skriva skalbar kod med paketen bigmemory och iotools. I den här kursen använder du data från Federal Housing Finance Agency – en offentligt tillgänglig datamängd som dokumenterar alla bolån som innehades eller värdepapperiserades av Federal National Mortgage Association (Fannie Mae) och Federal Home Loan Mortgage Corporation (Freddie Mac) under åren 2009–2015.
Förkunskapskrav
Kursplan
Kursöversikt
1
Att arbeta med allt större datamängder
I det här kapitlet går vi igenom varför du behöver nya tekniker när datamängder är större än tillgängligt RAM-minne. Vi visar att import och export av data med R:s inbyggda funktioner kan vara långsamt, och presenterar enkla sätt att förbättra detta. Slutligen introducerar vi paketet bigmemory.
- Vad är skalbar databehandling?50 XP
- Varför är din kod långsam?50 XP
- Hur varierar bearbetningstiden med datamängdens storlek?100 XP
- Arbeta med "Out-of-Core"-objekt med Bigmemory-projektet50 XP
- Läsa in ett big.matrix-objekt100 XP
- Ansluta ett big.matrix-objekt100 XP
- Skapa tabeller med big.matrix-objekt100 XP
- Datasammanfattning med bigsummary100 XP
- Referenser vs. kopior50 XP
- Kopiera matriser och big matrices100 XP
2
Bearbeta och analysera data med bigmemory
Nu när du har lite erfarenhet av bigmemory går vi igenom några enkla tekniker för datautforskning och analys. Vi ser bland annat hur man skapar tabeller och implementerar split-apply-combine-metoden.
3
Att arbeta med iotools
Vi använder paketet iotools, som kan hantera både numerisk och textbaserad data, och introducerar konceptet segmentvis bearbetning.
4
Fallstudie: En preliminär analys av bostadsdata
I de tidigare kapitlen introducerade vi bostadsdata och visade hur man beräknar med data som är ungefär lika stora som, eller större än, RAM-minnet på en enskild dator. I det här kapitlet gör vi en preliminär analys av data och jämför olika trender över tid.
R
Skalbar databehandling i R
Kurs
slutförd

