Build your ultimate AI agent
Opis kursu
Zbiory danych często przekraczają dostępną pamięć RAM, co stanowi problem dla programistów R, ponieważ domyślnie wszystkie zmienne są przechowywane w pamięci. Nauczysz się narzędzi do przetwarzania, eksploracji i analizowania danych bezpośrednio z dysku. Poznasz też podejście split-apply-combine i nauczysz się pisać skalowalny kod z wykorzystaniem pakietów bigmemory i iotools. W kursie korzystamy z danych Federalnej Agencji Finansowania Mieszkalnictwa (FHFA) – publicznie dostępnego zbioru danych obejmującego wszystkie kredyty hipoteczne obsługiwane lub sekurytyzowane przez Federal National Mortgage Association (Fannie Mae) oraz Federal Home Loan Mortgage Corporation (Freddie Mac) w latach 2009–2015.
Wymagania wstępne
Program kursu
Plan kursu
1
Praca z coraz większymi zbiorami danych
W tym rozdziale omawiamy, dlaczego praca z dużymi zbiorami danych – przekraczającymi dostępną pamięć RAM – wymaga nowych technik. Pokażemy, że importowanie i eksportowanie danych za pomocą bazowych funkcji R bywa wolne, oraz przedstawimy proste sposoby na poprawę wydajności. Na koniec wprowadzamy pakiet bigmemory.
- Czym jest skalowalne przetwarzanie danych?50 XP
- Dlaczego twój kod działa wolno?50 XP
- Jak czas przetwarzania zależy od rozmiaru danych?100 XP
- Praca z obiektami „out-of-core" w pakiecie Bigmemory50 XP
- Wczytywanie obiektu big.matrix100 XP
- Dołączanie obiektu big.matrix100 XP
- Tworzenie tabel z obiektami big.matrix100 XP
- Podsumowanie danych z użyciem bigsummary100 XP
- Referencje a kopie50 XP
- Kopiowanie macierzy i obiektów big.matrix100 XP
2
Przetwarzanie i analiza danych z bigmemory
Mając już pewne doświadczenie z bigmemory, przejdziemy do prostych technik eksploracji i analizy danych. Zobaczymy w szczególności, jak tworzyć tabele i wdrażać podejście split-apply-combine.
3
Praca z iotools
Poznamy pakiet iotools, który obsługuje zarówno dane liczbowe, jak i tekstowe, oraz wprowadzamy koncepcję przetwarzania fragmentarycznego (chunk-wise).
4
Studium przypadku: wstępna analiza danych mieszkaniowych
W poprzednich rozdziałach przedstawiliśmy dane mieszkaniowe i pokazaliśmy, jak obliczać na danych zbliżonych rozmiarem do dostępnej pamięci RAM lub ją przekraczających. W tym rozdziale przeprowadzimy wstępną analizę tych danych, porównując różne trendy w czasie.
R
Skalowalne przetwarzanie danych w R
Kurs
ukończony

