Build your ultimate AI agent
Описание курса
Наборы данных нередко превышают объём доступной оперативной памяти, что создаёт трудности для программистов на R: по умолчанию все переменные хранятся в памяти. В этом курсе вы освоите инструменты для обработки, исследования и анализа данных непосредственно с диска. Вы также реализуете подход «разделить — применить — объединить» и научитесь писать масштабируемый код с помощью пакетов bigmemory и iotools. В курсе используются данные Федерального агентства по жилищному финансированию — общедоступный набор данных, охватывающий все ипотечные кредиты, которые удерживались или секьюритизировались Федеральной национальной ипотечной ассоциацией (Fannie Mae) и Федеральной корпорацией по жилищному ипотечному кредитованию (Freddie Mac) в период с 2009 по 2015 год.
Предварительные требования
Программа
Структура курса
1
Работа с всё более крупными наборами данных
В этой главе рассматриваются причины, по которым необходимо применять новые подходы, когда наборы данных превышают объём доступной оперативной памяти. Вы увидите, что импорт и экспорт данных с помощью базовых функций R может работать медленно, и узнаете, как легко это исправить. В завершение главы вводится пакет bigmemory.
- Что такое масштабируемая обработка данных?50 XP
- Почему ваш код работает медленно?50 XP
- Как время обработки зависит от размера данных?100 XP
- Работа с «внепамятными» объектами с помощью проекта Bigmemory50 XP
- Чтение объекта big.matrix100 XP
- Подключение объекта big.matrix100 XP
- Работа с таблицами на основе объектов big.matrix100 XP
- Сводная статистика с помощью bigsummary100 XP
- Ссылки и копии50 XP
- Копирование матриц и больших матриц100 XP
2
Обработка и анализ данных с помощью bigmemory
Теперь, когда у вас есть опыт работы с bigmemory, мы рассмотрим простые методы исследования и анализа данных. В частности, вы узнаете, как создавать таблицы и реализовывать подход «разделить — применить — объединить».
3
Работа с iotools
Мы познакомимся с пакетом iotools, который умеет обрабатывать как числовые, так и строковые данные, и изучим концепцию пообрывочной (chunk-wise) обработки.
4
Практический пример: предварительный анализ данных о жилищном рынке
В предыдущих главах мы познакомились с данными о жилищном рынке и рассмотрели, как работать с данными, сопоставимыми по объёму с оперативной памятью одной машины или превышающими её. В этой главе мы проведём предварительный анализ данных и сравним различные тенденции во времени.
R
Масштабируемая обработка данных в R
Курс
завершён

