Build your ultimate AI agent
Описание курса
Изучите преимущества R, Spark и sparklyr
R в первую очередь оптимизирован для того, чтобы вы могли быстро и понятно писать код для анализа данных. Apache Spark предназначен для быстрого анализа огромных наборов данных. Пакет sparklyr позволяет писать код dplyr на R, который выполняется в кластере Spark, объединяя лучшее из обоих миров. Этот 4-часовой курс научит вас работать с Spark DataFrame как через интерфейс dplyr, так и через нативный интерфейс Spark, а также познакомит с методами машинного обучения.Загружайте данные в Spark и работайте с DataFrame в Spark
Вы начнёте этот курс по Spark с изучения того, как Spark и R эффективно работают вместе, а также с практики загрузки данных, чтобы подготовить их к очистке, преобразованию и анализу. Вы будете использовать фреймы Spark и синтаксис dplyr для работы с данными: фильтровать и упорядочивать строки, а также изменять и суммировать столбцы.Погрузитесь в анализ больших данных с Spark MLib
Этот курс направлен на развитие ваших навыков и уверенности в анализе огромных наборов данных. В последних главах вы познакомитесь с возможностями Spark для преобразования данных в машинном обучении и получите возможность попрактиковаться в процедурах машинного обучения sparklyr, используя их для построения прогнозов с помощью градиентного бустинга деревьев и случайных лесов. "Предварительные требования
Программа
Структура курса
1
Первые шаги: начинаем работу со Spark и синтаксисом dplyr
Вы узнаете, как Spark и R дополняют друг друга, как передавать данные в Spark и обратно, а также как работать с фреймами данных Spark, используя синтаксис dplyr.
- Начало работы50 XP
- Созданы друг для друга50 XP
- Осторожно: впереди неизведанное50 XP
- Паттерн «подключение — работа — отключение»100 XP
- Копирование данных в Spark100 XP
- Большие данные, маленький тиббл100 XP
- Изучение структуры тиблов100 XP
- Выбор столбцов100 XP
- Фильтрация строк100 XP
- Сортировка строк100 XP
- Изменение столбцов100 XP
- Агрегирование столбцов100 XP
2
Инструменты в деле: продвинутые возможности dplyr
Вы подробнее изучите интерфейс
dplyr для работы со Spark: расширенный выбор полей, вычисление групповых статистик и объединение фреймов данных.3
Нативный подход: работа со Spark DataFrames через нативный интерфейс
Вы познакомитесь с возможностями Spark для преобразования данных в задачах машинного обучения, а также с функциями для работы с нативными DataFrames.
4
Практический кейс: машинное обучение на Spark
Практический кейс, в котором вы научитесь использовать процедуры машинного обучения из
sparklyr — на примере задачи предсказания года выпуска песни.R
Введение в Spark с sparklyr на R
Курс
завершён

