Перейти к основному содержимому

Курс

Машинное обучение с PySpark

Продвинутый4 ч

Научитесь делать прогнозы по данным с Apache Spark, используя деревья решений, логистическую регрессию, линейную регрессию, ансамбли и конвейеры.

Python4 чвидео: 16Упражнений: 564,550 XP30,057Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Научитесь использовать Apache Spark для машинного обучения

Spark — это мощный универсальный инструмент для работы с Big Data. Spark прозрачно распределяет вычислительные задачи по кластеру. Это означает, что операции выполняются быстро, но это также позволяет вам сосредоточиться на анализе, а не беспокоиться о технических деталях. На этом курсе вы узнаете, как загружать данные в Spark, а затем познакомитесь с тремя основными алгоритмами машинного обучения Spark: Линейная регрессия, логистическая регрессия/классификаторы и создание конвейеров.

Создавайте и тестируйте деревья решений

Создание собственных деревьев решений — отличный способ начать изучать модели машинного обучения. Вы будете использовать алгоритм под названием «рекурсивное разбиение», чтобы разделить данные на два класса и найти в ваших данных предиктор, который обеспечивает наиболее информативное разделение этих двух классов, а затем повторять это действие для последующих узлов. Затем вы сможете использовать своё дерево решений для прогнозирования на новых данных.

Освойте логистическую и линейную регрессию в PySpark

Логистическая и линейная регрессия — это важные методы машинного обучения, поддерживаемые PySpark. Вы научитесь строить и оценивать модели логистической регрессии, а затем перейдёте к созданию моделей линейной регрессии, чтобы уточнять набор признаков и оставлять только самые релевантные варианты.

К концу курса вы будете уверенно применять полученные знания в области машинного обучения благодаря практическим заданиям и наборам данных для отработки навыков, которые встречаются на протяжении всего курса.

Предварительные требования

Программа

План курса

1

Введение

Spark — это фреймворк для работы с большими данными. В этой главе вы познакомитесь с основами Spark и машинного обучения, узнаете, как подключиться к Spark с помощью Python и загрузить данные в формате CSV.
Начать главу
3

Регрессия

4

Ансамбли и конвейеры

В заключительной главе вы узнаете, как повысить эффективность моделей. Вы научитесь использовать конвейеры, чтобы сделать код более понятным и удобным в сопровождении. Затем освоите кросс-валидацию для более качественного тестирования моделей и подбора оптимальных параметров. В финале познакомитесь с двумя типами ансамблевых моделей.
Начать главу

Машинное обучение с PySpark

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.