Перейти к основному контенту

Курс

Машинное обучение с PySpark

Продвинутый4 ч

Научитесь делать прогнозы по данным с Apache Spark, используя деревья решений, логистическую регрессию, линейную регрессию, ансамбли и конвейеры.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}4,550 XP29,823Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Научитесь использовать Apache Spark для машинного обучения

Spark — это мощный универсальный инструмент для работы с Big Data. Spark прозрачно распределяет вычислительные задачи по кластеру. Это означает, что операции выполняются быстро, но это также позволяет вам сосредоточиться на анализе, а не беспокоиться о технических деталях. На этом курсе вы узнаете, как загружать данные в Spark, а затем познакомитесь с тремя основными алгоритмами машинного обучения Spark: Линейная регрессия, логистическая регрессия/классификаторы и создание конвейеров.

Создавайте и тестируйте деревья решений

Создание собственных деревьев решений — отличный способ начать изучать модели машинного обучения. Вы будете использовать алгоритм под названием «рекурсивное разбиение», чтобы разделить данные на два класса и найти в ваших данных предиктор, который обеспечивает наиболее информативное разделение этих двух классов, а затем повторять это действие для последующих узлов. Затем вы сможете использовать своё дерево решений для прогнозирования на новых данных.

Освойте логистическую и линейную регрессию в PySpark

Логистическая и линейная регрессия — это важные методы машинного обучения, поддерживаемые PySpark. Вы научитесь строить и оценивать модели логистической регрессии, а затем перейдёте к созданию моделей линейной регрессии, чтобы уточнять набор признаков и оставлять только самые релевантные варианты.

К концу курса вы будете уверенно применять полученные знания в области машинного обучения благодаря практическим заданиям и наборам данных для отработки навыков, которые встречаются на протяжении всего курса.

Предварительные требования

Программа

Структура курса

1

Введение

Spark — это фреймворк для работы с большими данными. В этой главе вы познакомитесь с основами Spark и машинного обучения, узнаете, как подключиться к Spark с помощью Python и загрузить данные в формате CSV.
Начать главу
4

Ансамбли и конвейеры

В заключительной главе вы узнаете, как повысить эффективность моделей. Вы научитесь использовать конвейеры, чтобы сделать код более понятным и удобным в сопровождении. Затем освоите кросс-валидацию для более качественного тестирования моделей и подбора оптимальных параметров. В финале познакомитесь с двумя типами ансамблевых моделей.
Начать главу

Машинное обучение с PySpark

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Машинное обучение с PySpark | DataCamp