Перейти к основному контенту

Курс

Основы Big Data с PySpark

Продвинутый4 ч

Освойте основы работы с большими данными с помощью PySpark.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}4,600 XP65,810Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

В последние годы тема Big Data активно обсуждается в профессиональном сообществе и стала стандартом для многих компаний. Но что же такое Big Data? Этот курс охватывает основы работы с большими данными с помощью PySpark. Spark — это высокопроизводительный фреймворк кластерных вычислений для обработки Big Data. Он предоставляет универсальный движок обработки данных и позволяет выполнять программы до 100 раз быстрее в оперативной памяти и до 10 раз быстрее на диске по сравнению с Hadoop. Вы будете использовать PySpark — пакет Python для программирования на Spark — и его мощные высокоуровневые библиотеки, такие как SparkSQL и MLlib (для машинного обучения). В ходе курса вы проанализируете произведения Уильяма Шекспира, данные FIFA 2018 и выполните кластеризацию геномных наборов данных. По завершении курса вы глубоко разберётесь в PySpark и его применении для анализа больших данных.

Предварительные требования

Программа

Структура курса

1

Введение в анализ Big Data с помощью Spark

В этой главе вы познакомитесь с миром Big Data, а также с основными концепциями и различными фреймворками для обработки больших данных. Вы поймёте, почему Apache Spark считается лучшим фреймворком для работы с Big Data.
Начать главу
2

Программирование с использованием RDD в PySpark

4

Машинное обучение с PySpark MLlib

PySpark MLlib — это масштабируемая библиотека машинного обучения Apache Spark для Python, включающая распространённые алгоритмы и вспомогательные инструменты. В последней главе курса вы изучите ключевые алгоритмы машинного обучения, создадите систему рекомендации фильмов и фильтр спама, а также применёте метод k-средних для кластеризации.
Начать главу

Основы Big Data с PySpark

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Основы Big Data с PySpark | DataCamp