Перейти к основному содержимому

Курс

Основы Big Data с PySpark

Продвинутый4 ч

Освойте основы работы с большими данными с помощью PySpark.

Python4 чвидео: 16Упражнений: 554,600 XP66,513Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

В последние годы тема Big Data активно обсуждается в профессиональном сообществе и стала стандартом для многих компаний. Но что же такое Big Data? Этот курс охватывает основы работы с большими данными с помощью PySpark. Spark — это высокопроизводительный фреймворк кластерных вычислений для обработки Big Data. Он предоставляет универсальный движок обработки данных и позволяет выполнять программы до 100 раз быстрее в оперативной памяти и до 10 раз быстрее на диске по сравнению с Hadoop. Вы будете использовать PySpark — пакет Python для программирования на Spark — и его мощные высокоуровневые библиотеки, такие как SparkSQL и MLlib (для машинного обучения). В ходе курса вы проанализируете произведения Уильяма Шекспира, данные FIFA 2018 и выполните кластеризацию геномных наборов данных. По завершении курса вы глубоко разберётесь в PySpark и его применении для анализа больших данных.

Предварительные требования

Программа

План курса

1

Введение в анализ Big Data с помощью Spark

В этой главе вы познакомитесь с миром Big Data, а также с основными концепциями и различными фреймворками для обработки больших данных. Вы поймёте, почему Apache Spark считается лучшим фреймворком для работы с Big Data.
Начать главу
2

Программирование с использованием RDD в PySpark

4

Машинное обучение с PySpark MLlib

PySpark MLlib — это масштабируемая библиотека машинного обучения Apache Spark для Python, включающая распространённые алгоритмы и вспомогательные инструменты. В последней главе курса вы изучите ключевые алгоритмы машинного обучения, создадите систему рекомендации фильмов и фильтр спама, а также применёте метод k-средних для кластеризации.
Начать главу

Основы Big Data с PySpark

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.