Перейти до основного вмісту

Курс

Основи Big Data з PySpark

Просунутий4 год

Опануйте основи роботи з великими даними за допомогою PySpark.

Python4 год16 відео55 вправ4,600 XP65,822Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Останніми роками навколо Big Data було чимало розмов, і тепер це стало звичним для багатьох компаній. Але що таке Big Data? У цьому курсі ви вивчите основи Big Data за допомогою PySpark. Spark — це фреймворк для Big Data з «блискавично швидкими обчисленнями в кластері». Він надає універсальний рушій для обробки даних і дає змогу запускати програми до 100 разів швидше в пам'яті або до 10 разів швидше на диску, ніж у Hadoop. Ви працюватимете з PySpark — пакетом Python для програмування в Spark — і його потужними високорівневими бібліотеками, як-от SparkSQL, MLlib (для машинного навчання) тощо. Ви дослідите твори Вільяма Шекспіра, проаналізуєте дані Fifa 2018 і виконаєте кластеризацію на геномних наборах даних. Наприкінці курсу ви матимете глибоке розуміння PySpark і того, як застосовувати його для загального аналізу Big Data.

Попередні вимоги

Навчальний план

Зміст курсу

1

Вступ до аналізу Big Data зі Spark

У цьому розділі ви познайомитеся з захопливим світом Big Data, а також із ключовими поняттями та різними фреймворками для її обробки. Ви зрозумієте, чому Apache Spark вважають найкращим фреймворком для Big Data.
Почати розділ
2

Програмування в PySpark RDD

3

PySpark SQL і DataFrame

У цьому розділі ви дізнаєтеся про Spark SQL — модуль Spark для обробки структурованих даних. Він надає програмну абстракцію під назвою DataFrame і також може працювати як розподілений рушій SQL-запитів. Розділ показує, як Spark SQL дає змогу використовувати DataFrame у Python.
Почати розділ
4

Машинне навчання з PySpark MLlib

PySpark MLlib — це масштабовна бібліотека машинного навчання Apache Spark для Python, що містить поширені алгоритми навчання та утиліти. Упродовж цього завершального розділу ви опануєте важливі алгоритми машинного навчання. Ви створите рушій рекомендацій фільмів і фільтр спаму та застосуєте кластеризацію k-means.
Почати розділ

Основи Big Data з PySpark

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.