Przejdź do głównej treści

Kurs

Podstawy Big Data z PySpark

Zaawansowany4 godz.

Poznaj podstawy pracy z big data w PySpark.

Python4 godz.16 filmy55 ćwiczeń4,600 XP66,513Zaświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z Google
lub
Kontynuując, akceptujesz nasz Warunki użytkowania, nasz Polityka prywatności i że Twoje dane są przechowywane w USA.

Uwielbiany przez kursantów z tysięcy firm

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

W ostatnich latach temat Big Data stał się niezwykle popularny i trafił do głównego nurtu w wielu firmach. Czym jednak właściwie jest Big Data? Ten kurs omawia podstawy Big Data za pomocą PySpark. Spark to framework do obliczeń klastrowych, który działa błyskawicznie. Zapewnia ogólną platformę przetwarzania danych i pozwala uruchamiać programy nawet 100 razy szybciej w pamięci – lub 10 razy szybciej na dysku – niż Hadoop. Będziesz korzystać z PySpark, pakietu Pythona do programowania w Spark, oraz jego zaawansowanych bibliotek, takich jak SparkSQL czy MLlib (do uczenia maszynowego). Przeanalizujesz dzieła Williama Szekspira, zbadasz dane z Fify 2018 i przeprowadzisz grupowanie na zbiorach danych genomicznych. Po ukończeniu kursu będziesz mieć solidne zrozumienie PySpark i jego zastosowania w ogólnej analizie Big Data.

Wymagania wstępne

Program nauczania

Plan kursu

1

Wprowadzenie do analizy Big Data z Spark

Ten rozdział wprowadza w świat Big Data oraz omawia różne koncepcje i frameworki służące do jego przetwarzania. Dowiesz się, dlaczego Apache Spark jest uważany za najlepszy framework do pracy z Big Data.
Zacznij rozdział
4

Uczenie maszynowe z PySpark MLlib

Podstawy Big Data z PySpark

Kurs
ukończony

Zdobądź zaświadczenie o ukończeniu

Zapisz się teraz

Rozwijaj swoje umiejętności danych z DataCamp for Mobile

Rozwijaj się w drodze dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.