700+ courses, half price
Opis kursu
Ten kurs jest idealny dla inżynierów danych, data scientistów i praktyków machine learning, którzy chcą efektywnie pracować z dużymi zbiorami danych. Niezależnie od tego, czy przechodzisz z narzędzi takich jak Pandas, czy po raz pierwszy zagłębiasz się w technologie big data, ten kurs oferuje solidne wprowadzenie do PySpark i rozproszonego przetwarzania danych.
Dlaczego Spark? Dlaczego teraz?
Odkryj szybkość i skalowalność Apache Spark — potężnej platformy stworzonej do pracy z big data. Dzięki interaktywnym lekcjom i praktycznym ćwiczeniom zobaczysz, jak przetwarzanie w pamięci Spark daje mu przewagę nad tradycyjnymi frameworkami, takimi jak Hadoop. Zaczniesz od konfiguracji sesji Spark i zagłębisz się w kluczowe komponenty, takie jak Resilient Distributed Datasets (RDD) i DataFrames. Naucz się z łatwością filtrować, grupować i łączyć zbiory danych, pracując na przykładach z życia wziętych.Rozwiń swoje umiejętności w Pythonie i SQL dla Big Data
Dowiedz się, jak wykorzystać PySpark SQL do zapytań i zarządzania danymi, używając znanej składni SQL. Zajmij się schematami, złożonymi typami danych i funkcjami definiowanymi przez użytkownika (UDF), jednocześnie rozwijając umiejętności w zakresie cache’owania i optymalizacji wydajności systemów rozproszonych.Zbuduj fundamenty Big Data
Po ukończeniu tego kursu będziesz mieć pewność, że potrafisz obsługiwać, wykonywać zapytania i przetwarzać big data za pomocą PySpark. Dzięki tym podstawowym umiejętnościom będziesz gotowy(-a) zgłębiać zaawansowane zagadnienia, takie jak uczenie maszynowe i analiza big data.Wymagania wstępne
Program kursu
Plan kursu
1
Wprowadzenie do Apache Spark i PySpark
Ogólne wprowadzenie do PySpark i przetwarzania rozproszonego. Ta sekcja przedstawia PySpark, obiekty DataFrame w PySpark oraz RDD.
- Wprowadzenie do PySpark50 XP
- Tworzenie SparkSession100 XP
- Wczytywanie danych spisowych100 XP
- Wprowadzenie do PySpark DataFrames50 XP
- Skalowalność i wydajność50 XP
- Wczytywanie pliku CSV i wykonywanie agregacji100 XP
- Filtrowanie według lokalizacji firmy100 XP
- Więcej o Spark DataFrames50 XP
- Wnioskowanie schematu i filtrowanie100 XP
- Definiowanie schematu100 XP
2
PySpark w Pythonie
Kontynuacja tematu obiektów DataFrame i złożonych typów danych. Ta sekcja rozszerza wiedzę o możliwościach obiektów DataFrame w PySpark i wprowadza wybrane koncepcje Spark SQL.
3
Wprowadzenie do PySpark SQL
Poznaj możliwości Spark SQL i PySpark w zakresie skalowalnego przetwarzania danych – połącz prostotę SQL z mocą przetwarzania rozproszonego PySpark, aby sprawnie obsługiwać duże zbiory danych.
Wprowadzenie do PySpark
Kurs
ukończony

