Po ukończeniu tych kursów czuję się pewnie w tworzeniu profesjonalnych wizualizacji i pulpitów nawigacyjnych
Opis kursu
Praca z danymi bywa wymagająca – a praca z milionami czy nawet miliardami wierszy to już prawdziwe wyzwanie.
Czy zdarzyło ci się otrzymać kod do przetwarzania danych napisany na laptopie z niemal idealnymi danymi?
Pewnie nie raz trafiło ci się przejąć podstawowy proces przetwarzania danych i przenieść go z prototypu na produkcję.
Możliwe, że masz już doświadczenie z rzeczywistymi zbiorami danych – z brakującymi polami, dziwnym formatowaniem i wolumenem danych większym o rzędy wielkości. Nawet jeśli to wszystko jest dla ciebie nowe, ten kurs pomoże ci opanować to, czego potrzebujesz, by przygotować procesy przetwarzania danych w Pythonie z Apache Spark.
Poznasz terminologię, metody oraz sprawdzone praktyki tworzenia wydajnej, łatwej w utrzymaniu i czytelnej platformy do przetwarzania danych.
Wymagania wstępne
Program nauczania
Plan kursu
1
Szczegóły DataFrame
Przegląd podstaw DataFrame oraz znaczenia czyszczenia danych.
- Wprowadzenie do czyszczenia danych w Apache Spark50 XP
- Powtórka: czyszczenie danych50 XP
- Definiowanie schematu100 XP
- Niemutowalność i leniwe przetwarzanie50 XP
- Powtórzenie: niezmienność50 XP
- Leniwe przetwarzanie w praktyce100 XP
- Czym jest Parquet50 XP
- Zapisywanie ramki danych w formacie Parquet100 XP
- SQL i Parquet100 XP
2
Modyfikowanie DataFrame w praktyce
Omówienie różnych technik modyfikowania zawartości DataFrame w Sparku.
3
Poprawa wydajności
Usprawnij zadania związane z czyszczeniem danych, zwiększając wydajność lub ograniczając zużycie zasobów.
4
Zaawansowane przetwarzanie i potoki danych
Naucz się przetwarzać złożone dane rzeczywiste przy użyciu Sparka oraz poznaj podstawy potoków danych.
Czyszczenie danych w PySpark
Kurs
ukończony

