Build your ultimate AI agent
Descrizione del corso
Questo corso è perfetto per ingegneri dei dati, data scientist e professionisti del machine learning che vogliono lavorare in modo efficiente con grandi set di dati. Che tu stia passando da strumenti come Pandas o ti stia avvicinando per la prima volta alle tecnologie dei big data, questo corso ti dà una solida introduzione a PySpark e all'elaborazione distribuita dei dati.
Perché Spark? Perché adesso?
Scopri la velocità e la scalabilità di Apache Spark, il potente framework fatto apposta per gestire i big data. Grazie a lezioni interattive ed esercizi pratici, scoprirai come l'elaborazione in memoria di Spark gli dia un vantaggio rispetto ai framework tradizionali come Hadoop. Inizierai configurando le sessioni Spark e ti immergerai nei componenti principali come i Resilient Distributed Datasets (RDD) e i DataFrame. Impara a filtrare, raggruppare e unire i set di dati in modo facile mentre lavori su esempi reali.Migliora le tue competenze in Python e SQL per i Big Data
Scopri come usare PySpark SQL per fare query e gestire i dati usando la sintassi SQL che già conosci. Affronta schemi, tipi di dati complessi e funzioni definite dall'utente (UDF), mentre impari a gestire la cache e a ottimizzare le prestazioni per i sistemi distribuiti.Costruisci le tue basi per i big data
Alla fine di questo corso, avrai la sicurezza necessaria per gestire, interrogare ed elaborare grandi quantità di dati usando PySpark. Con queste competenze di base, sarai pronto per approfondire argomenti più complessi come l'apprendimento automatico e l'analisi dei big data.Prerequisiti
Curriculum
Programma del corso
1
Introduzione ad Apache Spark e PySpark
Un’introduzione generale a PySpark e al calcolo distribuito. Questa sezione presenta PySpark, i DataFrame di PySpark e gli RDD.
- Introduzione a PySpark50 XP
- Creare una SparkSession100 XP
- Caricare i dati del censimento100 XP
- Introduzione ai DataFrame di PySpark50 XP
- Scalabilità e prestazioni50 XP
- Lettura di un CSV ed esecuzione di aggregazioni100 XP
- Filtrare per azienda100 XP
- Approfondiamo gli Spark DataFrame50 XP
- Inferisci e filtra100 XP
- Scrittura dello schema100 XP
2
PySpark in Python
Prosecuzione su DataFrame e tipi di dati complessi. Questa sezione approfondisce ciò che offrono i DataFrame in PySpark e introduce alcuni concetti di Spark SQL.
3
Introduzione a PySpark SQL
Approfondisci come sfruttare Spark SQL e PySpark per l’elaborazione di dati su larga scala, unendo la semplicità di SQL alla potenza del calcolo distribuito di PySpark per gestire grandi insiemi di dati in modo efficiente.
Introduzione a PySpark
Corso
completato

