Vai al contenuto principale

Corso

Fondamenti di Big Data con PySpark

Avanzato4 h

Impara le basi per lavorare con i big data usando PySpark.

Python4 h16 video55 esercizi4,600 XP65,857Attestato di conseguimento

Crea il tuo account gratuito

Continua con Google
o
Continuando, accetti i nostri Condizioni d'uso, il nostro Informativa sulla privacy e che i tuoi dati siano archiviati negli USA.

Amato da studenti in migliaia di aziende

Descrizione del corso

Negli ultimi anni si è parlato molto di Big Data, e ormai sono entrati nel mainstream per molte aziende. Ma cosa sono davvero i Big Data? Questo corso copre i fondamenti dei Big Data tramite PySpark. Spark è un framework di "lightning fast cluster computing" per i Big Data. Fornisce un motore generale per l’elaborazione dei dati e ti permette di eseguire programmi fino a 100 volte più veloci in memoria, o 10 volte più veloci su disco, rispetto a Hadoop. Userai PySpark, un pacchetto Python per programmare in Spark, e le sue potenti librerie di livello superiore come SparkSQL, MLlib (per il Machine Learning), ecc. Esplorerai le opere di William Shakespeare, analizzerai i dati dei Mondiali Fifa 2018 ed eseguirai il clustering su insiemi di dati genomici. Al termine del corso, avrai una comprensione approfondita di PySpark e della sua applicazione all’analisi generale dei Big Data.

Prerequisiti

Curriculum

Programma del corso

1

Introduzione all’analisi dei Big Data con Spark

Questo capitolo introduce l’entusiasmante mondo dei Big Data, insieme ai vari concetti e ai diversi framework per l’elaborazione dei Big Data. Capirai perché Apache Spark è considerato il miglior framework per i Big Data.
Inizia capitolo

Fondamenti di Big Data con PySpark

Corso
completato

Ottieni l'attestato di completamento

Iscriviti ora

Aumenta le tue competenze sui dati con l'app di DataCamp

Avanza ovunque ti trovi con i nostri corsi per dispositivi mobili e le nostre sfide di programmazione quotidiane da 5 minuti.