Ga naar hoofdinhoud

Cursus

Big Data Fundamentals met PySpark

Gevorderd4 u

Leer de basisprincipes van werken met big data met PySpark.

Python4 u16 video's55 oefeningen4,600 XP65,850Bewijs van voltooiing

Maak je gratis account aan

Ga verder met Google
of
Door verder te gaan accepteer je onze Gebruiksvoorwaarden, onze Privacybeleid en dat uw gegevens in de VS worden opgeslagen.

Geliefd bij learners van duizenden bedrijven

Cursusbeschrijving

Er is de afgelopen jaren veel te doen geweest rond Big Data, en inmiddels is het voor veel bedrijven mainstream. Maar wat is Big Data nu precies? Deze cursus behandelt de basisprincipes van Big Data met PySpark. Spark is een framework voor Big Data dat "bliksemsnel clusteren berekeningen" mogelijk maakt. Het biedt een algemene engine voor gegevensverwerking en laat je programma’s tot 100x sneller in het geheugen draaien, of 10x sneller op schijf, dan Hadoop. Je werkt met PySpark, een Python-pakket voor Spark-programmering, en met krachtige, hoog-niveau bibliotheken zoals SparkSQL, MLlib (voor Machine Learning), enzovoort. Je gaat aan de slag met werken van William Shakespeare, analyseert Fifa 2018-gegevens en voert clustering uit op genomische gegevenssets. Aan het einde van deze cursus heb je een diepgaand begrip van PySpark en hoe je het toepast op algemene Big Data-analyse.

Vereisten

Curriculum

Cursusoverzicht

1

Introductie tot Big Data-analyse met Spark

In dit hoofdstuk maak je kennis met de spannende wereld van Big Data, evenals met de verschillende concepten en frameworks voor de verwerking ervan. Je ontdekt waarom Apache Spark wordt gezien als het beste framework voor Big Data.
Start hoofdstuk
4

Machine Learning met PySpark MLlib

Big Data Fundamentals met PySpark

Cursus
voltooid

Verdien een Statement of Accomplishment

Nu inschrijven

Verbeter je datavaardigheden met DataCamp voor mobiel

Blijf onderweg bezig met onze mobiele cursussen en dagelijkse programmeeruitdagingen van 5 minuten.