Build your ultimate AI agent
Cursusbeschrijving
Deze cursus is ideaal voor data-engineers, datawetenschappers en machine learning-specialisten die efficiënt met grote datasets willen werken. Of je nu overstapt van tools zoals Pandas of voor het eerst met big data-technologieën aan de slag gaat, deze cursus biedt een goede introductie tot PySpark en gedistribueerde gegevensverwerking.
Waarom Spark? Waarom nu?
Ontdek de snelheid en schaalbaarheid van Apache Spark, het krachtige framework dat is ontworpen voor het verwerken van big data. Door interactieve lessen en praktische oefeningen zie je hoe Spark met zijn in-memory-verwerking een voorsprong heeft op traditionele frameworks zoals Hadoop. Je begint met het opzetten van Spark-sessies en duikt in de belangrijkste onderdelen, zoals Resilient Distributed Datasets (RDD's) en DataFrames. Leer hoe je datasets makkelijk kunt filteren, groeperen en samenvoegen terwijl je met echte voorbeelden werkt.Verbeter je Python- en SQL-vaardigheden voor big data
Leer hoe je PySpark SQL kunt gebruiken voor het opvragen en beheren van gegevens met behulp van de bekende SQL-syntaxis. Werk met schema's, ingewikkelde gegevenstypen en door gebruikers gedefinieerde functies (UDF's), terwijl je vaardigheden opbouwt in caching en het optimaliseren van prestaties voor gedistribueerde systemen.Bouw je basis voor big data
Aan het einde van deze cursus heb je het zelfvertrouwen om big data te verwerken, te doorzoeken en te bewerken met PySpark. Met deze basisvaardigheden ben je klaar om geavanceerde onderwerpen zoals machine learning en big data-analyse te ontdekken.Vereisten
Curriculum
Cursusoverzicht
1
Introductie tot Apache Spark en PySpark
Een algemene introductie tot PySpark en gedistribueerd rekenen. Deze sectie introduceert PySpark, PySpark DataFrames en RDD's.
- Kennismaking met PySpark50 XP
- Een SparkSession maken100 XP
- Census-gegevens laden100 XP
- Introductie tot PySpark DataFrames50 XP
- Schaalbaarheid en prestaties50 XP
- Een CSV inlezen en aggregaties uitvoeren100 XP
- Filteren op bedrijf100 XP
- Meer over Spark DataFrames50 XP
- Afbellen en filteren100 XP
- Schema uitschrijven100 XP
2
PySpark in Python
Een vervolg op DataFrames en complexe datatypen. Deze sectie breidt uit wat DataFrames in PySpark bieden en introduceert enkele Spark SQL-concepten.
3
Introductie tot PySpark SQL
Ga dieper in op het benutten van Spark SQL en PySpark voor schaalbare gegevensverwerking: de eenvoud van SQL gecombineerd met de kracht van PySpark voor gedistribueerd rekenen om grote gegevenssets efficiënt te verwerken.
Introductie tot PySpark
Cursus
voltooid

