Accéder au contenu principal

Cours

Principes fondamentaux de PySpark

Intermédiaire4 h

Apprenez à mettre en œuvre la gestion des données distribuées et l'apprentissage automatique dans Spark à l'aide du package PySpark.

Python4 h45 exercices3,850 XP150K+Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Dans ce cours, vous apprendrez à utiliser Spark à partir de Python. Spark est un outil permettant d'effectuer des calculs parallèles sur de grands ensembles de données et s'intègre parfaitement à Python. PySpark est le paquet Python qui rend cela possible. Vous utiliserez ce paquet pour traiter les données relatives aux vols au départ de Portland et de Seattle. Vous apprendrez à exploiter ces données et à mettre en place un pipeline complet de machine learning afin de prédire si les vols seront retardés ou non. Préparez-vous à ajouter un peu de Spark à votre code Python et à plonger dans le monde du machine learning haute performance.

Prérequis

Programme de formation

Plan du cours

3

Premiers pas avec les pipelines de machine learning

Principes fondamentaux de PySpark

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.