Build your ultimate AI agent
Description du cours
Travailler avec des données est complexe — et avec des millions, voire des milliards de lignes, c’est encore plus difficile.
Avez-vous reçu du code de traitement de données écrit sur un ordinateur portable avec des données assez propres ?
Vous êtes sans doute chargé de faire passer un processus de données basique du prototype à la production.
Vous avez peut-être travaillé avec des jeux de données réels, comportant des champs manquants, des formats étranges et des volumes de données beaucoup plus importants. Même si tout cela est nouveau pour vous, ce cours vous apprend ce qu’il faut pour préparer des processus de données en Python avec Apache Spark.
Vous apprendrez la terminologie, des méthodes et de bonnes pratiques pour créer une plateforme de traitement de données performante, maintenable et compréhensible.
Prérequis
Programme de formation
Plan du cours
1
Détails sur les DataFrames
Révision des bases des DataFrames et de l’importance du nettoyage des données.
- Introduction au nettoyage des données avec Apache Spark50 XP
- Révision du nettoyage des données50 XP
- Définir un schéma100 XP
- Immutabilité et traitement paresseux50 XP
- Rappel sur l’immutabilité50 XP
- Utiliser l'exécution paresseuse100 XP
- Comprendre Parquet50 XP
- Enregistrer un DataFrame au format Parquet100 XP
- SQL et Parquet100 XP
2
Manipuler des DataFrames en conditions réelles
Panorama de différentes techniques pour modifier le contenu des DataFrames dans Spark.
3
Améliorer les performances
Améliorez les tâches de nettoyage de données en augmentant les performances ou en réduisant les ressources nécessaires.
4
Traitements complexes et pipelines de données
Apprenez à traiter des données réelles complexes avec Spark et les bases des pipelines.
Nettoyer des données avec PySpark
Cours
terminé

