Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Ce cours propose une introduction complète à Data Version Control (DVC), un outil conçu pour une gestion et une versioning efficaces des données de machine learning. Vous comprendrez le cycle de vie des produits de machine learning, en distinguant le versionnement des données du versionnement du code et en explorant les fonctionnalités et les cas d’usage de DVC.
Exploration des caractéristiques uniques de DVC
Vous comprendrez les motivations derrière le versionnage des données, le cycle de vie du machine learning et les fonctionnalités distinctives ainsi que les cas d’usage de DVC. Vous découvrirez également la configuration de DVC, couvrant l’installation, l’initialisation du dépôt et le fichier .dvcignore. Vous explorerez le cache DVC et les fichiers de staging, apprendrez à ajouter et supprimer des fichiers, à gérer les caches et à comprendre les mécanismes sous-jacents. Vous découvrirez les remotes DVC, expliquerez la distinction entre les remotes DVC et Git, ajouterez des remotes, les listerez et les modifierez. Vous apprendrez à interagir avec des dépôts distants, à pousser et tirer des données, à extraire des versions spécifiques et à récupérer des données dans le cache.Automatiser et évaluer
Vous serez motivé à automatiser les pipelines de ML, en mettant l’accent sur la modularisation du code et la création d’un fichier de configuration. Vous découvrirez les pipelines DVC sous forme de graphes acycliques dirigés, avec une expérience pratique dans l’ajout d’étapes ainsi que de leurs entrées et sorties. Vous vous entraînerez à exécuter efficacement ces pipelines afin de permettre différents cas d’usage dans l’entraînement de modèles de machine learning. Le cours se termine par un focus sur l’évaluation, en montrant comment les métriques et les graphiques sont suivis dans DVC.Prérequis
Programme de formation
Plan du cours
1
Introduction à DVC
Ce chapitre propose une introduction complète à Data Version Control (DVC), un outil essentiel pour le versionnage des données en Machine Learning. Vous explorerez les motivations du versionnage des données, comprendrez ses différences avec le versionnage du code et expérimenterez un simple problème de classification. Vous reverrez des commandes Git de base, découvrirez DVC et vous entraînerez à configurer un dépôt. Le chapitre se termine par un panorama des fonctionnalités et cas d’usage de DVC, notamment le versionnage des données et des modèles, la CI/CD pour le Machine Learning, le suivi d’expériences, les pipelines, et plus encore.
- Pourquoi versionner les données50 XP
- Anatomie d’un modèle de Machine Learning100 XP
- Différences entre le versionnage des données et du code50 XP
- Comprendre les hyperparamètres50 XP
- Introduction à DVC50 XP
- Travailler avec l’interface en ligne de commande de Git100 XP
- Révision de la CLI DVC50 XP
- Fonctionnalités et cas d’usage de DVC50 XP
- Pipelines DVC50 XP
- CI/CD pour le Machine Learning50 XP
2
Configuration de DVC et gestion des données
Ce chapitre aborde la mise en place de DVC, incluant l’installation, l’initialisation du dépôt et l’utilisation du fichier .dvcignore. Il explore ensuite le cache DVC et les fichiers de staging, en vous apprenant à ajouter et supprimer des fichiers, gérer les caches et comprendre les mécanismes sous-jacents via le hachage MD5. Le chapitre clarifie également les remotes DVC, en les distinguant des remotes Git, et vous guide pour les ajouter, les lister et les modifier. Enfin, vous apprendrez à interagir avec ces remotes en poussant et récupérant des données, en basculant vers des versions spécifiques et en rapatriant des données dans le cache.
3
Pipelines avec DVC
Ce chapitre se concentre sur l’automatisation des pipelines de ML avec DVC. Vous créez un fichier de configuration contenant des paramètres et des hyperparamètres. Vous apprenez aussi à visualiser un pipeline à l’aide de graphes acycliques orientés et utilisez des commandes pour décrire les dépendances, les commandes et les résultats. L’exécution des pipelines DVC est couverte, y compris l’entraînement local de modèles et la façon dont Git suit les métadonnées DVC. Enfin, vous explorez le suivi des métriques et des graphiques dans DVC, notamment comment afficher les métriques, créer des fichiers de graphiques et comparer métriques et graphiques entre différentes étapes du pipeline.
Introduction au versionnage des données avec DVC
Cours
terminé

