Accéder au contenu principal

Cours

Introduction au versionnage des données avec DVC

Intermédiaire3 h

Découvrez Data Version Control pour la gestion des données ML. Maîtrisez la configuration, automatisez les pipelines et évaluez les modèles en toute fluidité.

Python3 h12 vidéos35 exercices2,500 XP3,720Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Ce cours propose une introduction complète à Data Version Control (DVC), un outil conçu pour une gestion et une versioning efficaces des données de machine learning. Vous comprendrez le cycle de vie des produits de machine learning, en distinguant le versionnement des données du versionnement du code et en explorant les fonctionnalités et les cas d’usage de DVC.

Exploration des caractéristiques uniques de DVC

Vous comprendrez les motivations derrière le versionnage des données, le cycle de vie du machine learning et les fonctionnalités distinctives ainsi que les cas d’usage de DVC. Vous découvrirez également la configuration de DVC, couvrant l’installation, l’initialisation du dépôt et le fichier .dvcignore. Vous explorerez le cache DVC et les fichiers de staging, apprendrez à ajouter et supprimer des fichiers, à gérer les caches et à comprendre les mécanismes sous-jacents. Vous découvrirez les remotes DVC, expliquerez la distinction entre les remotes DVC et Git, ajouterez des remotes, les listerez et les modifierez. Vous apprendrez à interagir avec des dépôts distants, à pousser et tirer des données, à extraire des versions spécifiques et à récupérer des données dans le cache.

Automatiser et évaluer

Vous serez motivé à automatiser les pipelines de ML, en mettant l’accent sur la modularisation du code et la création d’un fichier de configuration. Vous découvrirez les pipelines DVC sous forme de graphes acycliques dirigés, avec une expérience pratique dans l’ajout d’étapes ainsi que de leurs entrées et sorties. Vous vous entraînerez à exécuter efficacement ces pipelines afin de permettre différents cas d’usage dans l’entraînement de modèles de machine learning. Le cours se termine par un focus sur l’évaluation, en montrant comment les métriques et les graphiques sont suivis dans DVC.

Prérequis

Programme de formation

Plan du cours

1

Introduction à DVC

Ce chapitre propose une introduction complète à Data Version Control (DVC), un outil essentiel pour le versionnage des données en Machine Learning. Vous explorerez les motivations du versionnage des données, comprendrez ses différences avec le versionnage du code et expérimenterez un simple problème de classification. Vous reverrez des commandes Git de base, découvrirez DVC et vous entraînerez à configurer un dépôt. Le chapitre se termine par un panorama des fonctionnalités et cas d’usage de DVC, notamment le versionnage des données et des modèles, la CI/CD pour le Machine Learning, le suivi d’expériences, les pipelines, et plus encore.
Commencer le chapitre
2

Configuration de DVC et gestion des données

Ce chapitre aborde la mise en place de DVC, incluant l’installation, l’initialisation du dépôt et l’utilisation du fichier .dvcignore. Il explore ensuite le cache DVC et les fichiers de staging, en vous apprenant à ajouter et supprimer des fichiers, gérer les caches et comprendre les mécanismes sous-jacents via le hachage MD5. Le chapitre clarifie également les remotes DVC, en les distinguant des remotes Git, et vous guide pour les ajouter, les lister et les modifier. Enfin, vous apprendrez à interagir avec ces remotes en poussant et récupérant des données, en basculant vers des versions spécifiques et en rapatriant des données dans le cache.
Commencer le chapitre
3

Pipelines avec DVC

Ce chapitre se concentre sur l’automatisation des pipelines de ML avec DVC. Vous créez un fichier de configuration contenant des paramètres et des hyperparamètres. Vous apprenez aussi à visualiser un pipeline à l’aide de graphes acycliques orientés et utilisez des commandes pour décrire les dépendances, les commandes et les résultats. L’exécution des pipelines DVC est couverte, y compris l’entraînement local de modèles et la façon dont Git suit les métadonnées DVC. Enfin, vous explorez le suivi des métriques et des graphiques dans DVC, notamment comment afficher les métriques, créer des fichiers de graphiques et comparer métriques et graphiques entre différentes étapes du pipeline.
Commencer le chapitre

Introduction au versionnage des données avec DVC

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.