Build your ultimate AI agent
Kursbeschreibung
Dieser Kurs gibt dir einen umfassenden Überblick über Data Version Control (DVC), ein Tool, das für die effiziente Verwaltung und Versionierung von Daten für maschinelles Lernen entwickelt wurde. Du lernst den Produktlebenszyklus des maschinellen Lernens kennen, verstehst den Unterschied zwischen Datenversionierung und Codeversionierung und schaust dir die Funktionen und Anwendungsfälle von DVC an.
Entdecke die Funktionen von DVC
Du wirst die Gründe für die Datenversionierung, den Lebenszyklus des maschinellen Lernens und die besonderen Funktionen und Anwendungsfälle von DVC verstehen. Du lernst auch was über die DVC-Einrichtung, einschließlich Installation, Repository-Initialisierung und die Datei .dvcignore. Du wirst DVC-Cache- und Staging-Dateien erkunden, lernen, wie man Dateien hinzufügt und entfernt, Caches verwaltet und die zugrunde liegenden Mechanismen versteht. Du lernst was über DVC-Remotes, bekommst erklärt, wie sich DVC- und Git-Remotes unterscheiden, und kannst Remotes hinzufügen, auflisten und ändern. Du lernst, wie du mit Remote-Servern interagierst, Daten pushst und pullst, bestimmte Versionen auscheckst und Daten in den Cache holst.Automatisieren und bewerten
Du wirst motiviert sein, ML-Pipelines zu automatisieren, wobei der Schwerpunkt auf der Modularisierung von Code und der Erstellung einer Konfigurationsdatei liegt. Du lernst DVC-Pipelines als gerichtete azyklische Graphen kennen und kannst selbst Stufen und deren Ein- und Ausgänge hinzufügen. Du wirst üben, diese Pipelines effizient auszuführen, um verschiedene Anwendungsfälle beim Training von Machine-Learning-Modellen zu ermöglichen. Der Kurs endet mit einem Fokus auf die Auswertung und zeigt, wie Metriken und Plots in DVC verfolgt werden.Voraussetzungen
Lernprogramm
Kursübersicht
1
Einführung in DVC
Dieses Kapitel bietet eine umfassende Einführung in Data Version Control (DVC), ein unverzichtbares Tool für die Datenversionierung im Machine Learning. Du lernst die Motivation hinter der Datenversionierung kennen, verstehst die Unterschiede zur Code-Versionierung und arbeitest an einem einfachen Klassifikationsproblem. Außerdem wiederholst du grundlegende Git-Befehle, lernst DVC kennen und übst das Einrichten eines Repositories. Zum Schluss erhältst du einen Überblick über DVCs Funktionen und Anwendungsfälle, darunter das Versionieren von Daten und Modellen, CI/CD für Machine Learning, Experiment-Tracking, Pipelines und mehr.
- Motivation für Data Versioning50 XP
- Anatomie eines Machine-Learning-Modells100 XP
- Unterschiede zwischen Daten- und Code-Versionierung50 XP
- Hyperparameter verstehen50 XP
- Einführung in DVC50 XP
- Arbeiten mit der Git-CLI100 XP
- DVC-CLI wiederholen50 XP
- DVC‑Funktionen und Anwendungsfälle50 XP
- DVC-Pipelines50 XP
- CI/CD für Machine Learning50 XP
2
DVC-Konfiguration und Datenmanagement
Dieses Kapitel behandelt die Einrichtung von DVC, einschließlich Installation, Initialisierung des Repositories und Nutzung der Datei .dvcignore. Außerdem erkundest du den DVC-Cache und Staging-Dateien und erfährst, wie du Dateien hinzufügst und entfernst, Caches verwaltest und die zugrunde liegenden Mechanismen mit dem MD5-Hash verstehst. Das Kapitel erläutert zudem DVC-Remotes, grenzt sie von Git-Remotes ab und zeigt dir, wie du sie hinzufügst, auflistest und änderst. Abschließend lernst du, wie du mit diesen Remotes interagierst: Daten pushen und pullen, bestimmte Versionen auschecken und Daten in den Cache laden.
3
Pipelines in DVC
Dieses Kapitel konzentriert sich auf die Automatisierung von ML-Pipelines mit DVC. Du erstellst eine Konfigurationsdatei mit Einstellungen und Hyperparametern. Außerdem lernst du die Pipeline-Visualisierung mit gerichteten azyklischen Graphen kennen und verwendest Befehle, um Abhängigkeiten, Befehle und Ausgaben zu beschreiben. Die Ausführung von DVC-Pipelines wird behandelt, einschließlich lokalem Modelltraining und der Art, wie Git DVC-Metadaten verfolgt. Zusätzlich erkundest du das Tracking von Metriken und Plots in DVC, einschließlich des Ausgebens von Metriken, Erstellens von Plot-Dateien und Vergleichens von Metriken und Plots über verschiedene Pipeline-Schritte hinweg.
Einführung in Data Versioning mit DVC
Kurs
abgeschlossen

