Build your ultimate AI agent
Kursbeskrivning
Den här kursen ger en omfattande introduktion till Data Version Control (DVC), ett verktyg som är utformat för effektiv hantering och versionskontroll av data för maskininlärning. Du får en förståelse för maskininlärningsproduktens livscykel, lär dig skilja på dataversionering och kodversionering samt utforskar DVC:s funktioner och användningsområden.
Utforska DVC-funktioner
Du kommer att förstå motiven bakom dataversionering, maskininlärningslivscykeln och DVC:s unika funktioner och användningsområden. Du kommer också att lära dig om DVC-konfiguration, inklusive installation, initiering av repository och filen .dvcignore. Du kommer att utforska DVC-cache och staging-filer, lära dig att lägga till och ta bort filer, hantera cacheminnen och förstå de underliggande mekanismerna. Du kommer att lära dig om DVC-fjärrlagringar, förklara skillnaden mellan DVC- och Git-fjärrlagringar, lägga till fjärrlagringar, lista dem och ändra dem. Du kommer att lära dig att interagera med fjärrarkiv, pusha och pulla data, checka ut specifika versioner och hämta data till cachen.Automatisera och utvärdera
Du kommer att motiveras att automatisera ML-pipelines, med fokus på modulär kodstruktur och skapandet av en konfigurationsfil. Du kommer att introduceras till DVC-pipelines som riktade acykliska grafer, med praktisk erfarenhet av att lägga till steg samt deras in- och utdata. Du kommer att öva på att köra dessa pipelines effektivt för att möjliggöra olika användningsområden inom träning av maskininlärningsmodeller. Kursen avslutas med fokus på utvärdering och visar hur mätvärden och diagram spåras i DVC.Förkunskapskrav
Kursplan
Kursöversikt
1
Introduktion till DVC
Det här kapitlet ger en grundlig introduktion till Data Version Control (DVC), ett verktyg som är centralt för dataversionshantering inom maskininlärning. Du utforskar motivationen bakom dataversionshantering, förstår skillnaderna jämfört med kodversionshantering och experimenterar med ett enkelt klassificeringsproblem. Du repeterar grundläggande Git-kommandon, lär dig om DVC och övar på att sätta upp ett repository. Kapitlet avslutas med en översikt av DVC:s funktioner och användningsområden, däribland versionshantering av data och modeller, CI/CD för maskininlärning, experimentspårning, pipelines och mer därtill.
- Motivation till dataversionshantering50 XP
- Anatomi hos en maskininlärningsmodell100 XP
- Skillnader mellan data- och kodversionering50 XP
- Förstå hyperparametrar50 XP
- Introduktion till DVC50 XP
- Arbeta med Git CLI100 XP
- Utforska DVC CLI50 XP
- DVC:s funktioner och användningsområden50 XP
- DVC-pipelines50 XP
- CI/CD för maskininlärning50 XP
2
DVC-konfiguration och datahantering
Det här kapitlet går på djupet med konfigurationen av DVC och täcker installation, initiering av repository och användning av filen .dvcignore. Du utforskar DVC-cachen och hur filer mellanlagras, och lär dig lägga till och ta bort filer, hantera cachen samt förstå de underliggande mekanismerna med hjälp av MD5-hash. Kapitlet förklarar också DVC-fjärrkällor, hur de skiljer sig från Git-fjärrkällor, och visar hur du lägger till, listar och ändrar dem. Avslutningsvis lär du dig interagera med fjärrkällorna genom att pusha och hämta data, checka ut specifika versioner och hämta data till cachen.
3
Pipelines i DVC
Det här kapitlet fokuserar på att automatisera ML-pipelines med DVC. Du skapar en konfigurationsfil med inställningar och hyperparametrar, och lär dig visualisera pipelines med hjälp av riktade acykliska grafer samt använda kommandon för att beskriva beroenden, kommandon och utdata. Du lär dig också köra DVC-pipelines, inklusive lokal modellträning och hur Git spårar DVC-metadata. Dessutom utforskar du spårning av mätvärden och diagram i DVC – hur du skriver ut mätvärden, skapar diagramfiler och jämför mätvärden och diagram mellan olika steg i pipelinen.
Introduktion till dataversionshantering med DVC
Kurs
slutförd

