Build your ultimate AI agent
Kursbeskrivning
Kombinera effektiviteten hos generativ AI med mänsklig expertis i den här kursen om Reinforcement Learning from Human Feedback. Du lär dig hur man får GenAI-modeller att verkligen återspegla mänskliga värderingar och preferenser, och du får praktisk erfarenhet av LLM:er. Du utforskar också komplexiteten hos belöningsmodeller och lär dig hur man bygger vidare på LLM:er för att skapa AI som inte bara lär sig utan även anpassar sig till verkliga scenarier.
Förkunskapskrav
Kursplan
Kursöversikt
1
Grundläggande begrepp
Det här kapitlet introducerar grunderna i Reinforcement Learning with Human Feedback (RLHF) – en teknik som använder mänsklig input för att hjälpa AI-modeller att lära sig mer effektivt. Kom igång med RLHF genom att förstå hur det skiljer sig från traditionell reinforcement learning och varför mänsklig feedback kan förbättra AI-prestanda inom olika områden.
- Introduktion till RLHF50 XP
- Textgenerering med RLHF100 XP
- Klassificera genererad text för RLHF100 XP
- RL vs. RLHF50 XP
- Utforska förtränade LLM:er50 XP
- Tokenisera en textdatamängd100 XP
- Finjustering för recensionsklassificering100 XP
- Förbereda data för RLHF50 XP
- Förbereda preferensdatamängden100 XP
- Extrahera prompter50 XP
2
Insamling av mänsklig feedback
Lär dig hur man bygger upp system för insamling av mänsklig feedback i det här kapitlet. Du får ta del av bästa praxis för att samla in högkvalitativ data – från parvisa jämförelser till osäkerhetsbaserad sampling – och utforskar strategier för att förbättra din datainsamling.
3
Finjustering av modeller med mänsklig feedback
I det här kapitlet går du in på kärnan i träning med Reinforcement Learning from Human Feedback. Det inkluderar finjustering med PPO, tekniker för effektiv träning och hantering av potentiella avvikelser från dina måtts mål.
4
Modellutvärdering
Utforska centrala tekniker för att utvärdera och förbättra modellprestanda i det här sista kapitlet om Reinforcement Learning from Human Feedback (RLHF). Från finjustering av mätvärden till att integrera olika feedbackkällor får du en heltäckande verktygslåda för att effektivt förfina dina modeller.
Reinforcement Learning from Human Feedback (RLHF)
Kurs
slutförd

