Hoppa till huvudinnehållet

Kurs

Reinforcement Learning from Human Feedback (RLHF)

Avancerad4 tim

Lär dig hur du får GenAI-modeller att verkligen spegla mänskliga värderingar samtidigt som du får praktisk erfarenhet av avancerade LLM:er.

Python4 tim13 videor38 övningar2,900 XP3,778Intyg om fullgjord kurs

Skapa ditt kostnadsfria konto

Fortsätt med Google
eller
Genom att fortsätta godkänner du våra Användarvillkor, vår Integritetspolicy och att dina data lagras i USA.

Älskad av elever på tusentals företag

Utbildar ett team?

Prova för företag

Kursbeskrivning

Kombinera effektiviteten hos generativ AI med mänsklig expertis i den här kursen om Reinforcement Learning from Human Feedback. Du lär dig hur man får GenAI-modeller att verkligen återspegla mänskliga värderingar och preferenser, och du får praktisk erfarenhet av LLM:er. Du utforskar också komplexiteten hos belöningsmodeller och lär dig hur man bygger vidare på LLM:er för att skapa AI som inte bara lär sig utan även anpassar sig till verkliga scenarier.

Förkunskapskrav

Kursplan

Kursöversikt

1

Grundläggande begrepp

Det här kapitlet introducerar grunderna i Reinforcement Learning with Human Feedback (RLHF) – en teknik som använder mänsklig input för att hjälpa AI-modeller att lära sig mer effektivt. Kom igång med RLHF genom att förstå hur det skiljer sig från traditionell reinforcement learning och varför mänsklig feedback kan förbättra AI-prestanda inom olika områden.
Starta kapitel
2

Insamling av mänsklig feedback

Lär dig hur man bygger upp system för insamling av mänsklig feedback i det här kapitlet. Du får ta del av bästa praxis för att samla in högkvalitativ data – från parvisa jämförelser till osäkerhetsbaserad sampling – och utforskar strategier för att förbättra din datainsamling.
Starta kapitel
3

Finjustering av modeller med mänsklig feedback

I det här kapitlet går du in på kärnan i träning med Reinforcement Learning from Human Feedback. Det inkluderar finjustering med PPO, tekniker för effektiv träning och hantering av potentiella avvikelser från dina måtts mål.
Starta kapitel
4

Modellutvärdering

Utforska centrala tekniker för att utvärdera och förbättra modellprestanda i det här sista kapitlet om Reinforcement Learning from Human Feedback (RLHF). Från finjustering av mätvärden till att integrera olika feedbackkällor får du en heltäckande verktygslåda för att effektivt förfina dina modeller.
Starta kapitel

Reinforcement Learning from Human Feedback (RLHF)

Kurs
slutförd

Tjäna intyg om genomförande

Registrera dig nu

Utveckla dina datakunskaper med DataCamp för mobil

Ta dig framåt var du än är med våra mobilkurser och dagliga 5-minuterskodningsutmaningar.

Reinforcement Learning from Human Feedback (RLHF) | DataCamp