Ga naar hoofdinhoud

Cursus

Reinforcement Learning from Human Feedback (RLHF)

Gevorderd4 u

Leer hoe je GenAI-modellen echt menselijke waarden kunt laten weerspiegelen en doe tegelijkertijd praktische ervaring op met geavanceerde LLM's.

Python4 u13 video's38 oefeningen2,900 XP3,781Bewijs van voltooiing

Maak je gratis account aan

Ga verder met Google
of
Door verder te gaan accepteer je onze Gebruiksvoorwaarden, onze Privacybeleid en dat uw gegevens in de VS worden opgeslagen.

Geliefd bij learners van duizenden bedrijven

Cursusbeschrijving

Combineer de efficiëntie van Generatieve AI met de inzichten van menselijke expertise in deze cursus over Reinforcement Learning from Human Feedback. Je leert GenAI-modellen echt laten aansluiten bij menselijke waarden en voorkeuren, terwijl je praktisch aan de slag gaat met LLM’s. Ook navigeer je door de complexiteit van beloningsmodellen en leer je hoe je voortbouwt op LLM’s om AI te maken die niet alleen leert, maar zich ook aanpast aan situaties uit de echte wereld.

Vereisten

Curriculum

Cursusoverzicht

1

Fundamentele concepten

Dit hoofdstuk behandelt de basis van Reinforcement Learning with Human Feedback (RLHF), een techniek die menselijk input gebruikt om AI-modellen effectiever te laten leren. Begin met RLHF door te begrijpen hoe het verschilt van traditionele reinforcement learning en waarom menselijke feedback de prestaties van AI in uiteenlopende domeinen kan verbeteren.
Start hoofdstuk
2

Menselijke feedback verzamelen

Ontdek in dit hoofdstuk hoe je systemen opzet om menselijke feedback te verzamelen. Leer best practices voor het verzamelen van hoogwaardige data, van paargewijze vergelijkingen tot uncertainty sampling, en verken strategieën om je dataverzameling te versterken.
Start hoofdstuk
3

Modellen afstemmen met menselijke feedback

In dit hoofdstuk duik je in de kern van trainen met Reinforcement Learning from Human Feedback. Je verkent fine-tuning met PPO, technieken voor efficiënt trainen en hoe je mogelijke afwijkingen van de doelstellingen van je metriek aanpakt.
Start hoofdstuk
4

Modelbeoordeling

Verken in dit laatste hoofdstuk van Reinforcement Learning from Human Feedback (RLHF) belangrijke technieken om modelprestaties te beoordelen en te verbeteren: van het verfijnen van metriek tot het integreren van diverse feedbackbronnen. Je krijgt een complete gereedschapskist om je modellen effectief te finetunen.
Start hoofdstuk

Reinforcement Learning from Human Feedback (RLHF)

Cursus
voltooid

Verdien een Statement of Accomplishment

Nu inschrijven

Verbeter je datavaardigheden met DataCamp voor mobiel

Blijf onderweg bezig met onze mobiele cursussen en dagelijkse programmeeruitdagingen van 5 minuten.