Build your ultimate AI agent
Descrierea cursului
Combină eficiența inteligenței artificiale generative cu înțelegerea expertizei umane în acest curs despre Reinforcement Learning from Human Feedback. Vei învăța cum să faci modelele GenAI să reflecte cu adevărat valorile și preferințele umane, dobândind totodată experiență practică cu LLM-uri. Vei naviga prin complexitatea modelelor de recompensă și vei învăța cum să construiești pe baza LLM-urilor pentru a produce sisteme AI care nu doar învață, ci și se adaptează la scenarii din lumea reală.
Cerințe prealabile
Curriculum
Structura cursului
1
Concepte fundamentale
Acest capitol introduce elementele de bază ale Reinforcement Learning with Human Feedback (RLHF), o tehnică ce folosește input-ul uman pentru a ajuta modelele AI să învețe mai eficient. Începe cu RLHF înțelegând cum diferă de reinforcement learning-ul tradițional și de ce feedback-ul uman poate îmbunătăți performanța AI în diverse domenii.
- Introducere în RLHF50 XP
- Generarea de text cu RLHF100 XP
- Clasificarea textului generat pentru RLHF100 XP
- RL vs. RLHF50 XP
- Explorarea LLM-urilor pre-antrenate50 XP
- Tokenizarea unui set de date text100 XP
- Ajustarea fină pentru clasificarea recenziilor100 XP
- Pregătirea datelor pentru RLHF50 XP
- Pregătirea setului de date cu preferințe100 XP
- Extragerea prompturilor50 XP
2
Colectarea feedback-ului uman
Descoperă cum să configurezi sisteme pentru colectarea feedback-ului uman în acest capitol. Învață cele mai bune practici pentru colectarea datelor de calitate, de la comparații pereche până la eșantionarea prin incertitudine, și explorează strategii pentru îmbunătățirea colectării datelor.
3
Ajustarea modelelor cu feedback uman
În acest capitol, vei pătrunde în miezul antrenării prin Reinforcement Learning from Human Feedback. Vei explora ajustarea fină cu PPO, tehnici de antrenare eficientă și gestionarea potențialelor divergențe față de obiectivele metricilor tăi.
4
Evaluarea modelelor
Explorează tehnici esențiale pentru evaluarea și îmbunătățirea performanței modelelor în acest ultim capitol despre Reinforcement Learning from Human Feedback (RLHF): de la ajustarea metricilor până la integrarea unor surse diverse de feedback, vei dispune de un set complet de instrumente pentru a-ți rafina modelele eficient.
Reinforcement Learning from Human Feedback (RLHF)
Curs
finalizat

