Sari la conținutul principal

Curs

Reinforcement Learning from Human Feedback (RLHF)

Avansat4 h

Învață cum să faci modelele GenAI să reflecte cu adevărat valorile umane, dobândind experiență practică cu LLM-uri avansate.

Python4 h{count, plural, one {# video} few {# videoclipuri} other {# de videoclipuri}}{count, plural, one {# exercițiu} few {# exerciții} other {# de exerciții}}2,900 XP3,780Declarație de finalizare

Creează-ți contul gratuit

Continuă cu Google
sau
Continuând, accepți Termeni de utilizare, al nostru Politica de confidențialitate și că datele tale sunt stocate în SUA.

Iubit de cursanți din mii de companii

Instruiești o echipă?

Încearcă pentru business

Descrierea cursului

Combină eficiența inteligenței artificiale generative cu înțelegerea expertizei umane în acest curs despre Reinforcement Learning from Human Feedback. Vei învăța cum să faci modelele GenAI să reflecte cu adevărat valorile și preferințele umane, dobândind totodată experiență practică cu LLM-uri. Vei naviga prin complexitatea modelelor de recompensă și vei învăța cum să construiești pe baza LLM-urilor pentru a produce sisteme AI care nu doar învață, ci și se adaptează la scenarii din lumea reală.

Cerințe prealabile

Curriculum

Structura cursului

1

Concepte fundamentale

Acest capitol introduce elementele de bază ale Reinforcement Learning with Human Feedback (RLHF), o tehnică ce folosește input-ul uman pentru a ajuta modelele AI să învețe mai eficient. Începe cu RLHF înțelegând cum diferă de reinforcement learning-ul tradițional și de ce feedback-ul uman poate îmbunătăți performanța AI în diverse domenii.
Începe capitolul
2

Colectarea feedback-ului uman

Descoperă cum să configurezi sisteme pentru colectarea feedback-ului uman în acest capitol. Învață cele mai bune practici pentru colectarea datelor de calitate, de la comparații pereche până la eșantionarea prin incertitudine, și explorează strategii pentru îmbunătățirea colectării datelor.
Începe capitolul
3

Ajustarea modelelor cu feedback uman

În acest capitol, vei pătrunde în miezul antrenării prin Reinforcement Learning from Human Feedback. Vei explora ajustarea fină cu PPO, tehnici de antrenare eficientă și gestionarea potențialelor divergențe față de obiectivele metricilor tăi.
Începe capitolul
4

Evaluarea modelelor

Explorează tehnici esențiale pentru evaluarea și îmbunătățirea performanței modelelor în acest ultim capitol despre Reinforcement Learning from Human Feedback (RLHF): de la ajustarea metricilor până la integrarea unor surse diverse de feedback, vei dispune de un set complet de instrumente pentru a-ți rafina modelele eficient.
Începe capitolul

Reinforcement Learning from Human Feedback (RLHF)

Curs
finalizat

Obține Declarația de Realizare

Înscrie-te acum

Dezvoltă-ți competențele în date cu DataCamp pentru mobil

Progresează oricând cu cursurile noastre mobile și provocările zilnice de programare de 5 minute.

Reinforcement Learning from Human Feedback (RLHF) | DataCamp