Przejdź do głównej treści

Kurs

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zaawansowany4 godz.

Naucz się, jak sprawić, by modele GenAI naprawdę odzwierciedlały ludzkie wartości, zdobywając praktyczne doświadczenie z zaawansowanymi LLM.

Python4 godz.{count, plural, one {# film} few {# filmy} many {# filmów} other {# filmów}}{count, plural, one {# ćwiczenie} few {# ćwiczenia} many {# ćwiczeń} other {# ćwiczenia}}2,900 XP3,780Oświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z Google
lub
Kontynuując, akceptujesz nasz Warunki użytkowania, nasz Polityka prywatności i że Twoje dane są przechowywane w USA.

Uwielbiany przez uczących się w tysiącach firm

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

Połącz efektywność generatywnej sztucznej inteligencji z wiedzą ekspercką człowieka w tym kursie poświęconym uczeniu przez wzmacnianie z informacją zwrotną od człowieka. Dowiesz się, jak sprawić, by modele generatywnej SI naprawdę odzwierciedlały ludzkie wartości i preferencje, a przy tym zdobędziesz praktyczne doświadczenie z dużymi modelami językowymi. Poznasz też zawiłości modeli nagrody i nauczysz się rozwijać LLM-y tak, by tworzyć SI, która nie tylko się uczy, ale też dostosowuje do rzeczywistych scenariuszy.

Wymagania wstępne

Program kursu

Plan kursu

1

Podstawowe pojęcia

Ten rozdział wprowadza w podstawy uczenia przez wzmacnianie z informacją zwrotną od człowieka (RLHF) – techniki, która wykorzystuje dane od ludzi, aby modele SI uczyły się skuteczniej. Zacznij przygodę z RLHF od zrozumienia, czym różni się ono od klasycznego uczenia przez wzmacnianie i dlaczego ludzka informacja zwrotna może podnosić jakość SI w różnych dziedzinach.
Rozpocznij rozdział
2

Zbieranie informacji zwrotnej od człowieka

Dowiedz się, jak budować systemy do zbierania informacji zwrotnej od człowieka. Poznaj sprawdzone metody gromadzenia danych wysokiej jakości – od porównań parami po próbkowanie oparte na niepewności – i odkryj strategie usprawniające proces zbierania danych.
Rozpocznij rozdział
3

Dostrajanie modeli z wykorzystaniem informacji zwrotnej od człowieka

W tym rozdziale poznasz sedno procesu trenowania modeli z wykorzystaniem informacji zwrotnej od człowieka. Obejmuje to dostrajanie z użyciem PPO, techniki efektywnego trenowania oraz radzenie sobie z potencjalnymi odchyleniami od celów przyjętych metryk.
Rozpocznij rozdział
4

Ewaluacja modelu

W ostatnim rozdziale kursu poświęconego RLHF poznasz kluczowe techniki oceny i poprawy wydajności modeli. Od doboru metryk dostrajania po uwzględnianie różnorodnych źródeł informacji zwrotnej – otrzymasz kompleksowy zestaw narzędzi do efektywnego doskonalenia swoich modeli.
Rozpocznij rozdział

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Kurs
ukończony

Zdobądź Certyfikat Ukończenia

Zapisz się

Rozwijaj swoje umiejętności danych z DataCamp for Mobile

Rozwijaj się w drodze dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF) | DataCamp