Przejdź do głównej treści

Kurs

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zaawansowany4 godz.

Naucz się, jak sprawić, by modele GenAI naprawdę odzwierciedlały ludzkie wartości, zdobywając praktyczne doświadczenie z zaawansowanymi LLM.

Python4 godz.13 filmy38 ćwiczeń2,900 XP3,897Zaświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z Google
lub
Kontynuując, akceptujesz nasz Warunki użytkowania, nasz Polityka prywatności i że Twoje dane są przechowywane w USA.

Uwielbiany przez kursantów z tysięcy firm

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

Połącz efektywność generatywnej sztucznej inteligencji z wiedzą ekspercką człowieka w tym kursie poświęconym uczeniu przez wzmacnianie z informacją zwrotną od człowieka. Dowiesz się, jak sprawić, by modele generatywnej SI naprawdę odzwierciedlały ludzkie wartości i preferencje, a przy tym zdobędziesz praktyczne doświadczenie z dużymi modelami językowymi. Poznasz też zawiłości modeli nagrody i nauczysz się rozwijać LLM-y tak, by tworzyć SI, która nie tylko się uczy, ale też dostosowuje do rzeczywistych scenariuszy.

Wymagania wstępne

Program nauczania

Plan kursu

1

Podstawowe pojęcia

Ten rozdział wprowadza w podstawy uczenia przez wzmacnianie z informacją zwrotną od człowieka (RLHF) – techniki, która wykorzystuje dane od ludzi, aby modele SI uczyły się skuteczniej. Zacznij przygodę z RLHF od zrozumienia, czym różni się ono od klasycznego uczenia przez wzmacnianie i dlaczego ludzka informacja zwrotna może podnosić jakość SI w różnych dziedzinach.
Zacznij rozdział
2

Zbieranie informacji zwrotnej od człowieka

Dowiedz się, jak budować systemy do zbierania informacji zwrotnej od człowieka. Poznaj sprawdzone metody gromadzenia danych wysokiej jakości – od porównań parami po próbkowanie oparte na niepewności – i odkryj strategie usprawniające proces zbierania danych.
Zacznij rozdział
3

Dostrajanie modeli z wykorzystaniem informacji zwrotnej od człowieka

W tym rozdziale poznasz sedno procesu trenowania modeli z wykorzystaniem informacji zwrotnej od człowieka. Obejmuje to dostrajanie z użyciem PPO, techniki efektywnego trenowania oraz radzenie sobie z potencjalnymi odchyleniami od celów przyjętych metryk.
Zacznij rozdział
4

Ewaluacja modelu

W ostatnim rozdziale kursu poświęconego RLHF poznasz kluczowe techniki oceny i poprawy wydajności modeli. Od doboru metryk dostrajania po uwzględnianie różnorodnych źródeł informacji zwrotnej – otrzymasz kompleksowy zestaw narzędzi do efektywnego doskonalenia swoich modeli.
Zacznij rozdział

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Kurs
ukończony

Zdobądź zaświadczenie o ukończeniu

Zapisz się teraz

Rozwijaj swoje umiejętności danych z DataCamp for Mobile

Rozwijaj się w drodze dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.