Build your ultimate AI agent
Opis kursu
Połącz efektywność generatywnej sztucznej inteligencji z wiedzą ekspercką człowieka w tym kursie poświęconym uczeniu przez wzmacnianie z informacją zwrotną od człowieka. Dowiesz się, jak sprawić, by modele generatywnej SI naprawdę odzwierciedlały ludzkie wartości i preferencje, a przy tym zdobędziesz praktyczne doświadczenie z dużymi modelami językowymi. Poznasz też zawiłości modeli nagrody i nauczysz się rozwijać LLM-y tak, by tworzyć SI, która nie tylko się uczy, ale też dostosowuje do rzeczywistych scenariuszy.
Wymagania wstępne
Program kursu
Plan kursu
1
Podstawowe pojęcia
Ten rozdział wprowadza w podstawy uczenia przez wzmacnianie z informacją zwrotną od człowieka (RLHF) – techniki, która wykorzystuje dane od ludzi, aby modele SI uczyły się skuteczniej. Zacznij przygodę z RLHF od zrozumienia, czym różni się ono od klasycznego uczenia przez wzmacnianie i dlaczego ludzka informacja zwrotna może podnosić jakość SI w różnych dziedzinach.
- Wprowadzenie do RLHF50 XP
- Generowanie tekstu z użyciem RLHF100 XP
- Klasyfikowanie wygenerowanego tekstu na potrzeby RLHF100 XP
- RL a RLHF50 XP
- Eksploracja wstępnie wytrenowanych LLM50 XP
- Tokenizacja zbioru danych tekstowych100 XP
- Dostrajanie modelu do klasyfikacji recenzji100 XP
- Przygotowanie danych do RLHF50 XP
- Przygotowanie zbioru danych preferencji100 XP
- Wyodrębnianie promptów50 XP
2
Zbieranie informacji zwrotnej od człowieka
Dowiedz się, jak budować systemy do zbierania informacji zwrotnej od człowieka. Poznaj sprawdzone metody gromadzenia danych wysokiej jakości – od porównań parami po próbkowanie oparte na niepewności – i odkryj strategie usprawniające proces zbierania danych.
3
Dostrajanie modeli z wykorzystaniem informacji zwrotnej od człowieka
W tym rozdziale poznasz sedno procesu trenowania modeli z wykorzystaniem informacji zwrotnej od człowieka. Obejmuje to dostrajanie z użyciem PPO, techniki efektywnego trenowania oraz radzenie sobie z potencjalnymi odchyleniami od celów przyjętych metryk.
4
Ewaluacja modelu
W ostatnim rozdziale kursu poświęconego RLHF poznasz kluczowe techniki oceny i poprawy wydajności modeli. Od doboru metryk dostrajania po uwzględnianie różnorodnych źródeł informacji zwrotnej – otrzymasz kompleksowy zestaw narzędzi do efektywnego doskonalenia swoich modeli.
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Kurs
ukończony

