Перейти до основного вмісту

Курс

Reinforcement Learning from Human Feedback (RLHF)

Просунутий4 год

Дізнайтеся, як зробити моделі GenAI справді такими, що відображають людські цінності, здобуваючи практичний досвід із передовими LLM.

Python4 год13 відео38 вправ2,900 XP3,780Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Поєднайте ефективність Generative AI з експертним людським розумінням у курсі про Reinforcement Learning from Human Feedback. Ви навчитеся робити моделі GenAI такими, що справді відображають людські цінності та вподобання, і отримаєте практичний досвід роботи з LLM. Також ви розберетеся зі складнощами моделей винагороди та дізнаєтеся, як розвивати LLM, щоб створювати ШІ, який не лише навчається, а й адаптується до реальних сценаріїв.

Попередні вимоги

Навчальний план

Зміст курсу

1

Базові поняття

У цьому розділі подано основи Reinforcement Learning with Human Feedback (RLHF) — підходу, що використовує людський внесок, аби моделі ШІ навчалися ефективніше. Почніть роботу з RLHF, зрозумівши, чим він відрізняється від класичного підкріплювального навчання та чому людський зворотний зв'язок може підвищувати продуктивність ШІ у різних галузях.
Почати розділ
2

Збір людського зворотного зв'язку

У цьому розділі ви дізнаєтеся, як налаштувати системи для збирання людського зворотного зв'язку. Ознайомитеся з найкращими практиками збирання якісних даних — від парних порівнянь до відбору за невизначеністю — і дослідите стратегії, що допомагають покращити процес збору даних.
Почати розділ
3

Налаштування моделей за допомогою людського зворотного зв'язку

У цьому розділі ви зануритеся в ядро навчання Reinforcement Learning from Human Feedback. Розглянете тонке налаштування з PPO, техніки ефективного тренування та способи обробки можливих відхилень від цілей ваших метрик.
Почати розділ
4

Оцінювання моделей

Ознайомтеся з ключовими методами оцінювання та вдосконалення якості моделей у фінальному розділі Reinforcement Learning from Human Feedback (RLHF): від метрик тонкого налаштування до залучення різних джерел зворотного зв'язку — ви отримаєте повний набір інструментів для ефективного доопрацювання моделей.
Почати розділ

Reinforcement Learning from Human Feedback (RLHF)

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.

Reinforcement Learning from Human Feedback (RLHF) | DataCamp