Перейти к основному содержимому

Курс

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Продвинутый4 ч

Узнайте, как сделать модели GenAI по-настоящему отражающими человеческие ценности, получая практический опыт с продвинутыми LLM.

Python4 чвидео: 13Упражнений: 382,900 XP3,900Свидетельство о достижении

Создать бесплатный аккаунт

Продолжить через Google
или
Продолжая, вы принимаете нашу Условия использования, наши Политику конфиденциальности и то, что ваши данные хранятся в США.

Нас выбирают учащиеся из тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Объедините эффективность генеративного ИИ с экспертизой человека в этом курсе по обучению с подкреплением на основе обратной связи. Вы узнаете, как научить модели GenAI отражать ценности и предпочтения людей, и получите практический опыт работы с LLM. Кроме того, вы разберётесь в тонкостях моделей вознаграждения и научитесь создавать на основе LLM ИИ, который не только обучается, но и адаптируется к реальным условиям.

Предварительные требования

Программа

План курса

1

Базовые концепции

В этой главе рассматриваются основы обучения с подкреплением на основе обратной связи от людей (RLHF) — метода, при котором человеческая обратная связь помогает моделям ИИ обучаться эффективнее. Вы познакомитесь с RLHF, поймёте, чем он отличается от традиционного обучения с подкреплением, и узнаете, почему обратная связь от людей способна повысить качество ИИ в различных областях.
Начать главу
2

Сбор обратной связи от людей

В этой главе вы узнаете, как выстраивать системы сбора обратной связи от людей. Изучите лучшие практики получения качественных данных — от попарных сравнений до выборки с неопределённостью — и освойте стратегии повышения эффективности сбора данных.
Начать главу
3

Настройка моделей с использованием обратной связи

В этой главе вы погрузитесь в процесс обучения с подкреплением на основе обратной связи от людей. Вы рассмотрите тонкую настройку с помощью PPO, методы эффективного обучения и способы работы с возможными отклонениями от целевых метрик.
Начать главу
4

Оценка моделей

В последней главе курса по RLHF вы изучите ключевые методы оценки и улучшения качества моделей: от настройки метрик до использования разнообразных источников обратной связи. Вы получите полный набор инструментов для эффективного совершенствования своих моделей.
Начать главу

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Курс
завершён

Получить сертификат об окончании

Записаться сейчас

Развивайте навыки работы с данными с помощью DataCamp для мобильных устройств

Продвигайтесь вперёд в дороге с нашими мобильными курсами и ежедневными 5-минутными заданиями по программированию.