Build your ultimate AI agent
Описание курса
Объедините эффективность генеративного ИИ с экспертизой человека в этом курсе по обучению с подкреплением на основе обратной связи. Вы узнаете, как научить модели GenAI отражать ценности и предпочтения людей, и получите практический опыт работы с LLM. Кроме того, вы разберётесь в тонкостях моделей вознаграждения и научитесь создавать на основе LLM ИИ, который не только обучается, но и адаптируется к реальным условиям.
Предварительные требования
Программа
Структура курса
1
Базовые концепции
В этой главе рассматриваются основы обучения с подкреплением на основе обратной связи от людей (RLHF) — метода, при котором человеческая обратная связь помогает моделям ИИ обучаться эффективнее. Вы познакомитесь с RLHF, поймёте, чем он отличается от традиционного обучения с подкреплением, и узнаете, почему обратная связь от людей способна повысить качество ИИ в различных областях.
- Введение в RLHF50 XP
- Генерация текста с помощью RLHF100 XP
- Классификация сгенерированного текста для RLHF100 XP
- RL и RLHF50 XP
- Изучение предобученных LLM50 XP
- Токенизация текстового набора данных100 XP
- Дообучение для классификации отзывов100 XP
- Подготовка данных для RLHF50 XP
- Подготовка набора данных с предпочтениями100 XP
- Извлечение запросов50 XP
2
Сбор обратной связи от людей
В этой главе вы узнаете, как выстраивать системы сбора обратной связи от людей. Изучите лучшие практики получения качественных данных — от попарных сравнений до выборки с неопределённостью — и освойте стратегии повышения эффективности сбора данных.
3
Настройка моделей с использованием обратной связи
В этой главе вы погрузитесь в процесс обучения с подкреплением на основе обратной связи от людей. Вы рассмотрите тонкую настройку с помощью PPO, методы эффективного обучения и способы работы с возможными отклонениями от целевых метрик.
4
Оценка моделей
В последней главе курса по RLHF вы изучите ключевые методы оценки и улучшения качества моделей: от настройки метрик до использования разнообразных источников обратной связи. Вы получите полный набор инструментов для эффективного совершенствования своих моделей.
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Курс
завершён

