Перейти к основному контенту

Курс

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Продвинутый4 ч

Узнайте, как сделать модели GenAI по-настоящему отражающими человеческие ценности, получая практический опыт с продвинутыми LLM.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}2,900 XP3,780Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Объедините эффективность генеративного ИИ с экспертизой человека в этом курсе по обучению с подкреплением на основе обратной связи. Вы узнаете, как научить модели GenAI отражать ценности и предпочтения людей, и получите практический опыт работы с LLM. Кроме того, вы разберётесь в тонкостях моделей вознаграждения и научитесь создавать на основе LLM ИИ, который не только обучается, но и адаптируется к реальным условиям.

Предварительные требования

Программа

Структура курса

1

Базовые концепции

В этой главе рассматриваются основы обучения с подкреплением на основе обратной связи от людей (RLHF) — метода, при котором человеческая обратная связь помогает моделям ИИ обучаться эффективнее. Вы познакомитесь с RLHF, поймёте, чем он отличается от традиционного обучения с подкреплением, и узнаете, почему обратная связь от людей способна повысить качество ИИ в различных областях.
Начать главу
2

Сбор обратной связи от людей

В этой главе вы узнаете, как выстраивать системы сбора обратной связи от людей. Изучите лучшие практики получения качественных данных — от попарных сравнений до выборки с неопределённостью — и освойте стратегии повышения эффективности сбора данных.
Начать главу
3

Настройка моделей с использованием обратной связи

В этой главе вы погрузитесь в процесс обучения с подкреплением на основе обратной связи от людей. Вы рассмотрите тонкую настройку с помощью PPO, методы эффективного обучения и способы работы с возможными отклонениями от целевых метрик.
Начать главу
4

Оценка моделей

В последней главе курса по RLHF вы изучите ключевые методы оценки и улучшения качества моделей: от настройки метрик до использования разнообразных источников обратной связи. Вы получите полный набор инструментов для эффективного совершенствования своих моделей.
Начать главу

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Обучение с подкреплением на основе обратной связи от людей (RLHF) | DataCamp