跳至主要内容

课程

来自人类反馈的强化学习(RLHF)

高级4 小时

学习如何让 GenAI 模型真正体现人类价值观,同时获得高级 LLM 的实操经验。

Python4 小时13 个视频38 个练习2,900 XP3,898成就证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?

试用企业版

课程简介

在本课程中,将生成式 AI 的高效性与人类专家的理解相结合,系统学习来自人类反馈的强化学习。您将掌握如何让 GenAI 模型更真实地体现人类的价值观与偏好,并亲手实践使用 LLM。您还会梳理奖励模型的复杂性,学习如何在 LLM 之上构建既能学习又能适应真实场景的 AI。

先修要求

课程体系

课程大纲

1

基础概念

本章将介绍来自人类反馈的强化学习(RLHF)的基础知识。这是一种利用人类输入来帮助 AI 模型更高效学习的技术。通过理解 RLHF 与传统强化学习的差异,以及人类反馈为何能在多种领域提升 AI 表现,开始您的 RLHF 学习。
开始本章
2

获取人类反馈

在本章中,您将学习如何搭建获取人类反馈的系统。掌握收集高质量数据的最佳实践,从成对比较到不确定性采样,并探索进一步提升数据收集效果的策略。
开始本章
3

基于人类反馈微调模型

在本章中,您将进入来自人类反馈的强化学习训练核心。内容包括使用 PPO 进行微调、提升训练效率的技巧,以及如何在指标目标可能偏离时进行处理。
开始本章
4

模型评估

在本课程最后一章中,探索评估与改进模型性能的关键方法。涵盖从微调指标到引入多元反馈来源等内容,为您提供一套完善的工具,帮助您高效优化 RLHF 模型。
开始本章

来自人类反馈的强化学习(RLHF)

课程已完成

获得成就证明

立即报名

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。