跳至内容

课程

来自人类反馈的强化学习(RLHF)

高级4 小时

学习如何让 GenAI 模型真正体现人类价值观,同时获得高级 LLM 的实操经验。

Python4 小时13 个视频38 个练习2,900 经验值3,780结业证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 并且您的数据存储在美国。

深受上千家公司学习者喜爱

要培训团队?

试用企业版

课程介绍

在本课程中,将生成式 AI 的高效性与人类专家的理解相结合,系统学习来自人类反馈的强化学习。您将掌握如何让 GenAI 模型更真实地体现人类的价值观与偏好,并亲手实践使用 LLM。您还会梳理奖励模型的复杂性,学习如何在 LLM 之上构建既能学习又能适应真实场景的 AI。

先修要求

课程大纲

课程大纲

1

基础概念

本章将介绍来自人类反馈的强化学习(RLHF)的基础知识。这是一种利用人类输入来帮助 AI 模型更高效学习的技术。通过理解 RLHF 与传统强化学习的差异,以及人类反馈为何能在多种领域提升 AI 表现,开始您的 RLHF 学习。
开始本章
3

基于人类反馈微调模型

在本章中,您将进入来自人类反馈的强化学习训练核心。内容包括使用 PPO 进行微调、提升训练效率的技巧,以及如何在指标目标可能偏离时进行处理。
开始本章

来自人类反馈的强化学习(RLHF)

课程完成

获取成就证书

立即报名

通过 DataCamp for Mobile 提升您的数据技能

通过我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。

来自人类反馈的强化学习(RLHF) | DataCamp