跳至主要内容

学习路径

强化学习 在 Python 中

掌握强化学习(RL)的基础,创建能够在复杂现实环境中导航并训练 LLM 的模型。

  • Python
  • 机器学习
  • 12 人力资源
  • 4,524

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?试用企业版

学习路径描述

强化学习 在 Python 中

掌握强化学习(RL)的基础知识,并了解如何构建模型以应对机器人和电子游戏中常见的复杂环境。如果你刚接触强化学习,或者想将强化学习作为机器学习的一个分支进行专攻,这里是理想的起点。你将首先学习强化学习的核心概念,例如马尔可夫决策过程、探索/利用权衡以及动态规划算法。 你将学习如何应用 Q-learning、SARSA 及其他方法,借助 Gymnasium 库在山脉和冰湖中导航。你将融合深度学习和强化学习,探索深度强化学习,它可用于训练智能体在几乎没有监督的情况下应对高度复杂的环境。一路上,你将把这些技术应用到实际项目中,包括优化出租车路线和股票交易模拟。有了这些强化学习工具,你就可以开始应对强化学习的一个令人兴奋的新应用:来自人类反馈的强化学习(RLHF)。 RLHF 可通过基于人类对其响应的反馈进行训练来改进 LLM 输出。今天就开始你的强化学习之旅!

先修要求

此学习路径无先决条件

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。