跳至主要内容

课程

Python 中的 Gymnasium 强化学习

高级4 小时

开启你的强化学习之旅!了解智能体如何通过交互学习解决环境。

Python4 小时15 个视频52 个练习4,400 XP13,628成就证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?

试用企业版

课程简介

探索强化学习的世界

踏上一段激动人心的强化学习(RL)探索之旅,强化学习是机器学习的一个关键分支。 这门互动课程将带你全面了解强化学习(RL)的核心原理,在这里你将掌握训练智能体的艺术,教会它们做出战略决策并最大化奖励。

掌握核心概念与工具

你的探索之旅将从深入了解强化学习的独特之处开始。 你不仅会学习强化学习的基础概念,还会使用知名的 OpenAI Gym 工具包将关键强化学习算法应用于实际场景。 这种实践导向的方法可确保全面掌握强化学习的核心要点。

掌握高级策略与应用

随着你的学习之旅展开,你将深入高级强化学习策略的领域,探索蒙特卡洛方法、时序差分学习和 Q-Learning 的复杂机制。 通过掌握 Python 中的这些技术,你将能够熟练训练智能体来完成各种复杂任务。

将你的学习转化为现实世界的影响力

完成本课程后,你将对强化学习理论有深刻的理解,并具备在现实场景中创造性应用它的技能。 你将能够使用 Python 构建 RL 模型,为你的项目和职业发展开启无限可能。

先修要求

课程体系

课程大纲

1

强化学习入门

走进强化学习(RL)的精彩世界,了解其基础概念、角色与应用。带您梳理 RL 框架,理解智能体与环境的交互。您还将学习如何使用 Gymnasium 库创建环境、可视化状态并执行动作,从而为 RL 概念与应用打下实践基础。
开始本章
3

无模型学习

踏入 RL 中无模型学习的动态领域。首先认识基础的蒙特卡罗方法,并应用首次访问与每次访问的蒙特卡罗预测算法。随后过渡到时序差分学习,探索 SARSA 算法。最后深入 Q-learning,并分析其在复杂环境中的收敛性。
开始本章
4

无模型 RL 的高级策略

深入无模型 RL 的高级策略,重点提升决策算法。学习 Expected SARSA,以获得更准确的策略更新;以及 Double Q-learning,用于缓解过度估计偏差。探索探索—利用权衡,熟练掌握 epsilon-greedy 与 epsilon-decay 等最优动作选择策略。解决多臂老虎机问题,应用策略应对不确定条件下的决策挑战。
开始本章

Python 中的 Gymnasium 强化学习

课程已完成

获得成就证明

立即报名

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。