跳至内容

课程

Python 中的深度强化学习

高级4 小时

学习并应用强大的深度强化学习算法,包括优化与改进技术。

Python4 小时15 个视频49 个练习4,050 经验值5,775结业证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 并且您的数据存储在美国。

深受上千家公司学习者喜爱

要培训团队?

试用企业版

课程介绍

探索前沿技术,赋能机器学习并与其环境进行交互。 你将深入探索深度强化学习(DRL)的世界,并亲身体验推动这一领域不断前进的最强大算法。 您将使用 PyTorch 和 Gymnasium 环境来构建自己的智能体。

掌握深度强化学习基础

我们的旅程从 DRL 的基础及其与传统强化学习的关系开始。 从那里开始,我们将迅速转向在 PyTorch 中实现深度 Q 网络(DQN),包括双 DQN 和优先经验回放等高级优化,以全面提升您的模型。在探索基于策略的方法时,将你的技能提升到新水平。 您将学习并实现诸如 REINFORCE 和 Actor-Critic 方法等关键的策略梯度技术。

使用前沿算法

您将接触到当今行业中常用的强大 DRL 算法,包括近端策略优化(PPO)。 您将获得在推动机器人、游戏 AI 及更多领域突破的技术方面的实践经验。 最后,你将学习如何使用 Optuna 进行超参数调优,以优化你的模型。在本课程结束时,您将掌握将这些前沿技术应用于现实世界问题的技能,并充分发挥深度强化学习(DRL)的全部潜力!

先修要求

课程大纲

课程大纲

3

策略梯度方法入门

学习 DRL 中策略梯度方法的核心概念。您将从奠定这些方法基础的策略梯度定理开始。随后实现 REINFORCE 算法,这是一种强大的策略学习方法。接着,章节将引导您学习 Actor-Critic 方法,重点讲解优势 Actor-Critic(A2C)算法,它结合了策略梯度与基于价值的方法优势,从而提升学习效率与稳定性。
开始本章
4

近端策略优化与 DRL 实用技巧

探索近端策略优化(PPO),实现稳健的 DRL 表现。接着,您将研究在 PPO 中使用熵奖励,以避免过早收敛到确定性策略,从而鼓励探索。您还将学习策略梯度方法中的批量更新。最后,您将了解如何使用 Optuna 进行超参数优化,以充分提升 DRL 模型的性能。
开始本章

Python 中的深度强化学习

课程完成

获取成就证书

立即报名

通过 DataCamp for Mobile 提升您的数据技能

通过我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。