Build your ultimate AI agent
课程介绍
探索前沿技术,赋能机器学习并与其环境进行交互。 你将深入探索深度强化学习(DRL)的世界,并亲身体验推动这一领域不断前进的最强大算法。 您将使用 PyTorch 和 Gymnasium 环境来构建自己的智能体。
掌握深度强化学习基础
我们的旅程从 DRL 的基础及其与传统强化学习的关系开始。 从那里开始,我们将迅速转向在 PyTorch 中实现深度 Q 网络(DQN),包括双 DQN 和优先经验回放等高级优化,以全面提升您的模型。在探索基于策略的方法时,将你的技能提升到新水平。 您将学习并实现诸如 REINFORCE 和 Actor-Critic 方法等关键的策略梯度技术。使用前沿算法
您将接触到当今行业中常用的强大 DRL 算法,包括近端策略优化(PPO)。 您将获得在推动机器人、游戏 AI 及更多领域突破的技术方面的实践经验。 最后,你将学习如何使用 Optuna 进行超参数调优,以优化你的模型。在本课程结束时,您将掌握将这些前沿技术应用于现实世界问题的技能,并充分发挥深度强化学习(DRL)的全部潜力!先修要求
课程大纲
课程大纲
2
深度 Q 学习
通过实现原始 DQN 算法深入学习深度 Q 学习,其包含经验回放、epsilon-贪心与固定 Q 目标。接着,您将探索两种能够提升深度 Q 学习性能与稳定性的扩展:Double DQN 与优先级经验回放。
3
策略梯度方法入门
学习 DRL 中策略梯度方法的核心概念。您将从奠定这些方法基础的策略梯度定理开始。随后实现 REINFORCE 算法,这是一种强大的策略学习方法。接着,章节将引导您学习 Actor-Critic 方法,重点讲解优势 Actor-Critic(A2C)算法,它结合了策略梯度与基于价值的方法优势,从而提升学习效率与稳定性。
4
近端策略优化与 DRL 实用技巧
探索近端策略优化(PPO),实现稳健的 DRL 表现。接着,您将研究在 PPO 中使用熵奖励,以避免过早收敛到确定性策略,从而鼓励探索。您还将学习策略梯度方法中的批量更新。最后,您将了解如何使用 Optuna 进行超参数优化,以充分提升 DRL 模型的性能。
Python 中的深度强化学习
课程完成

