メインコンテンツにスキップ

コース

Pythonで学ぶDeep Reinforcement Learning

上級4 時間

強力な Deep Reinforcement Learning のアルゴリズムを学び、洗練・最適化手法を含めて実践します。

Python4 時間動画 15 本演習 49 件4,050 XP5,947修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

前提条件

カリキュラム

コース概要

3

Policy Gradient手法の基礎

DRLにおけるpolicy gradient手法の基礎概念を学びます。まず、これらの手法の土台となるpolicy gradient定理から始めます。次に、方策学習の強力なアプローチであるREINFORCEアルゴリズムを実装します。続いて、Actor-Critic手法、特にpolicy gradientと価値ベース手法の強みを組み合わせて学習効率と安定性を高めるAdvantage Actor-Critic(A2C)アルゴリズムを取り上げます。
4

Proximal Policy OptimizationとDRLの実践ヒント

堅牢なDRL性能を実現するProximal Policy Optimization(PPO)を学びます。次に、PPOにおけるエントロピーボーナスを取り上げ、方策が早期に決定論的に収束するのを防いで探索を促進する方法を確認します。さらに、policy gradient手法でのバッチ更新について学びます。最後に、Optunaを用いたハイパーパラメータ最適化を行い、DRLモデルの性能を高める方法を身につけます。

Pythonで学ぶDeep Reinforcement Learning

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。