メインコンテンツにスキップ

コース

Pythonで学ぶGymnasiumによるReinforcement Learning

上級4 時間

強化学習の旅を始めましょう!エージェントが相互作用を通じて環境を解決する方法を学びます。

Python4 時間動画 15 本演習 52 件4,400 XP13,633修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

前提条件

カリキュラム

コース概要

1

Reinforcement Learning の導入

Reinforcement Learning(RL)の基礎概念、役割、活用例を通して、RLの世界に踏み出しましょう。エージェントと環境の相互作用というRLの枠組みを理解し、Gymnasiumライブラリで環境を作成し、状態を可視化し、行動を実行する方法を学びます。これにより、RLの概念と応用を実践的に身につけられます。
2

Model-Based Learning

Model-Based Learning に焦点を当て、RLをさらに深く学びます。Markov Decision Process(MDP)の要素を整理し、その仕組みを理解しましょう。方策(policy)や価値関数についてスキルを高め、方策反復(policy iteration)と価値反復(value iteration)による方策最適化の手法を習得します。
3

Model-Free Learning

RLにおけるModel-Free Learningを段階的に学びます。まず基礎となるMonte Carlo法を導入し、初回訪問法と毎回訪問法のMonte Carlo予測アルゴリズムを実装します。次にTemporal Difference Learningへ移り、SARSAアルゴリズムを学びます。最後にQ-Learningを深く掘り下げ、困難な環境における収束性を分析します。
4

Model-Free RL の発展的手法

Model-Free RLの発展的手法を扱い、意思決定アルゴリズムを強化します。方策更新をより正確にする Expected SARSA、過大評価バイアスを抑える Double Q-learning を学びます。さらに探索と活用のトレードオフを理解し、最適な行動選択に向けて epsilon-greedy と epsilon-decay の戦略を身につけます。最後にMulti-Armed Bandit問題に取り組み、不確実性下での意思決定を解く手法を適用します。

Pythonで学ぶGymnasiumによるReinforcement Learning

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。