Build your ultimate AI agent
Descrição do curso
Descubra as técnicas de ponta que permitem que as máquinas aprendam e interajam com seus ambientes. Você mergulhará no mundo do Deep Reinforcement Learning (DRL) e ganhará experiência prática com os algoritmos mais poderosos que impulsionam o campo. Você usará o PyTorch e o ambiente Gymnasium para criar seus próprios agentes.
Domine os fundamentos da aprendizagem por reforço profundo
Nossa jornada começa com os fundamentos do DRL e sua relação com o aprendizado por reforço tradicional. A partir daí, passamos rapidamente à implementação de Deep Q-Networks (DQN) no PyTorch, incluindo refinamentos avançados, como Double DQN e Prioritized Experience Replay, para turbinar seus modelos.Leve suas habilidades para o próximo nível enquanto você explora métodos baseados em políticas. Você aprenderá e implementará técnicas essenciais de gradiente de política, como os métodos REINFORCE e Actor-Critic.Use algoritmos de ponta
Você encontrará algoritmos poderosos de DRL comumente usados no setor atualmente, incluindo o Proximal Policy Optimization (PPO). Você ganhará experiência prática com as técnicas que impulsionam as inovações em robótica, IA de jogos e muito mais. Por fim, você aprenderá a otimizar seus modelos usando o Optuna para ajuste de hiperparâmetros.Ao final deste curso, você terá adquirido as habilidades para aplicar essas técnicas de ponta a problemas do mundo real e aproveitar todo o potencial do DRL!Pré-requisitos
Programa de estudos
Conteúdo do curso
1
Introdução ao aprendizado por reforço profundo
Descubra como o aprendizado por reforço profundo melhora o aprendizado por reforço tradicional enquanto você estuda e implementa seu primeiro algoritmo de Deep Q Learning.
- Introdução ao aprendizado por reforço profundo50 XP
- Ambiente e configuração da rede neural100 XP
- DRL ciclo de treinamento100 XP
- Introdução à aprendizagem profunda de Q50 XP
- Aprendizagem profunda e DQN50 XP
- A arquitetura da rede Q100 XP
- Instanciando a rede Q100 XP
- O algoritmo barebone DQN50 XP
- Barebone DQN seleção de ações100 XP
- Barebone DQN função de perda100 XP
- Treinamento do barebone DQN100 XP
2
Aprendizado Q profundo
Mergulhe no Deep Q-learning implementando o algoritmo original DQN, com Experience Replay, epsilon-greediness e Q-targets fixos. Além de DQN, você explorará duas extensões fascinantes que melhoram o desempenho e a estabilidade do Deep Q-learning: Duplo DQN e repetição de experiência priorizada.
3
Introdução aos métodos de gradiente de política
Conheça os conceitos básicos dos métodos de gradiente de política encontrados em DRL. Você começará com o teorema do gradiente de política, que forma a base para esses métodos. Em seguida, você implementará o algoritmo REINFORCE, uma abordagem poderosa para aprender políticas. Em seguida, o capítulo guiará você pelos métodos Actor-Critic, com foco no algoritmo Advantage Actor-Critic (A2C), que combina os pontos fortes dos métodos de gradiente de política e baseados em valor para aumentar a eficiência e a estabilidade do aprendizado.
4
Otimização da política proximal e DRL Dicas
Explore a otimização da política proximal (PPO) para obter um desempenho robusto em DRL. Em seguida, você examinará o uso de um bônus de entropia em PPO, que incentiva a exploração ao evitar a convergência prematura para políticas determinísticas. Você também aprenderá sobre atualizações em lote em métodos de gradiente de política. Por fim, você aprenderá sobre a otimização de hiperparâmetros com o Optuna, uma ferramenta avançada para otimizar o desempenho dos seus modelos DRL.
Aprendizado por reforço profundo em Python
Curso
concluído

