Build your ultimate AI agent
Описание курса
Откройте для себя передовые методы, которые позволяют машинам обучаться и взаимодействовать со своей средой. Вы погрузитесь в мир глубокого обучения с подкреплением (DRL) и получите практический опыт работы с самыми мощными алгоритмами, которые двигают эту область вперёд. Вы будете использовать PyTorch и среду Gymnasium, чтобы создавать собственных агентов.
Освойте основы глубокого обучения с подкреплением
Наше путешествие начинается с основ DRL и их связи с традиционным обучением с подкреплением. Оттуда мы быстро переходим к реализации Deep Q-Networks (DQN) в PyTorch, включая такие продвинутые улучшения, как Double DQN и Prioritized Experience Replay, чтобы вывести ваши модели на новый уровень.Поднимите свои навыки на новый уровень, изучая методы, основанные на политике. Вы изучите и освоите ключевые методы градиентной политики, такие как REINFORCE и методы Actor-Critic.Используйте передовые алгоритмы
Вы познакомитесь с мощными алгоритмами DRL, которые сегодня широко используются в индустрии, включая Proximal Policy Optimization (PPO). Вы получите практический опыт работы с методами, лежащими в основе прорывов в робототехнике, игровом ИИ и за его пределами. Наконец, вы научитесь оптимизировать свои модели с помощью Optuna для настройки гиперпараметров.К концу этого курса вы освоите навыки применения этих передовых методов к реальным задачам и сможете раскрыть весь потенциал DRL!Предварительные требования
Программа
Структура курса
1
Введение в глубокое обучение с подкреплением
Узнайте, чем глубокое обучение с подкреплением превосходит классическое, и реализуйте свой первый алгоритм Deep Q-Learning.
- Введение в глубокое обучение с подкреплением50 XP
- Настройка среды и нейронной сети100 XP
- Цикл обучения в DRL100 XP
- Введение в глубокое Q-обучение50 XP
- Глубокое обучение и DQN50 XP
- Архитектура Q-сети100 XP
- Создание экземпляра Q-сети100 XP
- Базовый алгоритм DQN50 XP
- Выбор действия в базовом DQN100 XP
- Функция потерь базового DQN100 XP
- Обучение базового DQN100 XP
2
Глубокое Q-обучение
Погрузитесь в глубокое Q-обучение: реализуйте оригинальный алгоритм DQN с буфером воспроизведения опыта, стратегией эпсилон-жадности и фиксированными Q-целями. Затем изучите два важных расширения, которые повышают производительность и стабильность глубокого Q-обучения: Double DQN и приоритизированный буфер воспроизведения опыта.
3
Введение в методы градиента политики
Освойте ключевые концепции методов градиента политики в DRL. Вы начнёте с теоремы о градиенте политики, которая лежит в основе этих методов. Затем реализуете алгоритм REINFORCE — эффективный подход к обучению политик. Далее глава познакомит вас с методами «актор-критик» и алгоритмом Advantage Actor-Critic (A2C), который объединяет преимущества методов градиента политики и методов на основе ценности для повышения эффективности и стабильности обучения.
4
Proximal Policy Optimization и советы по DRL
Изучите Proximal Policy Optimization (PPO) для достижения стабильных результатов в DRL. Вы узнаете, как применять бонус за энтропию в PPO, чтобы стимулировать исследование среды и избежать преждевременной сходимости к детерминированным политикам. Также рассмотрите пакетные обновления в методах градиента политики. В завершение вы познакомитесь с оптимизацией гиперпараметров с помощью Optuna — мощного инструмента для настройки DRL-моделей.
Глубокое обучение с подкреплением на Python
Курс
завершён

