Перейти к основному контенту

Курс

Глубокое обучение с подкреплением на Python

Продвинутый4 ч

Изучайте и применяйте мощные алгоритмы Deep Reinforcement Learning, включая методы доработки и оптимизации.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}4,050 XP5,775Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Откройте для себя передовые методы, которые позволяют машинам обучаться и взаимодействовать со своей средой. Вы погрузитесь в мир глубокого обучения с подкреплением (DRL) и получите практический опыт работы с самыми мощными алгоритмами, которые двигают эту область вперёд. Вы будете использовать PyTorch и среду Gymnasium, чтобы создавать собственных агентов.

Освойте основы глубокого обучения с подкреплением

Наше путешествие начинается с основ DRL и их связи с традиционным обучением с подкреплением. Оттуда мы быстро переходим к реализации Deep Q-Networks (DQN) в PyTorch, включая такие продвинутые улучшения, как Double DQN и Prioritized Experience Replay, чтобы вывести ваши модели на новый уровень.Поднимите свои навыки на новый уровень, изучая методы, основанные на политике. Вы изучите и освоите ключевые методы градиентной политики, такие как REINFORCE и методы Actor-Critic.

Используйте передовые алгоритмы

Вы познакомитесь с мощными алгоритмами DRL, которые сегодня широко используются в индустрии, включая Proximal Policy Optimization (PPO). Вы получите практический опыт работы с методами, лежащими в основе прорывов в робототехнике, игровом ИИ и за его пределами. Наконец, вы научитесь оптимизировать свои модели с помощью Optuna для настройки гиперпараметров.К концу этого курса вы освоите навыки применения этих передовых методов к реальным задачам и сможете раскрыть весь потенциал DRL!

Предварительные требования

Программа

Структура курса

2

Глубокое Q-обучение

Погрузитесь в глубокое Q-обучение: реализуйте оригинальный алгоритм DQN с буфером воспроизведения опыта, стратегией эпсилон-жадности и фиксированными Q-целями. Затем изучите два важных расширения, которые повышают производительность и стабильность глубокого Q-обучения: Double DQN и приоритизированный буфер воспроизведения опыта.
Начать главу
3

Введение в методы градиента политики

Освойте ключевые концепции методов градиента политики в DRL. Вы начнёте с теоремы о градиенте политики, которая лежит в основе этих методов. Затем реализуете алгоритм REINFORCE — эффективный подход к обучению политик. Далее глава познакомит вас с методами «актор-критик» и алгоритмом Advantage Actor-Critic (A2C), который объединяет преимущества методов градиента политики и методов на основе ценности для повышения эффективности и стабильности обучения.
Начать главу
4

Proximal Policy Optimization и советы по DRL

Изучите Proximal Policy Optimization (PPO) для достижения стабильных результатов в DRL. Вы узнаете, как применять бонус за энтропию в PPO, чтобы стимулировать исследование среды и избежать преждевременной сходимости к детерминированным политикам. Также рассмотрите пакетные обновления в методах градиента политики. В завершение вы познакомитесь с оптимизацией гиперпараметров с помощью Optuna — мощного инструмента для настройки DRL-моделей.
Начать главу

Глубокое обучение с подкреплением на Python

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.