Перейти до основного вмісту

Курс

Глибоке навчання з підкріпленням у Python

Просунутий4 год

Вивчайте й застосовуйте потужні алгоритми Deep Reinforcement Learning, зокрема методи вдосконалення та оптимізації.

Python4 год15 відео49 вправ4,050 XP5,775Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Відкрийте для себе передові методи, які дають змогу машинам навчатися та взаємодіяти зі своїм середовищем. Ви зануритеся у світ глибокого навчання з підкріпленням (DRL) і отримаєте практичний досвід роботи з найпотужнішими алгоритмами, що рухають цю сферу вперед. Ви будете використовувати PyTorch і середовище Gymnasium, щоб створювати власних агентів.

Опануйте основи глибокого навчання з підкріпленням

Наш шлях починається з основ DRL та їхнього зв’язку з традиційним навчанням з підкріпленням. Звідти ми швидко переходимо до реалізації Deep Q-Networks (DQN) у PyTorch, включно з такими вдосконаленнями, як Double DQN і Prioritized Experience Replay, щоб максимально посилити ваші моделі.Підніміть свої навички на новий рівень, вивчаючи методи, засновані на політиках. Ви навчитеся застосовувати та впроваджувати основні методи policy-gradient, такі як REINFORCE та Actor-Critic.

Використовуйте передові алгоритми

Ви ознайомитеся з потужними алгоритмами DRL, які сьогодні широко використовуються в галузі, зокрема з Proximal Policy Optimization (PPO). Ви отримаєте практичний досвід роботи з техніками, що стоять за проривами в робототехніці, ігровому ШІ та не тільки. Нарешті, ви навчитеся оптимізувати свої моделі за допомогою Optuna для налаштування гіперпараметрів.Наприкінці цього курсу ви опануєте навички застосування цих передових методів до реальних задач і зможете повністю розкрити потенціал DRL!

Попередні вимоги

Навчальний план

Зміст курсу

3

Вступ до методів градієнта політики

Дізнайтеся про базові концепції методів градієнта політики в DRL. Ви почнете з теореми про градієнт політики, яка є основою цих методів. Потім ви реалізуєте алгоритм REINFORCE — потужний підхід до навчання політик. Далі розгляд перейде до методів Actor-Critic із фокусом на алгоритмі Advantage Actor-Critic (A2C), який поєднує переваги градієнтних і ціннісних методів, підвищуючи ефективність і стабільність навчання.
Почати розділ
4

Proximal Policy Optimization і поради з DRL

Ознайомтеся з Proximal Policy Optimization (PPO) для надійної роботи DRL. Далі ви розглянете використання ентропійного бонусу в PPO, який заохочує дослідження середовища та запобігає передчасному переходу до детермінованих політик. Ви також вивчите пакетні оновлення в методах градієнта політики. Нарешті, ви дізнаєтеся про оптимізацію гіперпараметрів за допомогою Optuna — потужного інструмента для підвищення продуктивності ваших DRL-моделей.
Почати розділ

Глибоке навчання з підкріпленням у Python

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.

Глибоке навчання з підкріпленням у Python | DataCamp