Build your ultimate AI agent
Kursbeskrivning
Upptäck de banbrytande tekniker som gör det möjligt för maskiner att lära sig och interagera med sin omgivning. Du kommer att dyka ner i världen av Deep Reinforcement Learning (DRL) och få praktisk erfarenhet av de mest kraftfulla algoritmerna som driver området framåt. Du kommer att använda PyTorch och Gymnasium-miljön för att bygga dina egna agenter.
Bemästra grunderna i djup förstärkningsinlärning
Vår resa börjar med grunderna i DRL och deras relation till traditionell förstärkningsinlärning. Därifrån går vi snabbt vidare till att implementera Deep Q-Networks (DQN) i PyTorch, inklusive avancerade förbättringar som Double DQN och Prioritized Experience Replay för att ge dina modeller extra kraft.Ta dina färdigheter till nästa nivå när du utforskar policybaserade metoder. Du kommer att lära dig och implementera viktiga policy-gradient-tekniker som REINFORCE och Actor-Critic-metoder.Använd banbrytande algoritmer
Du kommer att stöta på kraftfulla DRL-algoritmer som används flitigt i branschen idag, inklusive Proximal Policy Optimization (PPO). Du kommer att få praktisk erfarenhet av de tekniker som driver genombrott inom robotik, spel-AI och mer därtill. Slutligen kommer du att lära dig att optimera dina modeller med Optuna för hyperparameteroptimering.I slutet av den här kursen kommer du att ha skaffat dig färdigheterna att tillämpa dessa banbrytande tekniker på verkliga problem och utnyttja DRL:s fulla potential!Förkunskapskrav
Kursplan
Kursöversikt
1
Introduktion till djup förstärkningsinlärning
Upptäck hur djup förstärkningsinlärning förbättrar traditionell förstärkningsinlärning, och implementera din första djupa Q-inlärningsalgoritm.
- Introduktion till djup förstärkningsinlärning50 XP
- Miljö- och neuralt nätverksinställning100 XP
- DRL-träningsloop100 XP
- Introduktion till djup Q-inlärning50 XP
- Djupinlärning och DQN50 XP
- Q-nätverkets arkitektur100 XP
- Instansiera Q-nätverket100 XP
- Den grundläggande DQN-algoritmen50 XP
- Aktionsval med barebones DQN100 XP
- Förlustfunktion för ett grundläggande DQN100 XP
- Träna det grundläggande DQN-nätverket100 XP
2
Djup Q-inlärning
Fördjupa dig i djup Q-inlärning genom att implementera den ursprungliga DQN-algoritmen med Experience Replay, epsilon-girighet och fasta Q-mål. Därefter utforskar du två intressanta utökningar som förbättrar prestanda och stabilitet i djup Q-inlärning: Double DQN och Prioritized Experience Replay.
3
Introduktion till policygradientmetoder
Lär dig de grundläggande begreppen inom policygradientmetoder i DRL. Du börjar med policygradientteoremet, som utgör grunden för dessa metoder, och implementerar sedan REINFORCE-algoritmen – en kraftfull metod för att lära in policyer. Kapitlet leder dig sedan vidare till Actor-Critic-metoder, med fokus på Advantage Actor-Critic-algoritmen (A2C), som kombinerar styrkan hos både policygradient- och värdebaserade metoder för att förbättra inlärningens effektivitet och stabilitet.
4
Proximal Policy Optimization och tips för DRL
Utforska Proximal Policy Optimization (PPO) för robust DRL-prestanda. Du undersöker sedan hur en entropibonus i PPO uppmuntrar utforskning genom att förhindra att modellen för tidigt låser sig till deterministiska policyer. Du lär dig också om batchuppdateringar i policygradientmetoder. Avslutningsvis går vi igenom hyperparameteroptimering med Optuna – ett kraftfullt verktyg för att optimera prestandan i dina DRL-modeller.
Djup förstärkningsinlärning i Python
Kurs
slutförd

