Build your ultimate AI agent
कोर्स विवरण
मशीनों को अपने परिवेश से सीखने और उसके साथ अंतःक्रिया करने में सक्षम बनाने वाली अत्याधुनिक तकनीकों की खोज करें। आप डीप रिइनफोर्समेंट लर्निंग (DRL) की दुनिया में गहराई से उतरेंगे और इस क्षेत्र को आगे बढ़ाने वाले सबसे शक्तिशाली एल्गोरिदम के साथ व्यावहारिक अनुभव प्राप्त करेंगे। आप PyTorch और Gymnasium वातावरण का उपयोग करके अपने स्वयं के एजेंट बनाएँगे।
डीप रिइनफोर्समेंट लर्निंग की मूलभूत बातें सीखें
हमारी यात्रा DRL की बुनियादों और पारंपरिक Reinforcement Learning के साथ उनके संबंध से शुरू होती है। वहाँ से, हम तेज़ी से PyTorch में Deep Q-Networks (DQN) को लागू करने की ओर बढ़ते हैं, जिसमें Double DQN और Prioritized Experience Replay जैसे उन्नत सुधार शामिल हैं, ताकि आपके मॉडलों को और अधिक शक्तिशाली बनाया जा सके।नीति-आधारित विधियों का अन्वेषण करते हुए अपने कौशल को अगले स्तर पर ले जाएँ। आप REINFORCE और Actor-Critic विधियों जैसी आवश्यक policy-gradient तकनीकों को सीखेंगे और लागू करेंगे।अत्याधुनिक एल्गोरिदम का उपयोग करें
आप उद्योग में आज आमतौर पर उपयोग किए जाने वाले शक्तिशाली DRL एल्गोरिदमों, जिनमें Proximal Policy Optimization (PPO) शामिल है, से परिचित होंगे। आप रोबोटिक्स, गेम एआई और उससे आगे की सफलताओं को आगे बढ़ाने वाली तकनीकों के साथ व्यावहारिक अनुभव प्राप्त करेंगे। अंत में, आप हाइपरपैरामीटर ट्यूनिंग के लिए Optuna का उपयोग करके अपने मॉडलों को ऑप्टिमाइज़ करना सीखेंगे।इस पाठ्यक्रम के अंत तक, आपने इन अत्याधुनिक तकनीकों को वास्तविक दुनिया की समस्याओं पर लागू करने और DRL की पूरी क्षमता का उपयोग करने के कौशल हासिल कर लिए होंगे!पूर्वापेक्षाएँ
पाठ्यक्रम
कोर्स रूपरेखा
1
Deep Reinforcement Learning का परिचय
जानें कि deep reinforcement learning किस तरह पारंपरिक Reinforcement Learning को बेहतर बनाता है, और अपना पहला Deep Q Learning एल्गोरिदम पढ़ते व इम्प्लीमेंट करते हुए शुरू करें.
- डीप रिइन्फोर्समेंट लर्निंग का परिचय50 XP
- एंवायरनमेंट और न्यूरल नेटवर्क सेटअप100 XP
- DRL training loop100 XP
- डीप Q लर्निंग का परिचय50 XP
- डीप लर्निंग और DQN50 XP
- Q-Network आर्किटेक्चर100 XP
- Q-Network को इंस्टैंशिएट करना100 XP
- बेसिक DQN एल्गोरिदम50 XP
- Barebone DQN में action चयन100 XP
- Barebone DQN लॉस फंक्शन100 XP
- Barebone DQN का प्रशिक्षण100 XP
2
Deep Q-learning
Experience Replay, epsilon-greediness और fixed Q-targets सहित मूल DQN एल्गोरिदम को इम्प्लीमेंट करते हुए Deep Q-learning में गहराई से उतरें। DQN के आगे, आप दो दिलचस्प एक्सटेंशन्स भी देखेंगे जो Deep Q-learning के प्रदर्शन और स्थिरता को सुधारते हैं: Double DQN और Prioritized Experience Replay.
3
Policy Gradient तरीकों का परिचय
DRL में मिलने वाले policy gradient तरीकों की बुनियादी अवधारणाएँ सीखें। आप policy gradient theorem से शुरुआत करेंगे, जो इन तरीकों की नींव है। फिर आप REINFORCE एल्गोरिदम इम्प्लीमेंट करेंगे, जो पॉलिसीज़ सीखने का एक शक्तिशाली तरीका है। अध्याय आगे Actor-Critic तरीकों तक ले जाएगा, खासकर Advantage Actor-Critic (A2C) एल्गोरिदम पर, जो policy gradient और value-based दोनों तरीकों की खूबियों को जोड़कर learning की दक्षता और स्थिरता बढ़ाता है.
4
Proximal Policy Optimization और DRL टिप्स
Proximal Policy Optimization (PPO) का अध्ययन करें ताकि DRL का प्रदर्शन मज़बूत हो। इसके बाद आप PPO में entropy bonus के उपयोग को देखेंगे, जो deterministic पॉलिसीज़ पर समय से पहले पहुँचने से रोककर exploration को प्रोत्साहित करता है। आप policy gradient तरीकों में batch updates के बारे में भी सीखेंगे। अंत में, आप Optuna के साथ hyperparameter optimization सीखेंगे, जो आपके DRL मॉडलों के प्रदर्शन को बेहतर बनाने का एक शक्तिशाली टूल है.
Python में Deep Reinforcement Learning
कोर्स
पूरा

