मुख्य सामग्री पर जाएं

कोर्स

Python में Deep Reinforcement Learning

उन्नत4 घंटे

शक्तिशाली Deep Reinforcement Learning एल्गोरिदम सीखें और उपयोग करें, जिसमें refinement और optimization तकनीकें शामिल हैं।

Python4 घंटे15 वीडियो49 अभ्यास4,050 XP5,775उपलब्धि प्रमाणपत्र

अपना नि:शुल्क अकाउंट बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारा गोपनीयता नीति और यह कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

टीम को प्रशिक्षित कर रहे हैं?

बिज़नेस आज़माएँ

कोर्स विवरण

मशीनों को अपने परिवेश से सीखने और उसके साथ अंतःक्रिया करने में सक्षम बनाने वाली अत्याधुनिक तकनीकों की खोज करें। आप डीप रिइनफोर्समेंट लर्निंग (DRL) की दुनिया में गहराई से उतरेंगे और इस क्षेत्र को आगे बढ़ाने वाले सबसे शक्तिशाली एल्गोरिदम के साथ व्यावहारिक अनुभव प्राप्त करेंगे। आप PyTorch और Gymnasium वातावरण का उपयोग करके अपने स्वयं के एजेंट बनाएँगे।

डीप रिइनफोर्समेंट लर्निंग की मूलभूत बातें सीखें

हमारी यात्रा DRL की बुनियादों और पारंपरिक Reinforcement Learning के साथ उनके संबंध से शुरू होती है। वहाँ से, हम तेज़ी से PyTorch में Deep Q-Networks (DQN) को लागू करने की ओर बढ़ते हैं, जिसमें Double DQN और Prioritized Experience Replay जैसे उन्नत सुधार शामिल हैं, ताकि आपके मॉडलों को और अधिक शक्तिशाली बनाया जा सके।नीति-आधारित विधियों का अन्वेषण करते हुए अपने कौशल को अगले स्तर पर ले जाएँ। आप REINFORCE और Actor-Critic विधियों जैसी आवश्यक policy-gradient तकनीकों को सीखेंगे और लागू करेंगे।

अत्याधुनिक एल्गोरिदम का उपयोग करें

आप उद्योग में आज आमतौर पर उपयोग किए जाने वाले शक्तिशाली DRL एल्गोरिदमों, जिनमें Proximal Policy Optimization (PPO) शामिल है, से परिचित होंगे। आप रोबोटिक्स, गेम एआई और उससे आगे की सफलताओं को आगे बढ़ाने वाली तकनीकों के साथ व्यावहारिक अनुभव प्राप्त करेंगे। अंत में, आप हाइपरपैरामीटर ट्यूनिंग के लिए Optuna का उपयोग करके अपने मॉडलों को ऑप्टिमाइज़ करना सीखेंगे।इस पाठ्यक्रम के अंत तक, आपने इन अत्याधुनिक तकनीकों को वास्तविक दुनिया की समस्याओं पर लागू करने और DRL की पूरी क्षमता का उपयोग करने के कौशल हासिल कर लिए होंगे!

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

2

Deep Q-learning

3

Policy Gradient तरीकों का परिचय

DRL में मिलने वाले policy gradient तरीकों की बुनियादी अवधारणाएँ सीखें। आप policy gradient theorem से शुरुआत करेंगे, जो इन तरीकों की नींव है। फिर आप REINFORCE एल्गोरिदम इम्प्लीमेंट करेंगे, जो पॉलिसीज़ सीखने का एक शक्तिशाली तरीका है। अध्याय आगे Actor-Critic तरीकों तक ले जाएगा, खासकर Advantage Actor-Critic (A2C) एल्गोरिदम पर, जो policy gradient और value-based दोनों तरीकों की खूबियों को जोड़कर learning की दक्षता और स्थिरता बढ़ाता है.
अध्याय शुरू करें
4

Proximal Policy Optimization और DRL टिप्स

Proximal Policy Optimization (PPO) का अध्ययन करें ताकि DRL का प्रदर्शन मज़बूत हो। इसके बाद आप PPO में entropy bonus के उपयोग को देखेंगे, जो deterministic पॉलिसीज़ पर समय से पहले पहुँचने से रोककर exploration को प्रोत्साहित करता है। आप policy gradient तरीकों में batch updates के बारे में भी सीखेंगे। अंत में, आप Optuna के साथ hyperparameter optimization सीखेंगे, जो आपके DRL मॉडलों के प्रदर्शन को बेहतर बनाने का एक शक्तिशाली टूल है.
अध्याय शुरू करें

Python में Deep Reinforcement Learning

कोर्स
पूरा

उपलब्धि प्रमाणपत्र प्राप्त करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएं

हमारे मोबाइल पाठ्यक्रमों और दैनिक 5-मिनट कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।

Python में Deep Reinforcement Learning | DataCamp