मुख्य सामग्री पर जाएं

कोर्स

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

उन्नत4 घंटे

जानें कि GenAI मॉडल्स को मानव मूल्यों को सही मायने में कैसे प्रतिबिंबित करें, साथ ही उन्नत LLMs के साथ व्यावहारिक अनुभव प्राप्त करें।

Python4 घंटे13 वीडियो38 अभ्यास2,900 XP3,780उपलब्धि प्रमाणपत्र

अपना नि:शुल्क अकाउंट बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारा गोपनीयता नीति और यह कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

टीम को प्रशिक्षित कर रहे हैं?

बिज़नेस आज़माएँ

कोर्स विवरण

इस कोर्स में आप जनरेटिव AI की दक्षता को मानव विशेषज्ञता की समझ के साथ जोड़ेंगे। आप सीखेंगे कि GenAI मॉडलों को मानव मूल्यों और पसंद-नापसंद को सच में कैसे प्रतिबिंबित कराया जाए, साथ ही LLMs के साथ व्यावहारिक अनुभव भी मिलेगा। आप रिवॉर्ड मॉडलों की जटिलताओं को समझेंगे और जानेंगे कि LLMs के आधार पर ऐसा AI कैसे बनाएँ जो केवल सीखे ही नहीं बल्कि वास्तविक परिस्थितियों के अनुरूप ढल भी जाए।

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

1

बुनियादी अवधारणाएँ

यह चैप्टर मानवीय फीडबैक के साथ रिइनफोर्समेंट लर्निंग (RLHF) की बुनियाद से परिचित कराता है — एक तकनीक जिसमें AI मॉडलों को अधिक प्रभावी ढंग से सीखने में मानव इनपुट मदद करता है। शुरुआत कीजिए और समझिए कि RLHF पारंपरिक रिइनफोर्समेंट लर्निंग से कैसे अलग है और क्यों मानवीय फीडबैक विभिन्न क्षेत्रों में AI के प्रदर्शन को बेहतर बना सकता है।
अध्याय शुरू करें
2

मानवीय फीडबैक एकत्र करना

इस चैप्टर में जानिए कि मानवीय फीडबैक एकत्र करने के लिए सिस्टम कैसे सेटअप करें। पेयरवाइज़ तुलना से लेकर अनसर्टेन्टी सैंपलिंग तक उच्च-गुणवत्ता वाला डेटा इकट्ठा करने के सर्वोत्तम तरीकों को सीखिए, और अपने डेटा कलेक्शन को बेहतर बनाने की रणनीतियों का अन्वेषण कीजिए।
अध्याय शुरू करें
3

मानवीय फीडबैक से मॉडल ट्यून करना

इस चैप्टर में आप मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग ट्रेनिंग के कोर में जाएँगे। इसमें PPO के साथ फाइन-ट्यूनिंग, कुशलतापूर्वक ट्रेन करने की तकनीकें, और अपनी मैट्रिक्स के उद्देश्यों से संभावित विचलनों को संभालना शामिल है।
अध्याय शुरू करें
4

मॉडल मूल्यांकन

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF) के इस अंतिम चैप्टर में मॉडल के प्रदर्शन का आकलन और सुधार करने की प्रमुख तकनीकों का अन्वेषण कीजिए: फाइन-ट्यूनिंग मेट्रिक्स से लेकर विविध फीडबैक स्रोतों को शामिल करने तक — आपको अपने मॉडलों को प्रभावी ढंग से परिष्कृत करने के लिए एक व्यापक टूलकिट मिलेगा।
अध्याय शुरू करें

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

कोर्स
पूरा

उपलब्धि प्रमाणपत्र प्राप्त करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएं

हमारे मोबाइल पाठ्यक्रमों और दैनिक 5-मिनट कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।