मुख्य सामग्री पर जाएँ

कोर्स

Python में NLP के लिए Feature Engineering

मध्यवर्ती4 घंटे

पाठ से उपयोगी जानकारी निकालने और उसे मशीन लर्निंग के लिए उपयुक्त प्रारूप में संसाधित करने की तकनीकें सीखें।

Python4 घंटे15 वीडियो52 अभ्यास4,200 XP29,659उपलब्धि का प्रमाणपत्र

अपना निःशुल्क खाता बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

किसी टीम को प्रशिक्षित कर रहे हैं?

व्यवसायों के लिए आज़माएँ

कोर्स विवरण

इस कोर्स में, आप ऐसी तकनीकें सीखेंगे जिनसे आप टेक्स्ट से उपयोगी जानकारी निकालकर उसे ऐसे फॉर्मेट में प्रोसेस कर सकें जो ML मॉडल्स पर लागू हो सके। विशेष रूप से, आप POS टैगिंग, नेम्ड एंटिटी रिकग्निशन, रीडेबिलिटी स्कोर्स, n-gram और tf-idf मॉडल्स के बारे में जानेंगे, और scikit-learn व spaCy का उपयोग करके इन्हें इम्प्लीमेंट करना सीखेंगे। आप यह भी सीखेंगे कि दो डॉक्युमेंट्स एक-दूसरे से कितने समान हैं, यह कैसे निकाला जाए। इस दौरान, आप मूवी रिव्यू का सेंटिमेंट प्रिडिक्ट करेंगे और मूवी तथा TED Talk रिकमेंडर बनाएँगे। कोर्स पूरा करने के बाद, आप किसी भी टेक्स्ट से अहम फीचर्स इंजीनियर कर पाएँगे और डेटा साइंस की कई चुनौतीपूर्ण समस्याएँ सुलझा पाएँगे!

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

1

बेसिक फीचर्स और रीडेबिलिटी स्कोर्स

शब्दों की संख्या, कैरेक्टर्स की संख्या, औसत शब्द-लंबाई और स्पेशल कैरेक्टर्स (जैसे Twitter हैशटैग्स और मेंशन्स) की संख्या जैसे बेसिक फीचर्स निकालना सीखें। आप रीडेबिलिटी स्कोर्स निकालना और किसी टेक्स्ट को समझने के लिए कितनी शिक्षा आवश्यक है, यह निर्धारित करना भी सीखेंगे।
अध्याय शुरू करें
2

टेक्स्ट प्रीप्रोसेसिंग, POS टैगिंग और NER

इस चैप्टर में, आप टोकनाइज़ेशन और लेमाटाइज़ेशन के बारे में सीखेंगे। इसके बाद, आप spaCy लाइब्रेरी का उपयोग करके टेक्स्ट क्लीनिंग, पार्ट-ऑफ-स्पीच टैगिंग, और नेम्ड एंटिटी रिकग्निशन करना सीखेंगे। इन कॉन्सेप्ट्स में महारत हासिल करने के बाद, आप Gettysburg address को मशीन-फ्रेंडली बनाएँगे, फेक न्यूज़ में संज्ञा के उपयोग का विश्लेषण करेंगे, और TechCrunch आर्टिकल में उल्लिखित लोगों की पहचान करेंगे।
अध्याय शुरू करें
4

TF-IDF और सिमिलैरिटी स्कोर्स

दो वेक्टर्स के बीच tf-idf वेट्स और कॉसाइन सिमिलैरिटी स्कोर कैसे निकाले जाते हैं, यह सीखें। इन कॉन्सेप्ट्स का उपयोग करके आप एक मूवी और TED Talk रिकमेंडर बनाएँगे। अंत में, आप वर्ड एम्बेडिंग्स के बारे में भी सीखेंगे और वर्ड वेक्टर रिप्रेज़ेंटेशन्स का उपयोग करके विभिन्न Pink Floyd गानों के बीच सिमिलैरिटीज़ निकालेंगे।
अध्याय शुरू करें

Python में NLP के लिए Feature Engineering

कोर्स
पूर्ण

उपलब्धि का प्रमाण पत्र अर्जित करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएँ

हमारे मोबाइल कोर्स और रोज़ाना 5-मिनट की कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।