मुख्य सामग्री पर जाएं

कोर्स

Python में NLP के लिए Feature Engineering

इंटरमीडिएट4 घंटे

पाठ से उपयोगी जानकारी निकालने और उसे मशीन लर्निंग के लिए उपयुक्त प्रारूप में संसाधित करने की तकनीकें सीखें।

Python4 घंटे15 वीडियो52 अभ्यास4,200 XP29,428उपलब्धि प्रमाणपत्र

अपना नि:शुल्क अकाउंट बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारा गोपनीयता नीति और यह कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

टीम को प्रशिक्षित कर रहे हैं?

बिज़नेस आज़माएँ

कोर्स विवरण

इस कोर्स में, आप ऐसी तकनीकें सीखेंगे जिनसे आप टेक्स्ट से उपयोगी जानकारी निकालकर उसे ऐसे फॉर्मेट में प्रोसेस कर सकें जो ML मॉडल्स पर लागू हो सके। विशेष रूप से, आप POS टैगिंग, नेम्ड एंटिटी रिकग्निशन, रीडेबिलिटी स्कोर्स, n-gram और tf-idf मॉडल्स के बारे में जानेंगे, और scikit-learn व spaCy का उपयोग करके इन्हें इम्प्लीमेंट करना सीखेंगे। आप यह भी सीखेंगे कि दो डॉक्युमेंट्स एक-दूसरे से कितने समान हैं, यह कैसे निकाला जाए। इस दौरान, आप मूवी रिव्यू का सेंटिमेंट प्रिडिक्ट करेंगे और मूवी तथा TED Talk रिकमेंडर बनाएँगे। कोर्स पूरा करने के बाद, आप किसी भी टेक्स्ट से अहम फीचर्स इंजीनियर कर पाएँगे और डेटा साइंस की कई चुनौतीपूर्ण समस्याएँ सुलझा पाएँगे!

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

1

बेसिक फीचर्स और रीडेबिलिटी स्कोर्स

शब्दों की संख्या, कैरेक्टर्स की संख्या, औसत शब्द-लंबाई और स्पेशल कैरेक्टर्स (जैसे Twitter हैशटैग्स और मेंशन्स) की संख्या जैसे बेसिक फीचर्स निकालना सीखें। आप रीडेबिलिटी स्कोर्स निकालना और किसी टेक्स्ट को समझने के लिए कितनी शिक्षा आवश्यक है, यह निर्धारित करना भी सीखेंगे।
अध्याय शुरू करें
2

टेक्स्ट प्रीप्रोसेसिंग, POS टैगिंग और NER

इस चैप्टर में, आप टोकनाइज़ेशन और लेमाटाइज़ेशन के बारे में सीखेंगे। इसके बाद, आप spaCy लाइब्रेरी का उपयोग करके टेक्स्ट क्लीनिंग, पार्ट-ऑफ-स्पीच टैगिंग, और नेम्ड एंटिटी रिकग्निशन करना सीखेंगे। इन कॉन्सेप्ट्स में महारत हासिल करने के बाद, आप Gettysburg address को मशीन-फ्रेंडली बनाएँगे, फेक न्यूज़ में संज्ञा के उपयोग का विश्लेषण करेंगे, और TechCrunch आर्टिकल में उल्लिखित लोगों की पहचान करेंगे।
अध्याय शुरू करें
4

TF-IDF और सिमिलैरिटी स्कोर्स

दो वेक्टर्स के बीच tf-idf वेट्स और कॉसाइन सिमिलैरिटी स्कोर कैसे निकाले जाते हैं, यह सीखें। इन कॉन्सेप्ट्स का उपयोग करके आप एक मूवी और TED Talk रिकमेंडर बनाएँगे। अंत में, आप वर्ड एम्बेडिंग्स के बारे में भी सीखेंगे और वर्ड वेक्टर रिप्रेज़ेंटेशन्स का उपयोग करके विभिन्न Pink Floyd गानों के बीच सिमिलैरिटीज़ निकालेंगे।
अध्याय शुरू करें

Python में NLP के लिए Feature Engineering

कोर्स
पूरा

उपलब्धि प्रमाणपत्र प्राप्त करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएं

हमारे मोबाइल पाठ्यक्रमों और दैनिक 5-मिनट कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।

Python में NLP के लिए Feature Engineering | DataCamp