मुख्य सामग्री पर जाएं
होमSpark

कोर्स

PySpark के साथ Feature Engineering

उन्नतकौशल स्तर
अपडेट किया गया 01/2026
डेटा वैज्ञानिकों का 70-80% समय लेने वाले बारीक पहलू सीखें; डेटा रैंगलिंग और फीचर इंजीनियरिंग।
मुफ़्त में पाठ्यक्रम शुरू करें
SparkData Manipulation
4 घंटे
16 वीडियो
60 अभ्यास
5,000 XP
17,823
उपलब्धि का प्रमाण पत्र

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

हजारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

Group

टीम को ट्रेनिंग देना चाहते हैं?

व्यवसाय के लिए आज़माएँ

पाठ्यक्रम विवरण

वास्तविक दुनिया का डेटा बिखरा हुआ होता है, और आपका काम उसे समझ में लाना है। MTCars और Iris जैसे टॉय डेटासेट सावधानीपूर्वक क्यूरेशन और क्लीनिंग का नतीजा होते हैं, फिर भी उन्हें उपयोगी बनाने के लिए ट्रांसफ़ॉर्म करना पड़ता है ताकि शक्तिशाली मशीन लर्निंग एल्गोरिदम अर्थ निकाल सकें, फोरकास्ट कर सकें, क्लासिफ़ाई करें या क्लस्टर बनाएँ। इस कोर्स में हम वे पेचीदा बातें कवर करेंगे जिन पर डेटा साइंटिस्ट अपना 70–80% समय लगाते हैं: डेटा रैंगलिंग और फीचर इंजीनियरिंग। अब जब डेटासेट का आकार पहले से कहीं बड़ा हो रहा है, तो आइए PySpark का उपयोग करके इस Big Data समस्या को संभालने लायक आकार में लाएँ!

पूर्व आवश्यकताएं

Supervised Learning with scikit-learnIntroduction to PySpark
1

Exploratory Data Analysis

सीधे कूदने से पहले अपनी समस्या के बारे में थोड़ा जानिए! फिर सीखिए कि अपने डेटासेट का सांख्यिकीय और विज़ुअल तरीके से निरीक्षण कैसे करें!
अध्याय शुरू करें
2

Spark फंक्शंस के साथ रैंगलिंग

वास्तविक डेटा शायद ही कभी साफ़ और एनालिसिस के लिए तैयार होता है। इस चैप्टर में सीखिए कि अनावश्यक जानकारी कैसे हटाएँ, missing values को कैसे संभालें और अपनी एनालिसिस में अतिरिक्त डेटा कैसे जोड़ें।
अध्याय शुरू करें
3

फीचर इंजीनियरिंग

इस चैप्टर में सीखिए कि अपने मशीन लर्निंग मॉडल के सीखने के लिए नए फीचर कैसे बनाएँ। हम फ़ील्ड्स को मिलाकर, मैसी कॉलम्स से मान निकालकर, या बेहतर नतीजों के लिए उन्हें एन्कोड करके फीचर्स जनरेट करने के तरीके देखेंगे।
अध्याय शुरू करें
4

मॉडल बनाना

इस चैप्टर में हम सीखेंगे कि किस प्रकार का मॉडल चुनना है। फिर सीखेंगे कि अपने डेटा को मॉडल पर कैसे लागू करें और उसका मूल्यांकन करें। अंत में, हम नतीजों की व्याख्या करना और मॉडल को बाद के लिए सेव करना सीखेंगे!
अध्याय शुरू करें
PySpark के साथ Feature Engineering
पाठ्यक्रम
पूर्ण

उपलब्धि का प्रमाण पत्र अर्जित करें

इस प्रमाण पत्र को अपनी LinkedIn प्रोफ़ाइल, रिज्यूमे या CV में जोड़ें
इसे सोशल मीडिया पर और अपनी प्रदर्शन समीक्षा में साझा करें
अभी नामांकन करें

19 मिलियन से अधिक शिक्षार्थियों के साथ जुड़ें और आज ही PySpark के साथ Feature Engineering शुरू करें!

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

मोबाइल के लिए DataCamp के साथ अपने डेटा कौशल को बढ़ाएं

हमारे मोबाइल कोर्स और दैनिक 5 मिनट की कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।