मुख्य सामग्री पर जाएं

कोर्स

PySpark के साथ Machine Learning

उन्नत4 घंटे

Apache Spark के साथ डेटा से पूर्वानुमान बनाना सीखें, decision trees, logistic regression, linear regression, ensembles और pipelines का उपयोग करके.

Python4 घंटे16 वीडियो56 अभ्यास4,550 XP29,829उपलब्धि प्रमाणपत्र

अपना नि:शुल्क अकाउंट बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारा गोपनीयता नीति और यह कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

टीम को प्रशिक्षित कर रहे हैं?

बिज़नेस आज़माएँ

कोर्स विवरण

मशीन लर्निंग के लिए Apache Spark का उपयोग करना सीखें

स्पार्क बिग डेटा के साथ काम करने के लिए एक शक्तिशाली, सामान्य-उद्देश्य उपकरण है। Spark क्लस्टर में कंप्यूट कार्यों के वितरण को पारदर्शी रूप से संभालता है। इसका मतलब है कि संचालन तेज़ हैं, लेकिन यह आपको तकनीकी विवरणों की चिंता करने के बजाय विश्लेषण पर ध्यान केंद्रित करने की भी अनुमति देता है। इस पाठ्यक्रम में आप सीखेंगे कि डेटा को Spark में कैसे लाया जाए और फिर तीन मूलभूत Spark मशीन लर्निंग एल्गोरिदमों में गहराई से कैसे जाएँ: लीनियर रिग्रेशन, लॉजिस्टिक रिग्रेशन/क्लासिफ़ायर्स, और पाइपलाइनों का निर्माण।

निर्णय वृक्ष बनाएं और उनका परीक्षण करें

अपने खुद के निर्णय वृक्ष बनाना मशीन लर्निंग मॉडलों की खोज शुरू करने का एक शानदार तरीका है। आप ‘रिकर्सिव पार्टिशनिंग’ नामक एक एल्गोरिद्म का उपयोग करके डेटा को दो वर्गों में विभाजित करेंगे और अपने डेटा के भीतर एक ऐसा प्रेडिक्टर खोजेंगे जो दोनों वर्गों का सबसे अधिक सूचनात्मक विभाजन प्रदान करे, और फिर आगे के नोड्स के साथ इस प्रक्रिया को दोहराएँगे। फिर आप अपने निर्णय वृक्ष का उपयोग नए डेटा के साथ पूर्वानुमान लगाने के लिए कर सकते हैं।

PySpark में लॉजिस्टिक और लीनियर रिग्रेशन में महारत हासिल करें

लॉजिस्टिक और रैखिक प्रतिगमन PySpark द्वारा समर्थित आवश्यक मशीन लर्निंग तकनीकें हैं। आप लॉजिस्टिक रिग्रेशन मॉडल बनाना और उनका मूल्यांकन करना सीखेंगे, और फिर लीनियर रिग्रेशन मॉडल बनाने की ओर बढ़ेंगे, ताकि आप अपने प्रेडिक्टर्स को केवल सबसे प्रासंगिक विकल्पों तक परिष्कृत कर सकें।

पाठ्यक्रम के अंत तक, आप पूरे आत्मविश्वास के साथ अपने नए-नए मशीन लर्निंग ज्ञान को लागू कर पाएँगे, क्योंकि पूरे पाठ्यक्रम में आपको व्यावहारिक कार्य और अभ्यास डेटा सेट मिलेंगे।

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

1

परिचय

Spark बड़े डेटा के साथ काम करने के लिए एक फ्रेमवर्क है। इस अध्याय में आप Spark और Machine Learning की पृष्ठभूमि कवर करेंगे। फिर आप Python के ज़रिए Spark से कनेक्ट करना और CSV डेटा लोड करना सीखेंगे।
अध्याय शुरू करें
3

रीग्रेशन

अगले चरण में आप Linear Regression मॉडल बनाना सीखेंगे। आप नए प्रीडिक्टर्स इंजीनियर करके डेटा को बेहतर बनाना और केवल सबसे प्रासंगिक प्रीडिक्टर्स चुनने के एक मज़बूत तरीके के बारे में भी जानेंगे।
अध्याय शुरू करें
4

एंसेंबल्स और पाइपलाइंस

अंत में आप सीखेंगे कि अपने मॉडल्स को और कुशल कैसे बनाया जाए। आप पाइपलाइंस का उपयोग करना सीखेंगे ताकि आपका कोड साफ़ और मेंटेन करना आसान हो। फिर आप क्रॉस-वैलिडेशन का उपयोग करेंगे ताकि मॉडल्स का बेहतर परीक्षण हो और अच्छे पैरामीटर्स चुने जा सकें। अंत में, आप दो प्रकार के एंसेंबल मॉडल्स आज़माएँगे।
अध्याय शुरू करें

PySpark के साथ Machine Learning

कोर्स
पूरा

उपलब्धि प्रमाणपत्र प्राप्त करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएं

हमारे मोबाइल पाठ्यक्रमों और दैनिक 5-मिनट कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।