मुख्य सामग्री पर जाएं

कोर्स

PySpark के साथ Big Data Fundamentals

उन्नत4 घंटे

PySpark के साथ बिग डेटा पर काम करने की मूल बातें सीखें।

Python4 घंटे16 वीडियो55 अभ्यास4,600 XP65,832उपलब्धि प्रमाणपत्र

अपना नि:शुल्क अकाउंट बनाएँ

Google के साथ जारी रखें
या
जारी रखकर, आप हमारी उपयोग की शर्तें, हमारा गोपनीयता नीति और यह कि आपका डेटा USA में संग्रहीत है।

हज़ारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

टीम को प्रशिक्षित कर रहे हैं?

बिज़नेस आज़माएँ

कोर्स विवरण

पिछले कुछ वर्षों में Big Data को लेकर काफी चर्चा रही है, और अब यह कई कंपनियों के लिए मुख्यधारा बन चुका है। लेकिन Big Data है क्या? यह कोर्स PySpark के ज़रिए Big Data की बुनियादी बातें कवर करता है। Spark एक "lightning fast cluster computing" फ्रेमवर्क है जो Big Data के लिए बनाया गया है। यह एक जनरल डेटा प्रोसेसिंग प्लेटफ़ॉर्म इंजन देता है और आपको प्रोग्राम्स मेमोरी में 100x तक तेज़, या डिस्क पर 10x तक तेज़ चलाने देता है, Hadoop की तुलना में। आप PySpark, यानी Spark प्रोग्रामिंग के लिए Python पैकेज, और इसकी शक्तिशाली हाई-लेवल लाइब्रेरीज़ जैसे SparkSQL, MLlib (machine learning के लिए) आदि का इस्तेमाल करेंगे। आप William Shakespeare के कामों का अध्ययन करेंगे, Fifa 2018 डेटा का विश्लेषण करेंगे और genomic डेटासेट्स पर क्लस्टरिंग करेंगे। इस कोर्स के अंत तक, आप PySpark और सामान्य Big Data analysis में उसके उपयोग की गहरी समझ हासिल कर लेंगे।

पूर्वापेक्षाएँ

पाठ्यक्रम

कोर्स रूपरेखा

1

Spark के साथ Big Data analysis परिचय

यह अध्याय Big Data की रोमांचक दुनिया का परिचय कराता है, साथ ही Big Data प्रोसेसिंग के लिए अलग-अलग कॉन्सेप्ट्स और फ्रेमवर्क्स भी समझाता है। आप समझेंगे कि Apache Spark को Big Data के लिए सर्वश्रेष्ठ फ्रेमवर्क क्यों माना जाता है।
अध्याय शुरू करें
2

PySpark RDD's में प्रोग्रामिंग

3

PySpark SQL और DataFrames

इस अध्याय में, आप Spark SQL के बारे में सीखेंगे, जो structured data processing के लिए Spark का मॉड्यूल है। यह DataFrames नाम की एक प्रोग्रामिंग abstraction देता है और एक distributed SQL query engine की तरह भी काम कर सकता है। यह अध्याय दिखाता है कि Spark SQL आपको Python में DataFrames का उपयोग कैसे करने देता है।
अध्याय शुरू करें
4

PySpark MLlib के साथ Machine Learning

PySpark MLlib, Apache Spark की scalable machine learning लाइब्रेरी है जो Python में सामान्य learning एल्गोरिदम्स और यूटिलिटीज़ प्रदान करती है। पूरे इस अंतिम अध्याय में, आप महत्वपूर्ण Machine Learning एल्गोरिदम्स सीखेंगे। आप एक मूवी रिकमेंडेशन इंजन और एक स्पैम फ़िल्टर बनाएँगे, और k-means क्लस्टरिंग का उपयोग करेंगे।
अध्याय शुरू करें

PySpark के साथ Big Data Fundamentals

कोर्स
पूरा

उपलब्धि प्रमाणपत्र प्राप्त करें

अभी नामांकन करें

DataCamp for Mobile के साथ अपने डेटा कौशल बढ़ाएं

हमारे मोबाइल पाठ्यक्रमों और दैनिक 5-मिनट कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।