मुख्य सामग्री पर जाएं
होमSpark

कोर्स

PySpark के साथ Big Data Fundamentals

उन्नतकौशल स्तर
अपडेट किया गया 02/2025
PySpark के साथ बिग डेटा पर काम करने की मूल बातें सीखें।
मुफ़्त में पाठ्यक्रम शुरू करें
SparkData Engineering
4 घंटे
16 वीडियो
55 अभ्यास
4,600 XP
65,588
उपलब्धि का प्रमाण पत्र

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

हजारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

Group

टीम को ट्रेनिंग देना चाहते हैं?

व्यवसाय के लिए आज़माएँ

पाठ्यक्रम विवरण

पिछले कुछ वर्षों में Big Data को लेकर काफी चर्चा रही है, और अब यह कई कंपनियों के लिए मुख्यधारा बन चुका है। लेकिन Big Data है क्या? यह कोर्स PySpark के ज़रिए Big Data की बुनियादी बातें कवर करता है। Spark एक "lightning fast cluster computing" फ्रेमवर्क है जो Big Data के लिए बनाया गया है। यह एक जनरल डेटा प्रोसेसिंग प्लेटफ़ॉर्म इंजन देता है और आपको प्रोग्राम्स मेमोरी में 100x तक तेज़, या डिस्क पर 10x तक तेज़ चलाने देता है, Hadoop की तुलना में। आप PySpark, यानी Spark प्रोग्रामिंग के लिए Python पैकेज, और इसकी शक्तिशाली हाई-लेवल लाइब्रेरीज़ जैसे SparkSQL, MLlib (machine learning के लिए) आदि का इस्तेमाल करेंगे। आप William Shakespeare के कामों का अध्ययन करेंगे, Fifa 2018 डेटा का विश्लेषण करेंगे और genomic डेटासेट्स पर क्लस्टरिंग करेंगे। इस कोर्स के अंत तक, आप PySpark और सामान्य Big Data analysis में उसके उपयोग की गहरी समझ हासिल कर लेंगे।

पूर्व आवश्यकताएं

Introduction to Python
1

Spark के साथ Big Data analysis परिचय

यह अध्याय Big Data की रोमांचक दुनिया का परिचय कराता है, साथ ही Big Data प्रोसेसिंग के लिए अलग-अलग कॉन्सेप्ट्स और फ्रेमवर्क्स भी समझाता है। आप समझेंगे कि Apache Spark को Big Data के लिए सर्वश्रेष्ठ फ्रेमवर्क क्यों माना जाता है।
अध्याय शुरू करें
2

PySpark RDD's में प्रोग्रामिंग

Spark जो मुख्य abstraction प्रदान करता है वह है resilient distributed dataset (RDD), जो इस इंजन का मूल और रीढ़ की हड्डी जैसा डेटा टाइप है। यह अध्याय RDDs का परिचय देता है और दिखाता है कि RDD Transformations और Actions का उपयोग करके RDDs कैसे बनाए और चलाए जाते हैं।
अध्याय शुरू करें
3

PySpark SQL और DataFrames

इस अध्याय में, आप Spark SQL के बारे में सीखेंगे, जो structured data processing के लिए Spark का मॉड्यूल है। यह DataFrames नाम की एक प्रोग्रामिंग abstraction देता है और एक distributed SQL query engine की तरह भी काम कर सकता है। यह अध्याय दिखाता है कि Spark SQL आपको Python में DataFrames का उपयोग कैसे करने देता है।
अध्याय शुरू करें
4

PySpark MLlib के साथ Machine Learning

PySpark MLlib, Apache Spark की scalable machine learning लाइब्रेरी है जो Python में सामान्य learning एल्गोरिदम्स और यूटिलिटीज़ प्रदान करती है। पूरे इस अंतिम अध्याय में, आप महत्वपूर्ण Machine Learning एल्गोरिदम्स सीखेंगे। आप एक मूवी रिकमेंडेशन इंजन और एक स्पैम फ़िल्टर बनाएँगे, और k-means क्लस्टरिंग का उपयोग करेंगे।
अध्याय शुरू करें
PySpark के साथ Big Data Fundamentals
पाठ्यक्रम
पूर्ण

उपलब्धि का प्रमाण पत्र अर्जित करें

इस प्रमाण पत्र को अपनी LinkedIn प्रोफ़ाइल, रिज्यूमे या CV में जोड़ें
इसे सोशल मीडिया पर और अपनी प्रदर्शन समीक्षा में साझा करें
अभी नामांकन करें

19 मिलियन से अधिक शिक्षार्थियों के साथ जुड़ें और आज ही PySpark के साथ Big Data Fundamentals शुरू करें!

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

मोबाइल के लिए DataCamp के साथ अपने डेटा कौशल को बढ़ाएं

हमारे मोबाइल कोर्स और दैनिक 5 मिनट की कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।