कोर्स
R में डेटा क्लीनिंग
मध्यमकौशल स्तर
अपडेट किया गया 08/2024
RData Preparation4 घंटे13 वीडियो44 अभ्यास3,700 XP61,158उपलब्धि का प्रमाण पत्र
अपना मुफ़्त खाता बनाएं
Google के साथ जारी रखेंअधिक विकल्प दिखाएँया
जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।
हजारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया
टीम को ट्रेनिंग देना चाहते हैं?
व्यवसाय के लिए आज़माएँपाठ्यक्रम विवरण
R में डुप्लिकेट हटाने जैसी सामान्य डेटा समस्याओं को दूर करें
अक्सर कहा जाता है कि डेटा वैज्ञानिक अपना 80% समय डेटा को साफ़ करने और उसमें हेरफेर करने में बिताते हैं, और केवल 20% समय उसका विश्लेषण करने में। डेटा को साफ़ करने में लगाया गया समय अत्यंत महत्वपूर्ण है, क्योंकि गंदे डेटा का विश्लेषण आपको गलत निष्कर्ष निकालने की ओर ले जा सकता है.इस पाठ्यक्रम में, आप R का उपयोग करके गंदे डेटा को साफ़ करने में मदद करने वाली विभिन्न तकनीकें सीखेंगे। आप डेटा प्रकारों को परिवर्तित करने, सीमा बाधाएँ लागू करने, और पूर्ण तथा आंशिक डुप्लिकेट्स से निपटने से शुरुआत करेंगे ताकि दोहरी गणना से बचा जा सके।
उन्नत डेटा चुनौतियों में गहराई से उतरें
सामान्य डेटा समस्याओं पर अभ्यास करने के बाद, आप मापों में स्थिरता सुनिश्चित करने और अनुपस्थित डेटा से निपटने जैसी अधिक उन्नत चुनौतियों की ओर बढ़ेंगे। हर नई अवधारणा के बाद, आपको अपनी समझ को मजबूत करने और अपना अनुभव बढ़ाने के लिए एक व्यावहारिक अभ्यास पूरा करने का अवसर मिलेगा।डेटा सफाई के दौरान रिकॉर्ड लिंकज का उपयोग करना सीखें
रिकॉर्ड लिंकज का उपयोग डेटासेट्स को एक साथ मर्ज करने के लिए किया जाता है, जब मानों में टाइपो या अलग-अलग वर्तनी जैसी समस्याएँ होती हैं। आप अंतिम अध्याय में इस उपयोगी तकनीक का अन्वेषण करेंगे और दो रेस्तरां समीक्षा डेटासेट को एक ही डेटासेट में जोड़ने के लिए इसका उपयोग करके इसका अभ्यास करेंगे।पूर्व आवश्यकताएं
Joining Data with dplyr1
आम डेटा समस्याएँ
इस अध्याय में, आप सबसे आम गंदे डेटा समस्याओं से निपटना सीखेंगे. आप डेटा टाइप बदलेंगे, भविष्य की data points को हटाने के लिए रेंज constraints लागू करेंगे, और डबल-काउंटिंग से बचने के लिए डुप्लिकेट data points हटाएँगे.
2
श्रेणीगत और टेक्स्ट डेटा
श्रेणीगत और टेक्स्ट डेटा अक्सर अपनी असंरचित प्रकृति के कारण डेटासेट के सबसे अव्यवस्थित हिस्से होते हैं. इस अध्याय में, आप category labels में whitespace और capitalization की असंगतियों को ठीक करना, कई categories को मिलाकर एक बनाना, और consistency के लिए strings को फिर से फ़ॉर्मैट करना सीखेंगे.
3
एडवांस्ड डेटा समस्याएँ
इस अध्याय में, आप और उन्नत डेटा क्लीनिंग समस्याओं में उतरेंगे, जैसे यह सुनिश्चित करना कि वज़न पाउंड्स की बजाय सभी किलोग्राम में लिखे हों. आप ऐसी उपयोगी स्किल्स भी सीखेंगे जो यह सत्यापित करने में मदद करेंगी कि मान सही तरह जोड़े गए हैं और missing values आपके analyses को नकारात्मक रूप से प्रभावित न करें.
4
Record Linkage
Record linkage एक शक्तिशाली तकनीक है जिसका उपयोग कई डेटासेट्स को मर्ज करने में किया जाता है, खासकर तब जब मानों में टाइपो या अलग वर्तनी हों. इस अध्याय में, आप strings के बीच similarity निकालकर रिकॉर्ड्स को लिंक करना सीखेंगे—फिर आप अपनी नई स्किल्स का उपयोग करके दो रेस्तरां रिव्यू डेटासेट्स को जोड़कर एक साफ़ master डेटासेट बनाएँगे.
R में डेटा क्लीनिंग
पाठ्यक्रम पूर्ण
उपलब्धि का प्रमाण पत्र अर्जित करें
इस प्रमाण पत्र को अपनी LinkedIn प्रोफ़ाइल, रिज्यूमे या CV में जोड़ेंइसे सोशल मीडिया पर और अपनी प्रदर्शन समीक्षा में साझा करेंअभी नामांकन करें
19 मिलियन से अधिक शिक्षार्थियों के साथ जुड़ें और आज ही R में डेटा क्लीनिंग शुरू करें!
अपना मुफ़्त खाता बनाएं
Google के साथ जारी रखेंअधिक विकल्प दिखाएँया
जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।
मोबाइल के लिए DataCamp के साथ अपने डेटा कौशल को बढ़ाएं
हमारे मोबाइल कोर्स और दैनिक 5 मिनट की कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।