मुख्य सामग्री पर जाएं
होमR

कोर्स

R में डेटा क्लीनिंग

मध्यमकौशल स्तर
अपडेट किया गया 08/2024
डेटा को जितनी जल्दी और सटीकता से संभव हो साफ़ करना सीखें, ताकि आप कच्चे डेटा से शानदार अंतर्दृष्टि तक पहुँच सकें।
मुफ़्त में पाठ्यक्रम शुरू करें
RData Preparation
4 घंटे
13 वीडियो
44 अभ्यास
3,700 XP
61,158
उपलब्धि का प्रमाण पत्र

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

हजारों कंपनियों के शिक्षार्थियों द्वारा पसंद किया गया

Group

टीम को ट्रेनिंग देना चाहते हैं?

व्यवसाय के लिए आज़माएँ

पाठ्यक्रम विवरण

R में डुप्लिकेट हटाने जैसी सामान्य डेटा समस्याओं को दूर करें

अक्सर कहा जाता है कि डेटा वैज्ञानिक अपना 80% समय डेटा को साफ़ करने और उसमें हेरफेर करने में बिताते हैं, और केवल 20% समय उसका विश्लेषण करने में। डेटा को साफ़ करने में लगाया गया समय अत्यंत महत्वपूर्ण है, क्योंकि गंदे डेटा का विश्लेषण आपको गलत निष्कर्ष निकालने की ओर ले जा सकता है.

इस पाठ्यक्रम में, आप R का उपयोग करके गंदे डेटा को साफ़ करने में मदद करने वाली विभिन्न तकनीकें सीखेंगे। आप डेटा प्रकारों को परिवर्तित करने, सीमा बाधाएँ लागू करने, और पूर्ण तथा आंशिक डुप्लिकेट्स से निपटने से शुरुआत करेंगे ताकि दोहरी गणना से बचा जा सके।

उन्नत डेटा चुनौतियों में गहराई से उतरें

सामान्य डेटा समस्याओं पर अभ्यास करने के बाद, आप मापों में स्थिरता सुनिश्चित करने और अनुपस्थित डेटा से निपटने जैसी अधिक उन्नत चुनौतियों की ओर बढ़ेंगे। हर नई अवधारणा के बाद, आपको अपनी समझ को मजबूत करने और अपना अनुभव बढ़ाने के लिए एक व्यावहारिक अभ्यास पूरा करने का अवसर मिलेगा।

डेटा सफाई के दौरान रिकॉर्ड लिंकज का उपयोग करना सीखें

रिकॉर्ड लिंकज का उपयोग डेटासेट्स को एक साथ मर्ज करने के लिए किया जाता है, जब मानों में टाइपो या अलग-अलग वर्तनी जैसी समस्याएँ होती हैं। आप अंतिम अध्याय में इस उपयोगी तकनीक का अन्वेषण करेंगे और दो रेस्तरां समीक्षा डेटासेट को एक ही डेटासेट में जोड़ने के लिए इसका उपयोग करके इसका अभ्यास करेंगे।

पूर्व आवश्यकताएं

Joining Data with dplyr
1

आम डेटा समस्याएँ

इस अध्याय में, आप सबसे आम गंदे डेटा समस्याओं से निपटना सीखेंगे. आप डेटा टाइप बदलेंगे, भविष्य की data points को हटाने के लिए रेंज constraints लागू करेंगे, और डबल-काउंटिंग से बचने के लिए डुप्लिकेट data points हटाएँगे.
अध्याय शुरू करें
2

श्रेणीगत और टेक्स्ट डेटा

श्रेणीगत और टेक्स्ट डेटा अक्सर अपनी असंरचित प्रकृति के कारण डेटासेट के सबसे अव्यवस्थित हिस्से होते हैं. इस अध्याय में, आप category labels में whitespace और capitalization की असंगतियों को ठीक करना, कई categories को मिलाकर एक बनाना, और consistency के लिए strings को फिर से फ़ॉर्मैट करना सीखेंगे.
अध्याय शुरू करें
3

एडवांस्ड डेटा समस्याएँ

इस अध्याय में, आप और उन्नत डेटा क्लीनिंग समस्याओं में उतरेंगे, जैसे यह सुनिश्चित करना कि वज़न पाउंड्स की बजाय सभी किलोग्राम में लिखे हों. आप ऐसी उपयोगी स्किल्स भी सीखेंगे जो यह सत्यापित करने में मदद करेंगी कि मान सही तरह जोड़े गए हैं और missing values आपके analyses को नकारात्मक रूप से प्रभावित न करें.
अध्याय शुरू करें
4

Record Linkage

Record linkage एक शक्तिशाली तकनीक है जिसका उपयोग कई डेटासेट्स को मर्ज करने में किया जाता है, खासकर तब जब मानों में टाइपो या अलग वर्तनी हों. इस अध्याय में, आप strings के बीच similarity निकालकर रिकॉर्ड्स को लिंक करना सीखेंगे—फिर आप अपनी नई स्किल्स का उपयोग करके दो रेस्तरां रिव्यू डेटासेट्स को जोड़कर एक साफ़ master डेटासेट बनाएँगे.
अध्याय शुरू करें
R में डेटा क्लीनिंग
पाठ्यक्रम
पूर्ण

उपलब्धि का प्रमाण पत्र अर्जित करें

इस प्रमाण पत्र को अपनी LinkedIn प्रोफ़ाइल, रिज्यूमे या CV में जोड़ें
इसे सोशल मीडिया पर और अपनी प्रदर्शन समीक्षा में साझा करें
अभी नामांकन करें

19 मिलियन से अधिक शिक्षार्थियों के साथ जुड़ें और आज ही R में डेटा क्लीनिंग शुरू करें!

अपना मुफ़्त खाता बनाएं

Google के साथ जारी रखेंअधिक विकल्प दिखाएँ

या


जारी रखने पर, आप हमारी उपयोग की शर्तें, हमारी गोपनीयता नीति को स्वीकार करते हैं और यह भी कि आपका डेटा संयुक्त राज्य अमेरिका में संग्रहीत किया जाता है।

मोबाइल के लिए DataCamp के साथ अपने डेटा कौशल को बढ़ाएं

हमारे मोबाइल कोर्स और दैनिक 5 मिनट की कोडिंग चुनौतियों के साथ चलते-फिरते प्रगति करें।