Kurs
Datarensning i R
MedelnivåKunskapsnivå
Uppdaterad 2024-08
RData Preparation4 tim13 videor44 Övningar3,700 XP61,153Intyg om genomförande
Skapa ditt kostnadsfria konto
Fortsätt med GoogleVisa fler alternativeller
Genom att fortsätta godkänner du våra användarvillkor, vår integritetspolicy och att dina uppgifter lagras i USA.
Omtyckt av lärande på tusentals företag
Utbildar du ett team?
Prova för företagKursbeskrivning
{ "results": [] }
Det sägs ofta att data scientists lägger 80 % av sin tid på att rensa och bearbeta data och bara 20 % av sin tid på att analysera den. Tiden som läggs på att rensa data är avgörande, eftersom analys av smutsig data kan leda till att du drar felaktiga slutsatser.I den här kursen lär du dig en rad tekniker som hjälper dig att rensa smutsig data med R. Du börjar med att konvertera datatyper, tillämpa intervallbegränsningar och hantera fullständiga och partiella dubbletter för att undvika dubbelräkning.
Fördjupa dig i avancerade datautmaningar
När du har övat på att arbeta med vanliga dataproblem går du vidare till mer avancerade utmaningar, som att säkerställa konsekvens i mätningar och hantera saknade data. Efter varje nytt koncept får du möjlighet att genomföra en praktisk övning för att befästa dina kunskaper och bygga upp din erfarenhet.Lär dig använda record linkage vid datarensning
Record linkage används för att slå samman dataset när värdena har problem som stavfel eller olika stavningar. Du kommer att utforska denna användbara teknik i det sista kapitlet och öva på tillämpningen genom att använda den för att slå ihop två dataset med restaurangrecensioner till ett enda dataset.Förkunskapskrav
Joining Data with dplyr1
Vanliga dataproblem
I det här kapitlet lär du dig att hantera några av de vanligaste problemen med smutsig data. Du konverterar datatyper, tillämpar intervallbegränsningar för att ta bort framtida datapunkter och tar bort duplicerade datapunkter för att undvika dubbelräkning.
2
Kategorisk data och textdata
Kategorisk data och textdata kan ofta vara de mest svårhanterliga delarna av en datamängd på grund av sin ostrukturerade natur. I det här kapitlet lär du dig att åtgärda inkonsekvenser med blanksteg och versalisering i kategorietiketter, slå ihop flera kategorier till en och formatera om strängar för enhetlighet.
3
Avancerade dataproblem
I det här kapitlet fördjupar du dig i mer avancerade datarensningsproblem, till exempel att säkerställa att vikter anges i kilogram i stället för pund. Du får också värdefulla färdigheter som hjälper dig att kontrollera att värden har lagts till korrekt och att saknade värden inte påverkar dina analyser negativt.
4
Postlänkning
Postlänkning är en kraftfull teknik som används för att sammanfoga flera datamängder, särskilt när värden innehåller stavfel eller olika stavningar. I det här kapitlet lär du dig att länka poster genom att beräkna likheten mellan strängar – sedan använder du dina nya färdigheter för att slå samman två restaurangrecensiondatamängder till en samlad och ren datamängd.
Datarensning i R
Kurs slutförd
Tjäna ett prestationsbevis
Lägg till det här beviset i din LinkedIn-profil, ditt CV eller din meritförteckningDela det i sociala medier och i din medarbetarutvärderingRegistrera dig nu
Gå med 19 miljoner lärande och börja Datarensning i R idag!
Skapa ditt kostnadsfria konto
Fortsätt med GoogleVisa fler alternativeller
Genom att fortsätta godkänner du våra användarvillkor, vår integritetspolicy och att dina uppgifter lagras i USA.
Utveckla dina datakunskaper med DataCamp för mobilen
Gör framsteg när du är på språng med våra mobila kurser och dagliga 5-minuters kodningsutmaningar.