Hoppa till huvudinnehållet
HemR

Kurs

Datarensning i R

MedelnivåKunskapsnivå
Uppdaterad 2024-08
Lär dig att rensa data så snabbt och exakt som möjligt för att hjälpa dig gå från rådata till fantastiska insikter.
Starta kursen gratis
RData Preparation
4 tim
13 videor
44 Övningar
3,700 XP
61,153
Intyg om genomförande

Skapa ditt kostnadsfria konto

Fortsätt med GoogleVisa fler alternativ

eller


Genom att fortsätta godkänner du våra användarvillkor, vår integritetspolicy och att dina uppgifter lagras i USA.

Omtyckt av lärande på tusentals företag

Group

Utbildar du ett team?

Prova för företag

Kursbeskrivning

{ "results": [] }

Det sägs ofta att data scientists lägger 80 % av sin tid på att rensa och bearbeta data och bara 20 % av sin tid på att analysera den. Tiden som läggs på att rensa data är avgörande, eftersom analys av smutsig data kan leda till att du drar felaktiga slutsatser.

I den här kursen lär du dig en rad tekniker som hjälper dig att rensa smutsig data med R. Du börjar med att konvertera datatyper, tillämpa intervallbegränsningar och hantera fullständiga och partiella dubbletter för att undvika dubbelräkning.

Fördjupa dig i avancerade datautmaningar

När du har övat på att arbeta med vanliga dataproblem går du vidare till mer avancerade utmaningar, som att säkerställa konsekvens i mätningar och hantera saknade data. Efter varje nytt koncept får du möjlighet att genomföra en praktisk övning för att befästa dina kunskaper och bygga upp din erfarenhet.

Lär dig använda record linkage vid datarensning

Record linkage används för att slå samman dataset när värdena har problem som stavfel eller olika stavningar. Du kommer att utforska denna användbara teknik i det sista kapitlet och öva på tillämpningen genom att använda den för att slå ihop två dataset med restaurangrecensioner till ett enda dataset.

Förkunskapskrav

Joining Data with dplyr
1

Vanliga dataproblem

I det här kapitlet lär du dig att hantera några av de vanligaste problemen med smutsig data. Du konverterar datatyper, tillämpar intervallbegränsningar för att ta bort framtida datapunkter och tar bort duplicerade datapunkter för att undvika dubbelräkning.
Starta kapitel
2

Kategorisk data och textdata

Kategorisk data och textdata kan ofta vara de mest svårhanterliga delarna av en datamängd på grund av sin ostrukturerade natur. I det här kapitlet lär du dig att åtgärda inkonsekvenser med blanksteg och versalisering i kategorietiketter, slå ihop flera kategorier till en och formatera om strängar för enhetlighet.
Starta kapitel
3

Avancerade dataproblem

I det här kapitlet fördjupar du dig i mer avancerade datarensningsproblem, till exempel att säkerställa att vikter anges i kilogram i stället för pund. Du får också värdefulla färdigheter som hjälper dig att kontrollera att värden har lagts till korrekt och att saknade värden inte påverkar dina analyser negativt.
Starta kapitel
4

Postlänkning

Postlänkning är en kraftfull teknik som används för att sammanfoga flera datamängder, särskilt när värden innehåller stavfel eller olika stavningar. I det här kapitlet lär du dig att länka poster genom att beräkna likheten mellan strängar – sedan använder du dina nya färdigheter för att slå samman två restaurangrecensiondatamängder till en samlad och ren datamängd.
Starta kapitel
Datarensning i R
Kurs
slutförd

Tjäna ett prestationsbevis

Lägg till det här beviset i din LinkedIn-profil, ditt CV eller din meritförteckning
Dela det i sociala medier och i din medarbetarutvärdering
Registrera dig nu

Gå med 19 miljoner lärande och börja Datarensning i R idag!

Skapa ditt kostnadsfria konto

Fortsätt med GoogleVisa fler alternativ

eller


Genom att fortsätta godkänner du våra användarvillkor, vår integritetspolicy och att dina uppgifter lagras i USA.

Utveckla dina datakunskaper med DataCamp för mobilen

Gör framsteg när du är på språng med våra mobila kurser och dagliga 5-minuters kodningsutmaningar.