Hoppa till huvudinnehållet

Kurs

Datarensning i R

Mellannivå4 tim

Lär dig att rensa data så snabbt och exakt som möjligt för att hjälpa dig gå från rådata till fantastiska insikter.

R4 tim13 videor44 övningar3,700 XP61,321Intyg om fullgjord kurs

Skapa ditt kostnadsfria konto

Fortsätt med Google
eller
Genom att fortsätta godkänner du våra Användarvillkor, vår Integritetspolicy och att dina data lagras i USA.

Älskad av elever på tusentals företag

Utbildar ett team?

Prova för företag

Kursbeskrivning

{ "results": [] }

Det sägs ofta att data scientists lägger 80 % av sin tid på att rensa och bearbeta data och bara 20 % av sin tid på att analysera den. Tiden som läggs på att rensa data är avgörande, eftersom analys av smutsig data kan leda till att du drar felaktiga slutsatser.

I den här kursen lär du dig en rad tekniker som hjälper dig att rensa smutsig data med R. Du börjar med att konvertera datatyper, tillämpa intervallbegränsningar och hantera fullständiga och partiella dubbletter för att undvika dubbelräkning.

Fördjupa dig i avancerade datautmaningar

När du har övat på att arbeta med vanliga dataproblem går du vidare till mer avancerade utmaningar, som att säkerställa konsekvens i mätningar och hantera saknade data. Efter varje nytt koncept får du möjlighet att genomföra en praktisk övning för att befästa dina kunskaper och bygga upp din erfarenhet.

Lär dig använda record linkage vid datarensning

Record linkage används för att slå samman dataset när värdena har problem som stavfel eller olika stavningar. Du kommer att utforska denna användbara teknik i det sista kapitlet och öva på tillämpningen genom att använda den för att slå ihop två dataset med restaurangrecensioner till ett enda dataset.

Förkunskapskrav

Kursplan

Kursöversikt

1

Vanliga dataproblem

I det här kapitlet lär du dig att hantera några av de vanligaste problemen med smutsig data. Du konverterar datatyper, tillämpar intervallbegränsningar för att ta bort framtida datapunkter och tar bort duplicerade datapunkter för att undvika dubbelräkning.
Starta kapitel
2

Kategorisk data och textdata

Kategorisk data och textdata kan ofta vara de mest svårhanterliga delarna av en datamängd på grund av sin ostrukturerade natur. I det här kapitlet lär du dig att åtgärda inkonsekvenser med blanksteg och versalisering i kategorietiketter, slå ihop flera kategorier till en och formatera om strängar för enhetlighet.
Starta kapitel
3

Avancerade dataproblem

I det här kapitlet fördjupar du dig i mer avancerade datarensningsproblem, till exempel att säkerställa att vikter anges i kilogram i stället för pund. Du får också värdefulla färdigheter som hjälper dig att kontrollera att värden har lagts till korrekt och att saknade värden inte påverkar dina analyser negativt.
Starta kapitel
4

Postlänkning

Postlänkning är en kraftfull teknik som används för att sammanfoga flera datamängder, särskilt när värden innehåller stavfel eller olika stavningar. I det här kapitlet lär du dig att länka poster genom att beräkna likheten mellan strängar – sedan använder du dina nya färdigheter för att slå samman två restaurangrecensiondatamängder till en samlad och ren datamängd.
Starta kapitel
R

Datarensning i R

Kurs
slutförd

Tjäna intyg om genomförande

Registrera dig nu

Utveckla dina datakunskaper med DataCamp för mobil

Ta dig framåt var du än är med våra mobilkurser och dagliga 5-minuterskodningsutmaningar.

Datarensning i R | DataCamp