Ga naar hoofdinhoud

Cursus

Data opschonen in R

Gevorderd beginner4 u

Leer hoe je data zo snel en nauwkeurig mogelijk kunt opschonen, zodat je van ruwe data naar geweldige inzichten kunt gaan.

R4 u13 video's44 oefeningen3,700 XP61,331Bewijs van voltooiing

Maak je gratis account aan

Ga verder met Google
of
Door verder te gaan accepteer je onze Gebruiksvoorwaarden, onze Privacybeleid en dat uw gegevens in de VS worden opgeslagen.

Geliefd bij learners van duizenden bedrijven

Cursusbeschrijving

Overwin veelvoorkomende gegevensproblemen, zoals het verwijderen van dubbele gegevens in R

Er wordt vaak gezegd dat datawetenschappers 80% van hun tijd besteden aan het opschonen en bewerken van data en maar 20% aan het analyseren ervan. De tijd die je besteedt aan het opschonen is superbelangrijk, want als je rommelige data analyseert, kun je verkeerde conclusies trekken.

In deze cursus leer je allerlei technieken om vieze data op te schonen met R. Je begint met het omzetten van datatypes, het toepassen van bereikbeperkingen en het omgaan met volledige en gedeeltelijke duplicaten om dubbeltellingen te voorkomen.

Duik in geavanceerde uitdagingen op het gebied van data

Als je eenmaal hebt geoefend met veelvoorkomende gegevensproblemen, ga je verder met moeilijkere uitdagingen, zoals zorgen dat metingen consistent zijn en omgaan met ontbrekende gegevens. Na elk nieuw concept krijg je de kans om een praktische oefening te doen om je kennis te versterken en ervaring op te doen.

Leer hoe je recordkoppeling kunt gebruiken tijdens het opschonen van gegevens

Record Linkage wordt gebruikt om datasets samen te voegen als er problemen zijn met de waarden, zoals typefouten of verschillende spellingen. In het laatste hoofdstuk ga je deze handige techniek bekijken en oefenen hoe je het kunt gebruiken om twee datasets met restaurantrecensies samen te voegen tot één dataset.

Vereisten

Curriculum

Cursusoverzicht

1

Veelvoorkomende dataproblemen

In dit hoofdstuk leer je hoe je enkele van de meest voorkomende problemen met rommelige data aanpakt. Je zet datatypes om, past bereikbeperkingen toe om toekomstige datapunten te verwijderen en haalt dubbele datapunten weg om dubbel tellen te voorkomen.
Start hoofdstuk
2

Categorische en tekstuele data

Categorische en tekstuele data zijn vaak de rommeligste onderdelen van een gegevensset door hun ongestructureerde aard. In dit hoofdstuk leer je hoe je witruimte en inconsistent hoofdlettergebruik in categorielabels corrigeert, meerdere categorieën samenvoegt en strings herformatteert voor consistentie.
Start hoofdstuk
3

Geavanceerde dataproblemen

In dit hoofdstuk ga je aan de slag met meer geavanceerde opschoningsproblemen, zoals ervoor zorgen dat gewichten allemaal in kilogram worden genoteerd in plaats van in pounds. Je ontwikkelt ook waardevolle vaardigheden om te controleren of waarden correct zijn ingevoerd en of ontbrekende waarden je analyses niet negatief beïnvloeden.
Start hoofdstuk
4

Record Linkage

Record linkage is een krachtige techniek om meerdere gegevenssets samen te voegen, gebruikt wanneer waarden typfouten of verschillende spellingen hebben. In dit hoofdstuk leer je records koppelen door de gelijkenis tussen strings te berekenen—daarna gebruik je je nieuwe vaardigheden om twee gegevenssets met restaurantreviews samen te voegen tot één schone mastergegevensset.
Start hoofdstuk
R

Data opschonen in R

Cursus
voltooid

Verdien een Statement of Accomplishment

Nu inschrijven

Verbeter je datavaardigheden met DataCamp voor mobiel

Blijf onderweg bezig met onze mobiele cursussen en dagelijkse programmeeruitdagingen van 5 minuten.