Build your ultimate AI agent
Cursusbeschrijving
Missende data komt overal voor. Het proces van het invullen van ontbrekende waarden heet imputatie. Weten hoe je dit goed aanpakt is essentieel als je nauwkeurige voorspellingen wilt maken en je wilt onderscheiden van de rest. In deze cursus leer je met visualisaties en statistische toetsen patronen van missende data herkennen en hoe je data kunt imputeren met een reeks statistische en Machine Learning-modellen. Je ontwikkelt ook besluitvaardigheid: je leert kiezen welke imputatiemethode het best past bij een bepaalde situatie. Tot slot leer je onzekerheid uit imputatie mee te nemen in je inferenties en voorspellingen, zodat die robuuster en betrouwbaarder worden.
Vereisten
Curriculum
Cursusoverzicht
1
Het probleem van missende data
In dit hoofdstuk ontdek je waarom missende data een risico kan zijn bij het analyseren van een gegevensset. Je maakt kennis met de drie mechanismen achter missende data en leert ze herkennen met statistische toetsen en visualisatietools.
- Ontbrekende data: wat kan er misgaan50 XP
- Lineaire regressie met onvolledige gegevens100 XP
- Regressie-uitvoer analyseren50 XP
- Modellen vergelijken100 XP
- Mechanismen achter ontbrekende data50 XP
- Herkennen van mechanismen voor ontbrekende data100 XP
- t-toets voor MAR: datavoorbereiding100 XP
- t-toets voor MAR: interpretatie100 XP
- Ontbrekende datap patronen visualiseren50 XP
- Aggregatieplot100 XP
- Ruggengraatafbeelding100 XP
- Mozaïekdiagram100 XP
2
Donorgebaseerde imputatie
Leer de taxonomie van imputatiemethoden kennen en drie donorgebaseerde technieken: gemiddelde-, hot-deck- en k-Nearest-Neighbors-imputatie. Je kijkt onder de motorkap om te zien hoe deze methoden werken, voordat je ze toepast op een echte gegevensset met tropisch weer. Onderweg leer je ook handige trucs om ze nog beter te laten werken voor jouw problemen.
3
Modelgebaseerde imputatie
Tijd om statistische en Machine Learning-modellen, zoals lineaire regressie, logistische regressie en random forests, te gebruiken om missende data te imputeren. In dit hoofdstuk kijk je hoe de modellen hun voorspellingen maken en gebruik je die kennis om de geïmputeerde waarden te trekken uit conditionele verdelingen. Dat is belangrijk, omdat je imputaties zo gevarieerder en plausibeler worden en meer lijken op de echte data.
4
Onzekerheid door imputatie
Geïmputeerde waarden staan niet in steen gebeiteld. Het zijn schattingen, en schattingen brengen onzekerheid met zich mee. In dit laatste hoofdstuk ontdek je hoe bootstrapping en gekoppelde vergelijkingen met het pakket mice kunnen worden gebruikt om onzekerheid door imputatie op te nemen in je modellen en analyses, zodat ze betrouwbaarder en robuuster worden.
R
Omgaan met missende data met imputaties in R
Cursus
voltooid

