Build your ultimate AI agent
Kursbeskrivning
Saknade värden förekommer överallt. Processen att fylla i saknade värden kallas imputering, och att behärska detta är en viktig färdighet om du vill skapa träffsäkra förutsägelser och sticka ut från mängden. I den här kursen lär du dig att använda visualiseringar och statistiska tester för att identifiera mönster i saknade data, samt att imputera data med hjälp av statistiska modeller och maskininlärningsmodeller. Du utvecklar också din beslutsförmåga och lär dig välja rätt imputeringsmetod för olika situationer. Avslutningsvis lär du dig att hantera osäkerheten som uppstår vid imputering, vilket gör dina slutsatser och förutsägelser mer robusta och tillförlitliga.
Förkunskapskrav
Kursplan
Kursöversikt
1
Problemet med saknade data
I det här kapitlet får du lära dig varför saknade data kan utgöra en risk vid analys av en datamängd. Du introduceras till de tre mekanismerna för saknade data och lär dig att känna igen dem med hjälp av statistiska tester och visualiseringsverktyg.
- Saknade värden: vad kan gå fel50 XP
- Linjär regression med ofullständiga data100 XP
- Analysera regressionsresultat50 XP
- Jämföra modeller100 XP
- Mekanismer bakom saknade data50 XP
- Identifiera mekanismer för saknade data100 XP
- t-test för MAR: förberedelse av data100 XP
- t-test för MAR: tolkning100 XP
- Visualisering av mönster i saknade data50 XP
- Aggregationsplot100 XP
- Spine plot100 XP
- Mosaikplot100 XP
2
Donatorsbaserad imputering
Bekanta dig med taxonomin för imputeringsmetoder och lär dig tre donatorsbaserade tekniker: medelvärdesimputering, hot-deck-imputering och k-närmaste-grannar-imputering. Du får se hur metoderna fungerar under huven innan du tillämpar dem på ett verkligt dataset med tropiskt väder. På vägen lär du dig också användbara knep som gör metoderna ännu mer effektiva.
3
Modellbaserad imputering
Nu är det dags att lära dig använda statistiska modeller och maskininlärningsmodeller – som linjär regression, logistisk regression och random forests – för att imputera saknade data. I det här kapitlet undersöker du hur modellerna gör sina förutsägelser och använder den kunskapen för att dra imputerade värden från betingade fördelningar. Det här är viktigt eftersom det säkerställer att dina imputeringar blir mer varierade och rimliga, och på så sätt liknar de verkliga data mer.
4
Osäkerhet vid imputering
Imputerade värden är inte hugna i sten – de är uppskattningar, och uppskattningar är förenade med osäkerhet. I det här avslutande kapitlet får du lära dig hur bootstrapping och kedjebaserade ekvationer med paketet mice kan användas för att integrera imputeringsosäkerhet i dina modeller och analyser, och på så sätt göra dem mer tillförlitliga och robusta.
R
Hantering av saknade värden med imputering i R
Kurs
slutförd

