After doing these courses, I feel confident creating professional visualizations and dashboards
Descrierea cursului
Datele lipsă apar peste tot. Procesul de completare a valorilor lipsă se numește imputare, iar știința de a realiza corect această operațiune este o abilitate esențială pentru a obține predicții precise și a te diferenția. În acest curs, vei învăța să folosești vizualizări și teste statistice pentru a recunoaște tipare de date lipsă și cum să imputezi date folosind o gamă de modele statistice și de machine learning. Vei dobândi și abilități de decizie, care te vor ajuta să alegi metoda de imputare potrivită pentru fiecare situație. În final, vei învăța să incorporezi incertitudinea rezultată din imputare în inferențele și predicțiile tale, făcându-le mai robuste și mai fiabile.
Cerințe prealabile
Curriculum
Structura cursului
1
Problema datelor lipsă
În acest capitol, vei descoperi de ce datele lipsă pot reprezenta un risc atunci când analizezi un set de date. Vei fi introdus în cele trei mecanisme ale datelor lipsă și vei învăța cum să le recunoști folosind teste statistice și instrumente de vizualizare.
- Date lipsă: ce poate merge prost50 XP
- Regresie liniară cu date incomplete100 XP
- Analiza rezultatelor regresiei50 XP
- Compararea modelelor100 XP
- Mecanismele datelor lipsă50 XP
- Recunoașterea mecanismelor datelor lipsă100 XP
- Test t pentru MAR: pregătirea datelor100 XP
- Testul t pentru MAR: interpretare100 XP
- Vizualizarea tiparelor de date lipsă50 XP
- Graficul de agregare100 XP
- Spine plot100 XP
- Grafic mozaic100 XP
2
Imputarea bazată pe donatori
Descoperă taxonomia metodelor de imputare și învață trei tehnici bazate pe donatori: imputarea prin medie, hot-deck și k-Nearest-Neighbors. Vei înțelege cum funcționează aceste metode în detaliu, înainte de a le aplica pe un set de date meteo tropical din lumea reală. Pe parcurs, vei învăța și trucuri utile care te vor ajuta să le optimizezi pentru propriile probleme.
3
Imputarea bazată pe modele
Este momentul să înveți cum să folosești modele statistice și de machine learning – precum regresia liniară, regresia logistică și pădurile aleatoare – pentru a imputa date lipsă. În acest capitol, vei analiza modul în care modelele fac predicții și vei folosi aceste cunoștințe pentru a extrage valorile imputate din distribuții condiționale. Acest lucru este important deoarece asigură că imputările tale sunt mai variate și mai plauzibile, apropiindu-le de datele reale.
4
Incertitudinea din imputare
Valorile imputate nu sunt definitive. Ele sunt estimări, iar estimările implică un grad de incertitudine. În acest capitol final, vei descoperi cum bootstrapping-ul și ecuațiile înlănțuite din pachetul mice pot fi folosite pentru a incorpora incertitudinea imputării în modele și analize, făcându-le mai fiabile și mai robuste.
R
Gestionarea datelor lipsă prin imputare în R
Curs
finalizat

