After doing these courses, I feel confident creating professional visualizations and dashboards
Descrizione del corso
I dati mancanti sono ovunque. Il processo di riempire i valori assenti si chiama imputazione, e saperlo fare correttamente è una competenza essenziale se vuoi ottenere previsioni accurate e distinguerti. In questo corso imparerai a usare visualizzazioni e test statistici per riconoscere gli schemi di dati mancanti e a imputare i dati utilizzando una serie di modelli statistici e di Machine Learning. Svilupperai anche capacità decisionali, utili per scegliere il metodo di imputazione più adatto in una determinata situazione. Infine, imparerai a incorporare l’incertezza derivante dall’imputazione nelle tue inferenze e previsioni, rendendole più robuste e affidabili.
Prerequisiti
Curriculum
Programma del corso
1
Il problema dei dati mancanti
In questo capitolo scoprirai perché i dati mancanti possono rappresentare un rischio quando analizzi un insieme di dati. Ti verranno presentati i tre meccanismi dei dati mancanti e imparerai a riconoscerli usando test statistici e strumenti di visualizzazione.
- Dati mancanti: cosa può andare storto50 XP
- Regressione lineare con dati incompleti100 XP
- Analizzare l'output della regressione50 XP
- Confrontare i modelli100 XP
- Meccanismi dei dati mancanti50 XP
- Riconoscere i meccanismi dei dati mancanti100 XP
- t-test per MAR: preparazione dei dati100 XP
- t-test per MAR: interpretazione100 XP
- Visualizzare i pattern dei dati mancanti50 XP
- Grafico di aggregazione100 XP
- Spine plot100 XP
- Grafico a mosaico100 XP
2
Imputazione basata su donatori
Conosci la tassonomia dei metodi di imputazione e impara tre tecniche basate su donatori: imputazione con media, hot-deck e k-Nearest-Neighbors. Guarderai sotto il cofano per vedere come funzionano questi metodi, per poi imparare ad applicarli a un insieme di dati meteorologici tropicali reali. Lungo il percorso, scoprirai anche trucchi utili per farli funzionare ancora meglio sui tuoi problemi.
3
Imputazione basata su modelli
È il momento di imparare a usare modelli statistici e di Machine Learning, come regressione lineare, regressione logistica e random forests, per imputare i dati mancanti. In questo capitolo analizzerai come i modelli producono le loro previsioni e userai questa conoscenza per estrarre i valori imputati da distribuzioni condizionali. Questo è importante perché garantisce imputazioni più varie e plausibili, rendendole più simili ai dati reali.
4
Incertezza dell’imputazione
I valori imputati non sono scolpiti nella pietra. Sono solo stime, e le stime comportano una certa incertezza. In questo capitolo finale scoprirai come il bootstrapping e le equazioni concatenate con il pacchetto mice possono essere usati per incorporare l’incertezza dell’imputazione nei tuoi modelli e nelle tue analisi, rendendoli più affidabili e robusti.
R
Gestione dei dati mancanti con imputazioni in R
Corso
completato

