Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Les données manquantes sont partout. Le fait de remplacer les valeurs manquantes s’appelle l’imputation, et savoir le faire correctement est indispensable si vous voulez produire des prédictions fiables et vous démarquer. Dans ce cours, vous apprendrez à utiliser des visualisations et des tests statistiques pour identifier les schémas de données manquantes, ainsi qu’à imputer des données à l’aide d’un ensemble de modèles statistiques et de Machine Learning. Vous développerez aussi vos compétences d’aide à la décision, afin de choisir la méthode d’imputation la plus adaptée à chaque situation. Enfin, vous apprendrez à intégrer l’incertitude liée à l’imputation dans vos inférences et vos prédictions pour les rendre plus robustes et plus fiables.
Prérequis
Programme de formation
Plan du cours
1
Le problème des données manquantes
Dans ce chapitre, vous découvrirez pourquoi les données manquantes peuvent poser un risque lors de l’analyse d’un jeu de données. Vous serez présenté aux trois mécanismes de données manquantes et apprendrez à les reconnaître à l’aide de tests statistiques et d’outils de visualisation.
- Données manquantes : ce qui peut mal se passer50 XP
- Régression linéaire avec des données incomplètes100 XP
- Analyser la sortie d’une régression50 XP
- Comparer des modèles100 XP
- Mécanismes des données manquantes50 XP
- Reconnaître les mécanismes des données manquantes100 XP
- Test t pour MAR : préparation des données100 XP
- t-test pour MAR : interprétation100 XP
- Visualiser les motifs de données manquantes50 XP
- Graphique d’agrégation100 XP
- Diagramme en épine (spine plot)100 XP
- Graphique en mosaïque100 XP
2
Imputation par donneur
Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.
3
Imputation par modèle
Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.
4
Incertitude liée à l’imputation
Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.
R
Gérer les données manquantes avec des imputations en R
Cours
terminé

