Accéder au contenu principal

Cours

Gérer les données manquantes avec des imputations en R

Avancé4 h

Diagnostiquez, visualisez et traitez les data manquantes à l'aide de techniques d'imputation et de conseils pour améliorer vos résultats.

R4 h13 vidéos49 exercices4,200 XP6,237Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Les données manquantes sont partout. Le fait de remplacer les valeurs manquantes s’appelle l’imputation, et savoir le faire correctement est indispensable si vous voulez produire des prédictions fiables et vous démarquer. Dans ce cours, vous apprendrez à utiliser des visualisations et des tests statistiques pour identifier les schémas de données manquantes, ainsi qu’à imputer des données à l’aide d’un ensemble de modèles statistiques et de Machine Learning. Vous développerez aussi vos compétences d’aide à la décision, afin de choisir la méthode d’imputation la plus adaptée à chaque situation. Enfin, vous apprendrez à intégrer l’incertitude liée à l’imputation dans vos inférences et vos prédictions pour les rendre plus robustes et plus fiables.

Prérequis

Programme de formation

Plan du cours

1

Le problème des données manquantes

2

Imputation par donneur

Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.
Commencer le chapitre
3

Imputation par modèle

Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.
Commencer le chapitre
4

Incertitude liée à l’imputation

Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.
Commencer le chapitre
R

Gérer les données manquantes avec des imputations en R

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.