Accéder au contenu principal

[Infographic] Checklist de nettoyage des données

Le nettoyage des données représente 80 % du flux de travail en data science. Utilisez cette checklist pour identifier et résoudre les problèmes de qualité de vos données
Actualisé 18 sept. 2026  · 5 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Le nettoyage des données représente 80 % du flux de travail en data science. C’est pourquoi nous avons créé cette checklist pour vous aider à identifier et résoudre les problèmes de qualité de vos données. Pour aller plus loin sur le sujet, découvrez nos cours Cleaning Data in Python et R.

data cleaning checklist

Pour télécharger cette infographie, cliquez sur l’image ci-dessus

Problèmes de contraintes sur les données

1. Contraintes de type de données

  • De quoi s’agit-il : vérifier que chaque colonne a le type de données approprié avant de commencer l’analyse.
  • Exemple : une colonne revenue_usd au format chaîne de caractères au lieu d’un type numérique.
  • Pistes de solution : convertir au type de données correct

2. Contraintes de plage de valeurs

  • De quoi s’agit-il : s’assurer que les colonnes respectent une plage de valeurs cohérente, en particulier pour celles soumises à des limites.
  • Exemple : une colonne gpa qui devrait être contrainte à [0.0, 4.0]
  • Pistes de solution :
    • Vérifier les fautes de frappe, par exemple une virgule décimale mal placée.
    • Supprimer les lignes dont les valeurs sortent de la plage autorisée
    • Ramener la valeur hors plage au minimum ou au maximum
    • Traiter la valeur hors plage comme manquante, puis l’imputer

3. Contraintes d’unicité

  • De quoi s’agit-il : s’assurer qu’il n’existe pas de doublons exacts ou quasi exacts parmi les lignes.
  • Exemple : une ligne en double où les colonnes name et phone_number sont identiques, mais pas height_cm
  • Pistes de solution :
    • Conserver une seule des lignes en double exactes
    • Fusionner les lignes présentant des doublons non exacts

Problèmes sur les textes et les données catégorielles

1. Contraintes d’appartenance pour les données catégorielles

  • De quoi s’agit-il : garantir que les colonnes catégorielles utilisent des catégories correctes et homogènes
  • Exemple : deux saisies différentes pour « New York » dans la colonne city
  • Pistes de solution :
    • Supprimer les lignes affectées par des catégories incohérentes
    • Remapper les catégories incohérentes vers l’intitulé correct
    • Déduire la catégorie à partir d’autres variables lorsque le remapping n’est pas évident

2. Violation de longueur pour les données textuelles

  • De quoi s’agit-il : vérifier que les colonnes textuelles soumises à une norme ont une longueur de chaîne uniforme
  • Exemple : une colonne US phone_number avec 9 caractères au lieu de 14
  • Pistes de solution :
    • Supprimer les lignes affectées par une violation de longueur
    • Marquer les observations concernées comme manquantes

3. Formatage incohérent des données textuelles

  • De quoi s’agit-il : garantir un formatage homogène des champs textuels selon les standards définis (majuscules/minuscules, espaces, ponctuation, etc.)
  • Exemple : une colonne phone_number mêlant les formats « (555) 123-4567 » et « 555-123-4567 »
  • Pistes de solution :
    • Normaliser les formats de texte selon une convention unique
    • Supprimer ou marquer comme manquantes les lignes impossibles à normaliser

Problèmes d’uniformité des données

1. Uniformité des unités pour les colonnes numériques

  • De quoi s’agit-il : vérifier que les colonnes numériques partagent les mêmes unités (par exemple, température en Celsius ou en Fahrenheit sur l’ensemble des observations). Point crucial lors de la jointure de jeux de données provenant de pays ou de sources différentes.
  • Exemple : une colonne de température en Celsius contenant des valeurs anormalement élevées ou basses
  • Pistes de solution :
    • Supprimer les lignes sans contexte d’unité et ne passant pas le contrôle de cohérence
    • Standardiser les unités lorsque c’est possible

2. Uniformité des formats pour les colonnes de dates

  • De quoi s’agit-il : s’assurer que les colonnes de dates utilisent le même format de datetime
  • Exemple : une colonne birthday contenant des dates en dd-mm-yyyy et en mm-dd-yyyy
  • Pistes de solution :
    • Standardiser les formats de date et d’heure lorsque c’est possible
    • Supprimer les lignes sans contexte de format et ne passant pas le contrôle de cohérence

3. Validation croisée pour les colonnes numériques

  • De quoi s’agit-il : la validation croisée consiste à utiliser plusieurs champs d’un jeu de données pour vérifier la validité d’un autre, par exemple en s’assurant que des sous-totaux s’additionnent au total attendu.
  • Exemple : les réservations de vol par classe somment au total des réservations enregistrées
  • Pistes de solution :
    • Supprimer les lignes qui échouent aux contrôles de cohérence
    • Appliquer des règles issues de la connaissance métier et du contexte des données

4. Validation croisée pour les colonnes de dates

  • De quoi s’agit-il : vérifier que les champs de dates et temporels passent les contrôles de cohérence (par exemple, les dates d’inscription à un webinar précèdent toujours les dates de participation)
  • Exemple : une colonne date_of_birth qui ne correspond pas à la colonne age
  • Pistes de solution :
    • Supprimer les lignes qui échouent aux contrôles de cohérence
    • Appliquer des règles issues de la connaissance métier et du contexte des données

Problèmes de données manquantes

1. Données manquantes complètement aléatoires (MCAR)

  • De quoi s’agit-il : absence de relation systématique entre les valeurs manquantes et les autres valeurs du jeu de données
  • Exemple : aucune relation observable entre les données manquantes et le reste des valeurs du jeu de données
  • Pistes de solution :
    • Supprimer les lignes manquantes
    • Imputer les valeurs manquantes avec des mesures de centralité comme la médiane ou la moyenne
    • Imputer les valeurs manquantes avec des approches algorithmiques basées sur l’apprentissage automatique
    • Collecter de nouveaux points de données et variables

2. Données manquantes aléatoires conditionnelles (MAR)

  • De quoi s’agit-il : relation systématique entre les données manquantes et d’autres valeurs observées
  • Exemple : données de recensement manquantes pour une région spécifique, car le service postal n’y assure pas une couverture complète
  • Pistes de solution :
    • Supprimer les lignes manquantes
    • Imputer les valeurs manquantes avec des mesures de centralité comme la médiane ou la moyenne
    • Imputer les valeurs manquantes avec des approches algorithmiques basées sur l’apprentissage automatique
    • Collecter de nouveaux points de données et variables

3. Données manquantes non aléatoires (MNAR)

  • De quoi s’agit-il : relation systématique entre les données manquantes et d’autres valeurs non observées
  • Exemple : relevés de température manquants parce que la température était trop basse ou trop élevée
  • Pistes de solution :
    • Supprimer les lignes manquantes
    • Imputer les valeurs manquantes avec des mesures de centralité comme la médiane ou la moyenne
    • Imputer les valeurs manquantes avec des approches algorithmiques basées sur l’apprentissage automatique
    • Collecter de nouveaux points de données et variables
Sujets
Science des données
Analyse des données

En savoir plus sur le nettoyage des données

Cours

Nettoyer des données en Python

4 h
160.3K
Apprenez à diagnostiquer et nettoyer les données sales pour transformer vos données brutes en insights précis et fiables !
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow