Cours
À mesure que la révolution des données continue de transformer notre monde, les entreprises comprennent qu’évoluer dans cette époque impose de maintenir une architecture des données solide et bien exécutée. Une architecture des données décrit la structure des actifs de données d’une organisation et cartographie la façon dont les données circulent en son sein. En somme, elle sert de plan directeur pour gérer les données, afin qu’elles soient administrées correctement et répondent aux besoins métiers. Mais que se passe-t-il lorsque l’on se heurte à de mauvaises données ?
Sans architecture des données bien définie, il est peu probable que les entreprises déverrouillent la pleine valeur de leurs données et elles risquent de gaspiller des ressources au passage. Elles peuvent aussi perdre du terrain face à des concurrents dotés de stratégies data plus mûres. Pour éviter ce scénario, l’un des points essentiels à intégrer pour les dirigeants est que les mauvaises données existent et qu’elles ont des conséquences.
Nous examinons ici ce que sont les mauvaises données, pourquoi la qualité des données est cruciale et quels en sont les signes révélateurs.
Donnez à votre équipe les moyens de maîtriser les données
Améliorez la maîtrise des données et les capacités de prise de décision de votre équipe avec DataCamp for Business. Accédez à divers cours, à des projets pratiques et à des informations centralisées pour les équipes de 2 personnes ou plus.

Qu’est-ce que de mauvaises données ?
Si l’on définit des données de bonne qualité comme étant « adaptées à l’usage », alors des données de mauvaise qualité ne le sont pas. Autrement dit, elles ne sont pas suffisamment bonnes pour soutenir les résultats auxquels on les destine.
Souvent, les données brutes peuvent être considérées comme de mauvaises données. Par exemple, des données extraites de réseaux sociaux comme Twitter sont non structurées et, en l’état, ne sont pas prêtes à être analysées ou utilisées à des fins pertinentes.
Cependant, les données brutes peuvent devenir de bonnes données via le nettoyage et le traitement des données, ce qui prend généralement du temps.
Pour faire simple, toute donnée dépourvue de structure et souffrant de problèmes de qualité tels que l’inexactitude, l’incomplétude, les incohérences et les doublons peut être considérée comme de mauvaises données.
Pourquoi la qualité des données compte
La qualité des données désigne l’état de points de données, qualitatifs ou quantitatifs : elle mesure leur condition au regard de facteurs comme la précision, l’exhaustivité, la cohérence, la fiabilité et la fraîcheur. Au-delà des données clients, cela inclut les données produits, d’entreprise, fournisseurs, et bien plus encore.
Garantir la bonne qualité de vos données est essentiel. Pour en tirer de la valeur, elles doivent être précises, utiles pour soutenir les résultats visés et suffisantes pour optimiser l’emploi des ressources disponibles.
Pourquoi une mauvaise qualité de données survient-elle ?
Trois grands types de problèmes de qualité impactent directement l’efficacité opérationnelle :
- Erreurs humaines. L’une des causes les plus fréquentes : elles apparaissent quand la saisie manque de standardisation ou lorsque des collaborateurs entrent manuellement des valeurs dans des feuilles de calcul. Ces situations augmentent le risque d’erreurs.
- Systèmes disparates. Les organisations stockent souvent des données dans plusieurs systèmes hétérogènes avec leurs propres règles. Constituer un jeu de données peut exiger d’intégrer plusieurs sources, au risque de générer des doublons, des champs manquants ou des libellés incohérents. Différents champs peuvent aussi avoir le même sens mais être nommés autrement selon le système.
- Données invalides. Le changement est constant et les entreprises évoluent. Il faut alors faire évoluer les données (modifier le niveau de détail, déprécier des champs, mettre à jour des attributs). Or les analystes ne découvrent parfois ces besoins qu’au moment d’utiliser les données.
Ces facteurs sont des causes majeures de mauvaises données et deviennent des goulets d’étranglement au moment de l’usage.
Vous pouvez apprendre à améliorer la qualité des données en Python dans ce tutoriel Data Cleaning de DataCamp.
Le coût de mauvaises données
Le coût de données de mauvaise qualité varie selon de nombreux facteurs. Dans certains cas, il s’accumule dans les processus en aval ou via des retards critiques. Dans le pire des cas, c’est l’échec complet du processus.
Voyons quelques coûts associés à de mauvaises données.
Des insights biaisés
Les enseignements tirés des données dépendent de leur qualité. Par exemple, des décideurs peuvent trancher sur la base d’insights tirés de plusieurs sources contenant des doublons. Cette redondance fausse les résultats et ne reflète pas la réalité, produisant des conclusions erronées.
Dépenses financières
Dans un article sur la construction d’un business case pour l’amélioration de la qualité des données, Gartner Research indiquait que « les organisations estiment que la mauvaise qualité des données est responsable en moyenne de 15 millions de dollars de pertes par an » et que « cela risque d’empirer à mesure que les environnements informationnels se complexifient — un défi pour les organisations de toutes tailles. »
Efficacité organisationnelle
Alors que de plus en plus d’entreprises placent les données au cœur de leur activité, de mauvaises données affectent directement l’ensemble de l’organisation. Par exemple, l’équipe commerciale peut cibler la mauvaise audience, ce qui aurait pu être évité avec des données de qualité.
Problèmes lors des migrations
Imaginez qu’une organisation migre d’une plateforme à une autre : la nouvelle peut avoir des règles de gouvernance et de standardisation différentes, provoquant des problèmes de migration. La plateforme peut également stocker les données dans un autre format, rendant le mapping précis plus complexe.
Un goulet d’étranglement général
Une mauvaise qualité de données peut rapidement créer de sérieux blocages dans une transformation numérique. Les problèmes doivent être corrigés, ce qui met le projet en pause. Répété plusieurs fois, cela pèse lourdement sur le rythme d’adoption et les ressources.
10 signes de mauvaises données
La qualité de l’entrée détermine celle de la sortie. Il est quasiment impossible de produire des rapports fiables avec des données incomplètes, incohérentes ou corrompues : garbage in, garbage out.
Dès lors, comment savoir si votre organisation souffre d’un problème de qualité des données ? Voici dix signes à surveiller (sans ordre particulier) :
#1 Des informations importantes manquent
Plusieurs causes peuvent expliquer des données manquantes : pannes d’équipement, fichiers perdus, saisies incomplètes, etc. Qu’il y ait quelques valeurs manquantes dans un jeu de données n’a rien d’exceptionnel, mais l’absence d’informations clés pose de vrais défis. Les trois principaux :
- La perte de puissance statistique, qui réduit la probabilité de détecter un effet réel.
- Un biais possible dans l’estimation des paramètres.
- Une représentativité amoindrie des échantillons.
Pour en savoir plus sur la gestion des données manquantes en Python, suivez notre cours en ligne.
#2 Trop d’efforts et de temps consacrés à des tâches mécanique
Si vous passez l’essentiel de votre temps sur des tâches manuelles, vous avez probablement de mauvaises données. Une stratégie de gestion des données inefficace (ou inexistante) peut vous amener à organiser manuellement des données provenant de sources variées, courir après des interlocuteurs pour combler des manques, puis saisir ces données dans des feuilles de calcul.
#3 Pas assez d’insights actionnables
Les insights actionnables sont des conclusions tirées des données qui peuvent se traduire directement en action ou en réponse. Ils doivent donc être pertinents, spécifiques et utiles pour le décideur.
Leur valeur tient à l’éclairage nouveau qu’ils apportent. Cela ne signifie pas qu’ils doivent nécessairement provenir d’un tout nouveau jeu de données. Si vos données ne font que confirmer ce que vous savez déjà avec certitude, elles n’apportent pas de valeur et manquent de pertinence.
#4 L’analyse des données est compliquée
La normalisation de vos données est nécessaire pour :
- Garantir que la table ne contient que des données liées à la clé primaire
- S’assurer que chaque champ contient un seul élément de donnée
- Supprimer les redondances
Sans données normalisées, l’analyse devient très difficile, chaque source apportant potentiellement ses formats, champs et libellés, différents d’une source à l’autre.
#5 Des opportunités manquées
Vous avez l’impression de ne pas tirer le meilleur parti de vos données ? Surtout si vous ne faites pas confiance à votre stratégie actuelle. Un signe clair de mauvaises données : votre exposition à des risques inutiles augmente, vous laissant vulnérable lors de changements soudains.
#6 Des insights qui arrivent trop tard
Vous devez avoir un accès immédiat à des données centralisées. Cela facilite et accélère la production de rapports, avec d’autres bénéfices : moins de redondance, donc moins d’erreurs et un accès à l’information simplifié.
Des données centralisées signifient que toute l’organisation travaille selon le même plan et les mêmes règles. L’objectif est d’éviter les écarts liés à l’usage de données et d’outils disparates.
#7 Trop d’erreurs dans les données
L’erreur est humaine. Attendre des données parfaites quand la saisie est manuelle est illusoire. Les données doivent être auditées. Cela permet aussi de déterminer si les erreurs proviennent du fournisseur de service ou de fautes humaines.
#8 Des décideurs en manque de confiance
Les données doivent inspirer la confiance. Disposer de données fiables est un prérequis pour des décisions basées sur les données. Lorsque les décideurs ne font pas confiance aux données, ils reviennent à leurs anciennes habitudes : décisions à l’instinct et approximations.
Pour en savoir plus sur l’importance de la prise de décision basée sur les données pour l’entreprise, suivez notre cours en ligne.
#9 Manque de visibilité sur les métriques clés
Quand les indicateurs clés de performance (KPI) ne sont pas disponibles en temps réel, il devient difficile d’identifier les actions à plus fort impact.
#10 Une expérience client désarticuléE
Un signe clair (et potentiellement coûteux) de mauvaises données : des clients reçoivent des contenus déconnectés de leur parcours d’achat. Aujourd’hui, les consommateurs n’« veulent » plus une expérience personnalisée ; ils s’y attendent. Si l’expérience n’est pas personnalisée sur tous les points de contact, elle paraît désunie.
Si vous reconnaissez plusieurs de ces symptômes dans votre organisation, il y a de quoi s’inquiéter : il y a probablement un problème de qualité des données. Découvrez-en plus sur la création de moteurs de recommandation en Python avec notre cours en ligne.
Comment gérer de mauvaises données
Vous l’aurez compris : toutes les données ne se valent pas. La meilleure façon de gérer de mauvaises données est de prévenir la mauvaise qualité à la source. Mais si vous êtes déjà confronté à des données dégradées, cette solution est difficile à imposer.
Les étapes suivantes vous aideront à gérer de mauvaises données si elles ont déjà été collectées :
Étape 1 : accepter la réalité
Vous avez de mauvaises données. Acceptez-le. Si vous ne reconnaissez pas le problème, vous aurez peu de chances de le corriger.
Étape 2 : mettre à jour vos mauvaises données
En vous appuyant sur les critères d’identification, nettoyez vos données – cela passera très probablement par la mise à jour d’enregistrements existants.
Étape 3 : instaurer un programme de qualité des données
Les programmes de qualité des données réduisent le risque d’erreurs et établissent des processus communs et fiables pour la production et l’usage des données.
Étape 4 : améliorer les techniques de collecte
Mettez en place de meilleures pratiques d’acquisition : évitez de demander des informations non nécessaires et précisez pourquoi vous collectez certaines données, comment vous allez les utiliser et ce que le client y gagne en les partageant.
Étape 5 : sensibiliser votre entourage
Pour mieux gérer les données, les employés doivent savoir les collecter, les manipuler, les archiver et les administrer.
La clé pour gérer de mauvaises données est d’agir à la source. Si vous avez déjà collecté des données de mauvaise qualité, commencez par l’admettre, puis nettoyez-les et mettez-les à jour. Une fois vos données assainies, réduisez le risque de rechute en instaurant un programme de qualité qui améliore les pratiques de gestion des données de votre organisation. Disposez-vous de compétences data suffisantes ? Apprenez à répondre à des questions concrètes avec les données grâce au parcours Data Skills for Business de DataCamp.
Obtenez une certification en maîtrise des données et décrochez le poste de vos rêves
Nos programmes de certification vous aident à vous démarquer et à prouver aux employeurs potentiels que vos compétences sont adaptées à l'emploi.

FAQ sur les mauvaises données
Qu’est-ce que la qualité des données ?
La qualité des données est une mesure de l’état des données fondée sur la précision, l’exhaustivité, la cohérence, la fiabilité et la mise à jour.
Quelles sont les causes fréquentes des problèmes de qualité des données ?
Les problèmes de qualité des données peuvent avoir de multiples causes, mais les trois principales qui impactent directement l’efficacité opérationnelle sont : 1) les erreurs humaines, 2) les systèmes disparates et 3) les données invalides.
Quelles sont les conséquences de mauvaises données ?
Une mauvaise qualité peut sérieusement nuire à votre entreprise, car elle crée un véritable goulet d’étranglement. Les coûts incluent des insights biaisés, des charges financières élevées, des problèmes de migration et une efficacité organisationnelle en berne.
Comment savoir si vos données sont mauvaises ?
Des signes d’alerte indiquant que vos données sont de mauvaise qualité incluent :
- La même question renvoie des réponses différentes
- Les insights arrivent trop tard / Des opportunités sont manquées
- Trop d’efforts et de temps sur des tâches mécaniques
- Plaintes clients sur la méconnaissance de leurs transactions passées
- Désaccords entre équipes sur la performance de l’organisation
- Échecs répétés de migrations de données dus à une mauvaise qualité
- Des chiffres de performance peu fiables malgré plusieurs data warehouses et data lakes
- Les employés ne font pas confiance au système et entretiennent leurs propres silos de données
- L’analyse des données est difficile
- Des informations importantes manquent