Cours
Dans le cadre du Mois de la culture des données, cette série clarifie des notions clés du monde de la donnée, répond aux questions que vous n'osez peut-être pas poser et le fait avec légèreté. Pour commencer depuis le début, lisez notre premier article : Qu'est-ce qu'un jeu de données ?

Vous avez déjà entendu l'expression « corrélation n'implique pas causalité » ? C'est un piège classique qui fait trébucher aussi bien les passionnés de données que les professionnels. Dans cet article, nous allons explorer les différences essentielles entre corrélation et causalité, démonter quelques idées reçues et partager des exemples concrets pour vous aider à éviter l'une des plus grandes erreurs d'interprétation des données.
Qu'est-ce que la corrélation ?
La corrélation mesure la relation entre deux éléments. Autrement dit, lorsque l'un augmente, l'autre augmente-t-il ou diminue-t-il ? Le nuage de points ci-dessous présente des données issues de l'American Community Survey 2017. Sur l'axe des abscisses, vous voyez le revenu annuel moyen de chacun des cinquante États américains, et sur l'axe des ordonnées, le loyer mensuel moyen dans ces États. À mesure que les revenus augmentent, les loyers augmentent également.

Revenu annuel comparé au loyer mensuel moyen (en USD)
Si une variable augmente quand l'autre augmente — comme ici — on dit qu'elles sont positivement corrélées. On parle de corrélation négative si l'une diminue quand l'autre augmente.
En statistique et en science des données, la corrélation est une notion plus précise, qui renvoie à l'intensité d'une relation linéaire entre deux variables. Dans la variante du nuage de points ci-dessous, une droite a été ajustée sur les données. Elle suit assez bien les points, ce qui indique une relation linéaire entre revenu et loyer.

Une droite ajustée entre les deux variables, indiquant une relation positive entre elles
À l'inverse, dans l'exemple ci-dessous, avec le jeu de données classique diamonds, si l'on trace le prix d'un diamant en fonction de son poids en carats et que l'on dessine une courbe d'ajustement, on observe qu'elle se courbe vers le haut. Autrement dit, le prix augmente plus vite que linéairement.

La corrélation saisira la relation positive entre les deux variables — à mesure que le poids augmente, le prix augmente — mais pas l'aspect non linéaire de cette relation.
Qu'est-ce que la causalité ?
La causalité est une affirmation plus forte que la corrélation. Elle signifie que des changements d'une variable entraînent des changements d'une autre. On voit souvent des exemples de causalité dans les recommandations médicales, par exemple « le tabagisme provoque le cancer » ou « prendre de l'ibuprofène réduit la douleur ».
Vous pouvez aussi observer de nombreux exemples de causalité au quotidien. Manger sainement favorise de meilleurs résultats en matière de santé, faire du sport permet d'être en meilleure forme, et étudier sur DataCamp vous permet d'en savoir plus sur les données.
Le sophisme corrélation/causalité
Le sophisme corrélation/causalité survient lorsque l'on suppose un lien de cause à effet à partir d'une simple corrélation. Dans l'exemple revenu/loyer, les données montrent que les loyers sont positivement corrélés aux revenus. Toutefois, l'économie est complexe et ces données ne suffisent pas à affirmer de façon péremptoire qu'une hausse des revenus cause une hausse des loyers.
Ce sophisme est très répandu, notamment parce que tout le monde en marketing aimerait vous faire croire que l'achat de leur produit améliore votre vie, sans prendre le temps de mener une expérimentation scientifique rigoureuse pour le prouver. Cette idée a été poussée à l'extrême dans le tube pop des années 1990 de The Tamperer, If You Buy This Record (Your Life Will Be Better). Une corrélation peut apparaître dans trois grands cas, sans qu'il y ait causalité.
Coïncidence
Avec suffisamment de données, deux phénomènes totalement indépendants peuvent sembler corrélés. L'exemple ci-dessous est tiré de l'excellent site de Tyler Vigen, Spurious Correlations. La courbe montre que le taux de divorce dans l'État du Maine est fortement corrélé à la consommation de margarine par habitant.

Il serait absurde de penser que manger plus ou moins de margarine pourrait influencer le taux de divorce à l'échelle d'un État ; on ne peut donc pas parler de causalité. La corrélation observée est purement fortuite.
Même les investisseurs n'échappent pas à ce biais logique. Le Super Bowl Indicator suggère que le marché boursier grimpera si une équipe de la National Football Conference remporte le Super Bowl, et baissera si c'est une équipe de l'American Football Conference.
Variable de confusion
Des corrélations peuvent apparaître lorsqu'un troisième facteur (une « variable de confusion ») influence à la fois la cause supposée et l'effet supposé.
Un exemple classique : les coups de soleil sont corrélés aux ventes de glaces. Il serait absurde d'affirmer que manger des glaces provoque des coups de soleil. L'explication la plus raisonnable est que par temps chaud et ensoleillé, on mange plus de glaces et l'on s'expose davantage au soleil. La météo est donc la variable de confusion.
En 2001, un article scientifique a observé que les personnes qui consomment beaucoup de légumes et d'huile d'olive ont la peau moins ridée. Constat valable, mais Ben Goldacre a noté dans un TED Talk que des nutritionnistes se sont emparés de ce résultat pour affirmer que manger de l'huile d'olive réduit les rides. Cela ignore l'effet de nombreux facteurs de confusion. L'huile d'olive étant plus chère que d'autres huiles, si vous pouvez vous la permettre, vous avez davantage de chances d'occuper un emploi en intérieur avec moins d'exposition au soleil et d'être moins fumeur. Sans parler des centaines d'autres différences de mode de vie non prises en compte dans l'étude.
Causalité inverse
La causalité inverse se produit lorsque l'on se trompe sur le sens de l'effet. Exemple volontairement absurde : lorsque les éoliennes tournent plus vite, on détecte aussi des vents plus rapides, et l'on conclut que le vent est causé par les éoliennes. En y réfléchissant, on comprend bien que c'est l'inverse : le vent fait tourner les éoliennes.
Déterminer le sens de la causalité est un problème courant en analyse de données médicales. Par exemple, il existe une corrélation positive entre la dépression et la consommation de cannabis : les personnes déprimées sont plus susceptibles de fumer du cannabis. Cet article scientifique a ainsi constaté qu'en 2016, les personnes dépressives avaient 216 % de chances en plus de fumer du cannabis presque quotidiennement que les personnes non dépressives.
Le débat est vif sur le sens de la causalité : fumer du cannabis provoque-t-il la dépression, ou la dépression augmente-t-elle la probabilité de consommer du cannabis ? Cet article scientifique suggère que la causalité peut aller dans les deux sens. Certaines données indiquent que l'usage du cannabis peut favoriser l'apparition de la dépression ; toutefois, de solides éléments pointent vers l'association inverse, à savoir que la dépression peut conduire à l'initiation ou à l'augmentation de la fréquence de consommation.
Que faut-il pour établir une causalité ?
Établir une causalité est plus délicat qu'il n'y paraît. Pour y parvenir, quatre conditions sont nécessaires.
- Corrélation : même si la corrélation n'implique pas la causalité, elle est une condition nécessaire. Sans corrélation, pas de relation causale.
- Relation temporelle : la cause doit précéder l'effet que vous pensez observer.
- Mécanisme : il doit exister une explication crédible sur la manière dont la première variable entraîne la seconde.
- Contrôle des variables de confusion : l'effet des variables de confusion potentielles doit être maîtrisé via une conception expérimentale rigoureuse, une collecte de données adaptée et des méthodes statistiques appropriées.
Études observationnelles et expérimentales
Pour explorer les relations entre variables, on distingue deux types d'études.
- Les études observationnelles collectent des données sans influer sur la façon dont elles sont produites. L'étude sur l'huile d'olive mentionnée plus haut en est un exemple : elle a enregistré les régimes alimentaires, sans imposer à certains de cuisiner à l'huile d'olive et à d'autres non.
- Les expériences attribuent aléatoirement des « traitements » à des individus. C'est courant en évaluation de médicaments, où certains reçoivent le traitement et d'autres un placebo.
Les études observationnelles rendent en général la causalité très difficile, voire impossible, à établir. À l'inverse, des expériences bien conçues et conduites permettent de déterminer la causalité. Pour en savoir plus, consultez notre prochain article de Data Demystified sur l'A/B testing.
Envie d'aller plus loin ?
En résumé, le sophisme corrélation/causalité est largement documenté et constitue l'un des principaux pièges au début d'une montée en compétences en données. À retenir :
- La corrélation mesure la relation entre deux variables.
- Vous ne pouvez pas toujours en déduire une relation causale.
- Pour établir une causalité, il faut mener une expérimentation.
Pour passer au niveau supérieur, suivez Introduction to Statistics et lancez votre parcours de culture des données. Le prochain article de la série Data Demystified approfondit l'expérimentation, avec un focus sur la pratique de l'A/B testing. En attendant, découvrez ces ressources :
Corrélation vs causalité : foire aux questions
Peut-on avoir une causalité sans corrélation ?
Non, il ne peut pas y avoir de causalité sans corrélation. Pour qu'une variable en cause une autre, il doit exister une relation entre elles. La corrélation est une condition nécessaire à la causalité, mais elle n'est pas suffisante en soi. En l'absence de corrélation, il est hautement improbable que l'une cause l'autre.
Comment distinguer corrélation et causalité dans mes données ?
Pour distinguer corrélation et causalité, il faut aller au-delà d'une simple analyse descriptive. Commencez par vérifier s'il existe une corrélation entre les variables. Puis examinez trois éléments clés : (1) une relation temporelle (la cause doit précéder l'effet), (2) un mécanisme plausible expliquant comment la cause produit l'effet et (3) le contrôle des variables de confusion via la conception expérimentale ou des méthodes statistiques avancées.
Quelles méthodes puis-je utiliser pour tester la causalité ?
La meilleure façon de tester la causalité est d'avoir recours à des expériences, comme les essais randomisés contrôlés (RCT), où les sujets sont répartis aléatoirement en groupes recevant des traitements différents. L'A/B testing est une autre méthode courante en contexte business. Vous pouvez aussi utiliser des techniques statistiques comme l'analyse de régression, les tests de causalité de Granger ou la modélisation par équations structurelles pour inférer une causalité à partir de données observationnelles, même si ces approches restent moins concluantes que des expériences bien conçues.
Est-il possible que deux choses soient corrélées sans relation directe ?
Oui, deux phénomènes peuvent être corrélés sans relation directe, en raison de variables de confusion. Un troisième facteur peut influencer les deux variables et donner l'illusion d'un lien direct. Par exemple, les ventes de glaces et les coups de soleil sont corrélés, mais la véritable cause commune est la chaleur, pas la consommation de glace.
Qu'est-ce qu'une corrélation fallacieuse ?
Une corrélation fallacieuse (ou « spurieuse ») se produit lorsque deux variables semblent liées alors qu'il n'existe en réalité aucune connexion logique entre elles. Ces corrélations sont souvent fortuites et peuvent induire en erreur si l'on n'y prend pas garde. Par exemple, le taux de divorce dans le Maine a été mis en relation avec la consommation de margarine par habitant, alors qu'il n'y a manifestement aucun lien significatif entre ces deux phénomènes.