Cours
Supposons que vous souhaitiez savoir si rester plus longtemps à l'école augmente réellement vos revenus. Vous lancez une régression, obtenez un coefficient positif sur l'éducation et vous en réjouissez. Puis quelqu'un fait remarquer que les personnes plus intelligentes et plus motivées ont tendance à poursuivre davantage d'études et à gagner plus, indépendamment de la scolarité. Votre estimation capte autant l'aptitude que l'éducation. C'est l'endogénéité, l'une des façons les plus courantes dont les résultats de régression peuvent induire en erreur.
La distinction entre variables exogènes et endogènes est au cœur du problème. Si vous vous trompez, vos coefficients ne signifient pas ce que vous pensez. Si vous l'avez bien posée, vous pouvez commencer à formuler des affirmations causales crédibles. Cet article passe en revue les définitions, les différences clés, les principales sources d'endogénéité et les remèdes standards. Soyons honnêtes : c'est souvent la section « remèdes » qui reste vague ailleurs. J'ai essayé de ne pas tomber dans ce travers ici.
Que sont les variables exogènes et endogènes ?
Les mots viennent du grec : exo (extérieur) et endo (intérieur). Une variable exogène est déterminée en dehors du système modélisé. Elle influence les résultats mais n'est pas influencée par les autres variables du modèle. Une variable endogène est façonnée par le système lui‑même, c'est‑à‑dire qu'elle est liée aux autres variables de façon à créer des boucles de rétroaction ou des dépendances cachées.
En régression, la distinction a un sens statistique précis. Une variable est exogène si elle est non corrélée avec le terme d'erreur du modèle. Elle est endogène si elle est corrélée avec ce terme d'erreur, c'est‑à‑dire qu'il y a quelque chose dans le résidu qui influence aussi votre prédicteur.
Variables exogènes
Une variable exogène reste en dehors de la boucle de rétroaction. Pensez aux précipitations quotidiennes comme moteur de la production agricole : les décisions de semis de l'agriculteur n'influencent pas la météo. La pluie affecte le rendement, mais le rendement ne modifie pas la pluie. En termes de régression, cela se traduit par une corrélation nulle entre le prédicteur et le terme d'erreur, ce que les statisticiens écrivent Cov(X, ε) = 0. Cette condition de covariance nulle rend les estimations MCO non biaisées. Lorsqu'elle est vérifiée, le coefficient associé à X capture proprement la relation entre X et le résultat, sans contamination par des facteurs omis.
Variables endogènes
Une variable endogène est mêlée au terme d'erreur. Revenons à l'exemple de l'éducation : les revenus sont affectés par l'aptitude, la motivation, l'origine familiale et une foule d'autres éléments qui influencent aussi le nombre d'années d'études. Ces facteurs non observés atterrissent dans le terme d'erreur ε. Comme la scolarité est corrélée à ε, on a de l'endogénéité : Cov(X, ε) ≠ 0.
Le sens exact de « exogène » et « endogène » varie selon le cadre de modélisation. En équations structurelles, on classe selon que les variables sont des sorties du système ; en économétrie, l'accent est mis sur la relation avec le terme d'erreur. Les deux approches capturent la même idée de fond.
Variables exogènes vs endogènes : principales différences
Le tableau ci‑dessous résume le cœur du contraste. Les sections suivantes entrent dans les nuances.
|
Dimension |
Variable exogène |
Variable endogène |
|
Déterminée par |
Des facteurs extérieurs au modèle |
Des relations au sein du modèle ou du système |
|
Relation avec le terme d'erreur |
Non corrélée : Cov(X, ε) = 0 |
Corrélée : Cov(X, ε) ≠ 0 |
|
Relation avec les autres variables |
Influence les résultats ; n'est pas influencée par eux |
Peut à la fois influencer et être influencée par d'autres variables |
|
Implication pour les MCO |
Estimations non biaisées et convergentes |
Estimations biaisées et non convergentes |
|
Exemples |
Précipitations, assignation aléatoire d'un traitement, distance au campus |
Niveau d'éducation, prix dans un système offre‑demande, santé auto‑déclarée |
Exemples de variables exogènes et endogènes
Les définitions abstraites ont leurs limites. Voici trois situations où la distinction exogène/endogène fait une vraie différence.
Éducation et revenus
C'est l'exemple canonique, et pour de bonnes raisons. Vous voulez estimer l'effet causal d'une année d'étude supplémentaire sur les salaires. Le problème : les personnes ayant une plus grande aptitude tendent à faire plus d'études et à gagner davantage. L'aptitude n'est pas dans votre modèle. Elle est dans le terme d'erreur. L'éducation et le terme d'erreur sont donc corrélés, et votre coefficient sur la scolarité est gonflé par la prime d'aptitude qu'il absorbe subrepticement.
Traiter l'éducation comme exogène ici serait une erreur. Elle est endogène, en partie déterminée par les mêmes facteurs non observés que vous ne pouvez pas contrôler.
Prix et demande
Dans un marché standard offre‑demande, le prix et la quantité sont déterminés simultanément. Si vous régressiez la quantité demandée sur le prix, vous n'identifieriez pas la courbe de demande. Vous traceriez un équilibre qui se déplace au gré des chocs d'offre et de demande. Le prix n'est pas fixé indépendamment de la demande ; il y répond. Le prix est donc endogène lorsque la quantité est la variable expliquée, et inversement.
Ce problème de simultanéité explique pourquoi les économistes s'intéressaient aux expériences naturelles et aux variables instrumentales bien avant que ces méthodes ne deviennent à la mode ailleurs.
Météo et production agricole
La pluie est la variable exogène par excellence. La décision d'un agriculteur sur la quantité de blé à semer ne change pas les précipitations de demain. Les précipitations affectent la production, mais la production ne rétroagit pas sur la pluie. Cette influence à sens unique, combinée à l'hypothèse raisonnable que la météo est non corrélée avec des chocs de productivité propres à l'exploitation et non observés, en fait un prédicteur exogène plausible.
Ceci dit, aucune variable n'est intrinsèquement exogène ou endogène. La classification dépend du modèle et de ses hypothèses. Si vous modélisiez ensemble le climat régional de long terme et l'usage des terres agricoles, la « météo » pourrait ne plus paraître si indépendante.
Pourquoi l'endogénéité pose problème en régression
Le point technique est simple. Les MCO supposent que les variables explicatives sont non corrélées avec le terme d'erreur. Quand cette hypothèse échoue, l'estimateur capte une variation due à des facteurs omis plutôt qu'à la variable d'intérêt, produisant des estimations biaisées et non convergentes. Avec suffisamment de données, les MCO convergeraient vers une mauvaise valeur, non par erreur d'échantillonnage, mais parce qu'ils résolvent le mauvais problème.
Les dégâts d'interprétation s'accumulent vite. Un coefficient biaisé mène à des conclusions trompeuses, des prévisions erronées et de mauvaises politiques. Si vous surestimez le rendement salarial de l'éducation à cause d'une aptitude omise, vous pourriez surfinancer les programmes de scolarité par rapport, par exemple, aux interventions en petite enfance. Le problème statistique devient rapidement concret.
Formellement, la condition d'exogénéité exige E(ε | X) = 0, ou a minima Cov(X, ε) = 0. Quand elle échoue, l'estimateur MCO β̂ converge en probabilité vers β + (E[X′X])⁻¹E[X′ε] plutôt que vers β. Le terme supplémentaire est le biais, et il ne disparaît pas quand l'échantillon grandit.
Quelles sont les causes de l'endogénéité ?
Plusieurs mécanismes distincts existent, et savoir lequel est en jeu oriente la manière d'y répondre.
Biais de variable omise
C'est le coupable le plus fréquent. Lorsqu'une variable pertinente est laissée de côté, son effet est absorbé par le terme d'erreur. Si cette variable omise est aussi corrélée avec l'un de vos prédicteurs, vous avez de l'endogénéité. L'histoire éducation‑aptitude en est un cas classique : l'aptitude appartient à l'équation de salaire, mais on la mesure mal, elle reste donc dans ε. Comme l'aptitude est corrélée à l'éducation, le coefficient d'éducation absorbe une partie de la prime d'aptitude.
Simultanéité
La simultanéité survient lorsque deux variables se déterminent mutuellement : prix et quantité sur un marché concurrentiel, présence policière et criminalité, dépenses publicitaires et ventes. Chacune est cause et effet de l'autre, ce qui signifie qu'aucune ne peut être traitée comme exogène. Le signe distinctif de la simultanéité, c'est que vous auriez besoin d'un système d'équations pour décrire le processus générateur des données. Une régression à équation unique ne peut pas démêler qui cause quoi.
Erreur de mesure
Lorsqu'un prédicteur est mesuré avec erreur, il devient endogène même si la véritable variable sous‑jacente ne le serait pas. L'erreur de mesure se retrouve à la fois dans le prédicteur et dans le résidu, créant une corrélation entre eux. Exemple classique : le revenu auto‑déclaré. Les gens se trompent, arrondissent ou déclarent volontairement autre chose, et l'écart entre le revenu déclaré et réel se corrèle avec la variable que vous utilisez comme régresseur.
Sélection et autres sources
Le biais de sélection mérite d'être nommé à part. Si l'entrée dans votre échantillon dépend de la variable de résultat ou de facteurs corrélés à votre prédicteur, vous travaillez sur une tranche non aléatoire de la population. La version canonique est le modèle de sélection de Heckman : étudier les déterminants du salaire des personnes en emploi, alors que la décision de travailler est elle‑même corrélée au salaire potentiel.
D'autres sources existent (causalité inverse, panels dynamiques où les résultats retardés deviennent prédicteurs, effets de réseau), mais variables omises, simultanéité et erreur de mesure couvrent la plupart des cas.
Comment détecter l'endogénéité
Vous ne pouvez généralement pas détecter l'endogénéité via une matrice de corrélation ou un diagnostic standard. Le problème réside dans la relation entre votre prédicteur et le terme d'erreur, par définition non observé.
Ce qui aide vraiment, c'est la théorie et la connaissance du domaine. Avant toute régression, demandez‑vous : ce prédicteur est‑il déterminé par des facteurs qui affectent aussi mon résultat via des canaux que je n'ai pas contrôlés ? Tracer un diagramme causal peut aider. Les graphes acycliques orientés (DAG) clarifient quels chemins existent et quels facteurs de confusion doivent être bloqués.
Une approche formelle est le test de Durbin‑Wu‑Hausman, qui compare des estimations MCO à des estimations par variables instrumentales. Si les deux jeux de coefficients diffèrent significativement, c'est un indice que le prédicteur est endogène. Notez que la version classique suppose des erreurs homoscédastiques ; utilisez une variante robuste (comme la forme par régression de Wooldridge) si ce n'est pas le cas. Mais ce test ne fonctionne que si vous avez déjà un instrument valide, et en trouver un est souvent plus difficile que le test lui‑même. C'est une vérification utile, pas un substitut à une réflexion soignée sur le processus générateur des données.
Comment traiter l'endogénéité
Aucune méthode unique ne traite tous les types. Le bon choix dépend de la cause de l'endogénéité.
Variables instrumentales
L'idée centrale : trouver une variable (l'instrument) qui affecte votre prédicteur endogène mais n'a aucun effet direct sur le résultat en dehors de ce prédicteur. Un instrument valide satisfait deux conditions : pertinence (il est corrélé avec la variable endogène) et restriction d'exclusion (il n'a pas sa place directement dans l'équation de résultat).
Dans l'exemple de l'éducation, la distance entre le domicile et l'université la plus proche a été proposée comme instrument de la scolarité. Les personnes ayant grandi loin d'un campus ont fait moins d'études, non parce qu'elles étaient moins capables, mais parce que le coût d'y assister était plus élevé. Si la distance n'affecte pas les salaires autrement que via la scolarité, c'est un instrument valide. Cette seconde condition n'est jamais vérifiable avec les seules données, d'où l'exigence, en VI, d'un argument défendable, pas seulement d'un premier étage significatif.
Moindres carrés en deux étapes
Les moindres carrés en deux étapes (2SLS) opérationnalisent l'estimation par VI. Au premier stade, vous régressez le prédicteur endogène sur l'instrument et les contrôles exogènes. Au second, vous remplacez la variable endogène par ses valeurs prédites du premier stade et régressiez le résultat sur celles‑ci. Les valeurs prédites ne contiennent que la variation du prédicteur issue de l'instrument (variation non corrélée avec le terme d'erreur de l'équation de résultat), ce qui explique pourquoi 2SLS récupère une estimation causale plus propre. En pratique, n'exécutez pas manuellement les deux étapes comme des MCO séparés. Les erreurs standards du second stade seraient erronées car elles ignorent l'incertitude d'estimation du premier. Utilisez plutôt un estimateur VI dédié (ivreg dans le package AER de R, ou IV2SLS dans linearmodels en Python).
Effets fixes
Lorsque l'endogénéité provient de caractéristiques individuelles non observées et stables dans le temps (aptitude, culture d'entreprise, qualité du quartier), les effets fixes sur données de panel peuvent aider. Inclure une muette au niveau de l'unité (ou, de façon équivalente, recentrer au sein des unités) élimine toutes les variables omises invariantes dans le temps au niveau de l'unité. Les effets fixes ne traitent pas les confondeurs variant dans le temps, l'erreur de mesure ou la simultanéité, mais pour les inobservables stables, c'est souvent la solution la plus propre.
Plans expérimentaux et quasi expérimentaux
La façon la plus nette d'obtenir de la variation exogène, c'est la randomisation. Dans un essai contrôlé randomisé, l'assignation au traitement est indépendante de tout le reste par conception. Quand la randomisation n'est pas possible, les expériences naturelles (situations où un événement externe randomise de fait l'exposition) peuvent offrir une crédibilité similaire. Les dispositifs de régression sur discontinuité et différences‑en‑différences sont deux cadres quasi expérimentaux courants fondés sur cette logique.
À garder en tête : aucune de ces méthodes ne résout tous les types d'endogénéité. Les VI exigent un instrument défendable. Les effets fixes n'aident pas pour la simultanéité. La randomisation est rarement disponible pour les questions qui comptent le plus.
Variables instrumentales : un exemple simple
Le cas éducation‑revenus rend la mécanique concrète. La variable endogène est le nombre d'années d'études, endogène car corrélée à l'aptitude non observée dans le terme d'erreur. Il nous faut un instrument : quelque chose qui prédit la scolarité d'une personne mais n'affecte les revenus qu'à travers la scolarité.
Card (1995) a proposé la proximité d'une université en quatre ans. Les personnes ayant grandi près d'un campus faisaient face à des coûts moindres et ont, en moyenne, fait plus d'études. Si vivre près d'une université n'affecte pas directement les salaires à l'âge adulte (en contrôlant d'autres facteurs liés au lieu), alors la proximité satisfait la restriction d'exclusion.
Premier stade : régresser les années d'études sur la proximité d'un campus plus des contrôles. Cela produit des valeurs ajustées de scolarité qui ne contiennent que la variation due à la proximité, pas à l'aptitude. Second stade : régresser le logarithme des salaires sur ces valeurs ajustées. Le coefficient sur la scolarité ajustée estime l'effet causal de la scolarité sur les salaires pour les personnes dont l'éducation a effectivement été influencée par la proximité, ce que les économètres appellent un effet moyen local du traitement (LATE).
L'instrument ne donne pas l'effet moyen pour tout le monde. Il fournit une estimation causale crédible pour les « respecteurs » de l'instrument, celles et ceux dont la scolarité a changé à cause de la proximité. C'est une vraie limite des VI, mais une limite assumée.
Variables exogènes et endogènes en inférence causale
Le cadrage en régression de l'exogénéité porte sur la corrélation avec un terme d'erreur. L'inférence causale traite d'un point un peu différent : savoir si une variable est une cause du résultat via un chemin que vous pouvez isoler. Dans le cadre des graphes acycliques orientés (DAG) associés aux travaux de Judea Pearl, les variables exogènes sont des nœuds sans parents dans le graphe. Les confondeurs sont des causes communes du traitement et du résultat, et ce sont précisément eux qui créent de l'endogénéité au sens de la régression.
Le lien entre ces cadres est réel mais pas toujours net. L'endogénéité économétrique correspond à peu près à la présence de chemins « backdoor » non bloqués dans un DAG. Contrôler un confondeur revient à bloquer un chemin backdoor. Les VI correspondent à la recherche d'une source exogène de variation du traitement.
À noter : dans les modèles graphiques, une variable peut être exogène dans un système et endogène dans un autre, exactement comme l'illustre l'exemple éducation‑revenus. La conclusion pratique est la même quel que soit le cadre : vous devez défendre vos hypothèses causales, pas seulement ajuster le modèle.
Variables exogènes vs endogènes en apprentissage automatique
En ML prédictif standard, l'endogénéité est largement hors sujet. Si votre objectif est de minimiser l'erreur de prédiction sur un jeu de validation, peu importe que vos variables explicatives soient exogènes. Un modèle utilisant des prédicteurs endogènes peut quand même bien généraliser. Le coefficient biaisé pose problème pour l'interprétation, pas pour la prévision.
La distinction devient importante lorsque vous interprétez les coefficients de façon causale ou utilisez le modèle pour guider des actions. Supposons qu'une entreprise entraîne un modèle de churn puis agit sur ses caractéristiques, en ciblant des clients selon le volume récent de tickets support. La question causale surgit : le volume de tickets cause‑t‑il le churn, ou est‑ce le symptôme du même mécontentement sous‑jacent qui alimente les deux ? Agir sur un prédicteur endogène comme s'il était causal peut mener à des interventions coûteuses ou contre‑productives.
Les méthodes d'IA causale (double machine learning, forêts causales, apprentissage de politiques) intègrent explicitement les exigences d'exogénéité que le ML standard ignore. Elles utilisent une variation de type instrument ou expérimentale pour estimer des effets robustes à l'endogénéité. Elles sont plus exigeantes en données et en hypothèses d'identification, mais ce sont les bons outils lorsque l'objectif est l'évaluation de politiques plutôt que la prédiction.
Idées reçues fréquentes
Voici quelques idées reçues auxquelles vous pourriez être confronté.
Les variables indépendantes sont toujours exogènes
« Variable indépendante » signifie simplement « prédicteur ». Cela ne dit rien de son exogénéité. Dans la régression des salaires, l'éducation est la variable indépendante et elle est endogène. Ces deux classifications décrivent des choses différentes.
Endogène signifie la même chose que variable dépendante
« Variable dépendante » désigne le résultat modélisé, le côté gauche de l'équation. « Variable endogène » décrit un prédicteur corrélé avec le terme d'erreur, sur le côté droit. Elles peuvent se recouvrir dans des systèmes d'équations simultanées, mais ce ne sont pas des synonymes.
Exogénéité signifie absence totale de lien avec les autres variables
L'exogénéité n'exige pas l'indépendance statistique d'avec vos autres régresseurs. Deux prédicteurs peuvent être corrélés entre eux et tous deux exogènes, tant qu'aucun n'est corrélé avec le terme d'erreur. L'exogénéité concerne spécifiquement la relation avec ε.
Les contrôles statistiques éliminent automatiquement l'endogénéité
Ajouter des contrôles aide lorsque l'endogénéité vient d'un facteur omis que vous pouvez observer et mesurer. Mais beaucoup de confondeurs (aptitude, motivation, réseaux sociaux) sont non observés. Ajouter des contrôles ne résout pas le problème si la variable omise essentielle n'est pas dans vos données.
Conclusion
Exogène et endogène décrivent l'origine d'une variable et sa relation au reste du modèle, pas simplement le côté de l'équation où elle apparaît. Un prédicteur est exogène lorsqu'il est déterminé en dehors du système et non corrélé avec le terme d'erreur. Il est endogène lorsqu'il est mêlé à des facteurs non observés qui influencent aussi le résultat.
La distinction est cruciale car l'endogénéité casse les MCO. Variables omises, simultanéité et erreur de mesure créent chacune une corrélation entre prédicteurs et terme d'erreur, poussant les estimations vers des valeurs qui ne représentent pas l'effet causal recherché. Y remédier suppose de comprendre pourquoi l'endogénéité est apparue, puis de choisir une méthode (instruments, effets fixes, dispositif quasi expérimental) adaptée à cette source. Il n'existe pas de remède universel, et les méthodes les plus proches exigent des hypothèses que l'on peut défendre mais jamais prouver entièrement.
Pour approfondir la mécanique de la régression derrière tout cela, notre cours Intermediate Regression in R couvre en détail les hypothèses, et notre cours Causal Inference with R prend le relais exactement là où s'arrête cet article, notamment variables instrumentales, différences‑en‑différences et régressions sur discontinuité.
Vinod Chugani a débuté sa carrière à Tokyo comme plus jeune responsable du desk ventes hedge funds de JPMorgan, puis a signé un record de ventes individuel chez Lehman Brothers, avant de développer une activité de distribution d’électronique présente dans 30 pays, dépassant les 100 millions SG$ de chiffre d’affaires, puis de se tourner vers la data. Diplômé en économie de Duke et ancien élève de la NYC Data Science Academy, il a fait partie des trois lauréats de bourse sur plus de 100 candidatures pour le cours Building AI Applications de Hugo Bowne-Anderson sur Maven. Aujourd’hui, il écrit pour DataCamp, KDnuggets, Machine Learning Mastery et Statology, sur des sujets allant des statistiques à l’IA agentique, et accompagne des professionnels de la data à la NYC Data Science Academy, avec plus de 1 000 séances individuelles à son actif.
FAQ
Quelle est la manière la plus simple de comprendre la différence entre variables exogènes et endogènes ?
Une variable exogène est déterminée en dehors du modèle et n'est pas corrélée au terme d'erreur (pensez aux précipitations qui affectent les rendements agricoles). Une variable endogène est façonnée par des facteurs internes au modèle, y compris des facteurs non observés. Dans une régression de salaire, l'éducation est endogène car l'aptitude influence à la fois les choix d'études et les revenus, et l'aptitude se retrouve aussi dans le terme d'erreur.
La même variable peut‑elle être exogène dans une étude et endogène dans une autre ?
Oui. L'exogénéité n'est pas une propriété intrinsèque de la variable ; elle dépend du modèle et des hypothèses. Le prix est exogène lorsqu'il est fixé par un régulateur externe, mais endogène sur un marché concurrentiel où l'offre et la demande le déterminent conjointement.
L'endogénéité ne concerne‑t‑elle que l'économie et l'économétrie ?
Non. C'est un enjeu partout où l'on estime des effets causals à partir de données observationnelles : épidémiologie, science politique, sociologie et apprentissage automatique appliqué. La terminologie varie selon les disciplines, mais les problèmes sous‑jacents (confusion, causalité inverse, erreur de mesure) sont universels.
Si je dispose d'un large jeu de données, le biais d'endogénéité disparaîtra‑t‑il ?
Non. L'erreur d'échantillonnage diminue avec la taille de l'échantillon, mais le biais d'endogénéité non. C'est un problème structurel, pas un problème de bruit. Avec des données infinies, les MCO convergeraient toujours vers une mauvaise valeur si l'endogénéité n'est pas traitée.
Quelle est la différence entre biais de variable omise et endogénéité ?
Le biais de variable omise est une cause d'endogénéité. Lorsqu'une variable pertinente est omise et qu'elle est corrélée avec un prédicteur, ce prédicteur devient endogène. L'endogénéité est le concept plus large ; le biais de variable omise est l'un des mécanismes spécifiques qui la produisent.
Comment savoir si mon instrument est valide ?
Vous devez vérifier deux conditions. La pertinence (l'instrument est corrélé à la variable endogène) est testable via la statistique F du premier stade, où F > 10 est un seuil usuel. La restriction d'exclusion (l'instrument affecte le résultat uniquement via la variable endogène) n'est pas testable avec les seules données. Elle requiert un argument théorique, et la solidité de cet argument sépare les études VI crédibles des autres.
