Curso
Imagina que quieres saber si pasar más tiempo en la escuela realmente aumenta tus ingresos. Ejecutas una regresión, obtienes un coeficiente positivo para educación y te quedas tranquilo. Entonces alguien señala que las personas más inteligentes y motivadas tienden a estudiar más y a ganar más, con independencia de la escolarización. Tu estimación está captando tanto la habilidad como la educación. Eso es endogeneidad, y es una de las formas más comunes en que una regresión puede llevar a error.
La distinción entre variables exógenas y endógenas está en el centro del problema. Si la interpretas mal, tus coeficientes no significan lo que crees. Si la interpretas bien, puedes empezar a hacer afirmaciones causales creíbles. Este artículo repasa las definiciones, las diferencias clave, las principales fuentes de endogeneidad y los remedios estándar. Te lo adelanto: la sección de remedios es donde muchos tratamientos de este tema se quedan cortos. Aquí he intentado no hacerlo.
¿Qué son las variables exógenas y endógenas?
Las palabras vienen del griego: exo (fuera) y endo (dentro). Una variable exógena se determina fuera del sistema que estás modelando. Influye en los resultados, pero no está influida por las demás variables del modelo. Una variable endógena está moldeada por el propio sistema, es decir, está entrelazada con otras variables de forma que genera bucles de retroalimentación o dependencias ocultas.
En regresión, la distinción tiene un significado estadístico preciso. Una variable es exógena si no está correlacionada con el término de error del modelo. Es endógena si está correlacionada con ese término de error, lo que significa que hay algo en el residual que también impulsa tu predictor.
Variables exógenas
Una variable exógena queda fuera del bucle de retroalimentación. Piensa en la lluvia diaria como motor de la producción agrícola: las decisiones de siembra del agricultor no afectan al tiempo. La lluvia influye en el rendimiento, pero el rendimiento no cambia la lluvia. En términos de regresión, esto se traduce en correlación nula entre el predictor y el término de error, lo que los estadísticos escriben como Cov(X, ε) = 0. Esa covarianza cero es lo que hace que los estimadores MCO sean insesgados. Cuando se cumple, el coeficiente de X captura limpiamente la relación entre X y el resultado, sin contaminación por factores omitidos.
Variables endógenas
Una variable endógena está entrelazada con el término de error. Volvamos al ejemplo de educación: los ingresos dependen de la habilidad, la motivación, el entorno familiar y un sinfín de factores que también influyen en cuánta educación sigue alguien. Esos factores no observados van al término de error ε. Como la educación se correlaciona con ε, tenemos endogeneidad: Cov(X, ε) ≠ 0.
El significado exacto de "exógena" y "endógena" varía algo según el contexto de modelización. En modelos de ecuaciones estructurales, las variables se clasifican por si son salidas del sistema; en econometría, el énfasis recae en la relación con el término de error. Ambos enfoques capturan la misma idea de fondo.
Variables exógenas vs. endógenas: diferencias clave
La tabla siguiente resume el contraste principal. Más adelante entraremos en los matices.
|
Dimensión |
Variable exógena |
Variable endógena |
|
Determinada por |
Factores fuera del modelo |
Relaciones dentro del modelo o sistema |
|
Relación con el término de error |
No correlacionada: Cov(X, ε) = 0 |
Correlacionada: Cov(X, ε) ≠ 0 |
|
Relación con otras variables |
Influye en los resultados; no está influida por ellos |
Puede influir y ser influida por otras variables |
|
Implicación para MCO |
Estimaciones insesgadas y consistentes |
Estimaciones sesgadas e inconsistentes |
|
Ejemplos |
Precipitaciones, asignación aleatoria de tratamiento, distancia a la universidad |
Nivel educativo, precio en sistemas de oferta y demanda, salud autodeclarada |
Ejemplos de variables exógenas y endógenas
Las definiciones abstractas llegan hasta cierto punto. Aquí tienes tres escenarios donde la clasificación exógena/endógena aporta de verdad.
Educación e ingresos
Este es el ejemplo canónico y con razón. Quieres estimar el efecto causal de un año adicional de escolarización sobre los salarios. El problema: las personas con mayor habilidad tienden a estudiar más y a ganar más. La habilidad no está en tu modelo. Está en el término de error. La educación y el término de error están, por tanto, correlacionados, y tu coeficiente de escolarización se infla con la prima de habilidad que absorbe silenciosamente.
Tratar la educación como exógena aquí sería un error. Es endógena, determinada en parte por los mismos factores no observados que no puedes controlar.
Precio y demanda
En un mercado estándar de oferta y demanda, el precio y la cantidad se determinan simultáneamente. Si regresas la cantidad demandada sobre el precio, no estás identificando la curva de demanda. Estás siguiendo un equilibrio que varía con los shocks tanto de oferta como de demanda. El precio no se fija independientemente de la demanda; responde a ella. Así que el precio es endógeno cuando la cantidad es el resultado, y viceversa.
Este problema de simultaneidad explica por qué los economistas se interesaron por los experimentos naturales y las variables instrumentales mucho antes de que estos métodos se popularizaran en otros ámbitos.
Clima y producción agrícola
La lluvia es la variable exógena de libro. La decisión de un agricultor sobre cuánta trigo plantar no cambia la precipitación de mañana. La lluvia afecta a la producción, pero la producción no retroalimenta la lluvia. Esa influencia unidireccional, junto con el supuesto razonable de que el tiempo no está correlacionado con shocks no observados de productividad a nivel de explotación, la convierte en un predictor exógeno plausible.
Dicho esto, ninguna variable es intrínsecamente exógena o endógena. La clasificación depende del modelo y de sus supuestos. Si modelaras conjuntamente el clima regional a largo plazo y el uso agrícola del suelo, el "tiempo" quizá ya no parecería tan independiente.
Por qué la endogeneidad es un problema en regresión
El problema técnico es sencillo. MCO asume que las variables explicativas no están correlacionadas con el término de error. Cuando ese supuesto falla, el estimador recoge variación que pertenece a factores omitidos y no a la variable de interés, produciendo estimaciones sesgadas e inconsistentes. Con suficientes datos, MCO convergería al número equivocado, no por error muestral, sino porque está resolviendo el problema equivocado.
El daño interpretativo se multiplica rápido. Un coeficiente sesgado lleva a conclusiones erróneas, predicciones fallidas y malas políticas. Si sobreestimas el retorno salarial de la educación por no considerar la habilidad, quizá sobrefinancies programas educativos frente, por ejemplo, a intervenciones en la primera infancia. El problema estadístico se convierte pronto en uno práctico.
Formalmente, la condición de exogeneidad requiere E(ε | X) = 0, o como mínimo Cov(X, ε) = 0. Cuando esto falla, el estimador MCO β̂ converge en probabilidad a β + (E[X′X])⁻¹E[X′ε] en lugar de β. El término extra es el sesgo, y no desaparece al crecer la muestra.
¿Qué causa la endogeneidad?
Hay varios mecanismos distintos, y saber cuál tienes delante determina cómo abordarlo.
Sesgo por variables omitidas
Este es el culpable más habitual. Cuando se deja fuera del modelo una variable relevante, su efecto se absorbe en el término de error. Si esa variable omitida también se correlaciona con alguno de tus predictores, tienes endogeneidad. La historia educación-habilidad es el caso clásico: la habilidad pertenece a la ecuación de salarios, pero no la medimos bien, así que se queda en ε. Como la habilidad se correlaciona con la educación, el coeficiente de educación absorbe parte de esa prima de habilidad.
Simultaneidad
La simultaneidad surge cuando dos variables se determinan conjuntamente: precio y cantidad en un mercado competitivo, presencia policial y tasas de criminalidad, inversión publicitaria y ventas. Cada una es causa y efecto de la otra, por lo que ninguna puede tratarse como exógena. La seña de identidad de la simultaneidad es que necesitarías un sistema de ecuaciones para describir el proceso generador de datos. Una sola regresión no puede desenredar quién causa a quién.
Error de medida
Cuando un predictor se mide con error, se vuelve endógeno aunque la variable subyacente verdadera no lo fuera. El error de medida acaba tanto en el predictor como en el residual, creando correlación entre ambos. Ejemplo clásico: ingresos autodeclarados. La gente recuerda mal, redondea o informa deliberadamente otra cifra, y la brecha entre ingreso declarado y real termina correlacionada con la variable que usas como regresor.
Selección y otras fuentes
El sesgo de selección merece mención aparte. Si quién entra en tu muestra depende de la variable de resultado o de factores correlacionados con tu predictor, estás trabajando con un subconjunto no aleatorio de la población. La versión canónica es el modelo de selección de Heckman: estudiar los determinantes del salario para personas empleadas, cuando la decisión de trabajar está correlacionada con los salarios potenciales.
Existen otras fuentes (causalidad inversa, paneles dinámicos donde resultados rezagados pasan a ser predictores, efectos de red), pero las variables omitidas, la simultaneidad y el error de medida cubren la mayoría de los casos que verás.
Cómo detectar la endogeneidad
En general no puedes detectarla mirando una matriz de correlaciones ni con diagnósticos estándar. El problema está en la relación entre tu predictor y el término de error, que por definición es no observable.
Lo que de verdad ayuda es la teoría y el conocimiento del dominio. Antes de correr cualquier regresión, pregúntate: ¿este predictor está determinado por factores que también afectan a mi resultado por vías que no he controlado? Dibujar un diagrama causal puede ayudar. Los grafos acíclicos dirigidos (DAG) aclaran qué caminos existen y qué confundidores hay que bloquear.
Un enfoque formal es la prueba de Durbin-Wu-Hausman, que compara estimaciones MCO con estimaciones por variable instrumental. Si los dos conjuntos de coeficientes difieren significativamente, hay evidencia de que el predictor es endógeno. Ten en cuenta que la versión clásica asume homocedasticidad; usa una variante robusta (como la forma basada en regresión de Wooldridge) si dudas de ese supuesto. Pero esta prueba solo funciona si ya tienes un instrumento válido, y encontrarlo suele ser más difícil que la prueba en sí. Es una comprobación útil, no un sustituto de pensar con cuidado en el proceso generador de datos.
Cómo corregir la endogeneidad
No hay un método único que cubra todos los tipos. La elección adecuada depende de qué esté causando la endogeneidad.
Variables instrumentales
La idea central: encuentra una variable (el instrumento) que afecte a tu predictor endógeno pero que no tenga efecto directo en el resultado salvo a través de ese predictor. Un instrumento válido cumple dos condiciones: relevancia (está correlacionado con la variable endógena) y restricción de exclusión (no debe figurar directamente en la ecuación del resultado).
Para el ejemplo de educación, se ha propuesto la distancia desde el hogar a la universidad más cercana como instrumento de escolarización. Quienes crecieron lejos de una universidad estudiaron menos, no por menor habilidad, sino porque asistir era más costoso. Si la distancia no afecta a los salarios excepto a través de la educación, es un instrumento válido. Esa segunda condición nunca es verificable solo con datos, por lo que la estimación por VI requiere un argumento defendible, no solo un primer estadio significativo.
Mínimos cuadrados en dos etapas
Los mínimos cuadrados en dos etapas (2SLS) operacionalizan la VI. En la primera etapa, regresas el predictor endógeno sobre el instrumento y controles exógenos. En la segunda, reemplazas la variable endógena por sus valores predichos del primer estadio y ajustas la regresión del resultado sobre ellos. Los valores predichos contienen solo la variación del predictor que proviene del instrumento (variación no correlacionada con el error en la ecuación del resultado), por eso 2SLS recupera una estimación causal más limpia. En la práctica, no ejecutes las dos etapas manualmente como MCO separados. Los errores estándar de la segunda etapa serán incorrectos porque ignoran la incertidumbre de estimación del primer estadio. Usa mejor un estimador VI específico (ivreg en el paquete AER de R, o IV2SLS en linearmodels de Python).
Efectos fijos
Cuando la endogeneidad proviene de características no observadas a nivel individual que son estables en el tiempo (habilidad, cultura de empresa, calidad del barrio), los efectos fijos con datos de panel pueden ayudar. Incluir una dummy a nivel de unidad (o, de forma equivalente, centrar dentro de unidades) elimina todas las variables omitidas invariantes en el tiempo a ese nivel. Los efectos fijos no resuelven confundidores que varían en el tiempo, errores de medida ni simultaneidad, pero para inobservables estables suelen ser la solución más limpia.
Diseños experimentales y cuasi-experimentales
La forma más limpia de conseguir variación exógena es la aleatorización. En un ensayo controlado aleatorizado, la asignación de tratamiento es independiente de todo lo demás por diseño. Cuando no es posible aleatorizar, los experimentos naturales (situaciones en las que algún suceso externo aleatoriza de facto la exposición) pueden lograr una credibilidad similar. Los diseños de discontinuidad en la regresión y diferencias en diferencias son dos marcos cuasi-experimentales comunes basados en esta lógica.
Conviene recordarlo: ninguno de estos métodos resuelve todos los tipos de endogeneidad. VI requiere un instrumento defendible. Los efectos fijos no ayudan con la simultaneidad. La aleatorización rara vez está disponible para las preguntas que más importan.
Variables instrumentales: un ejemplo sencillo
El caso educación-ingresos hace concretas las mecánicas. La variable endógena son los años de escolarización, endógena porque se correlaciona con la habilidad no observada en el término de error. Necesitamos un instrumento: algo que prediga cuánta educación recibe alguien pero que afecte a los ingresos solo a través de la educación.
Card (1995) propuso la proximidad a una universidad de cuatro años. Quienes crecieron cerca de una universidad afrontaron menores costes de asistencia y estudiaron más de media. Si vivir cerca de una universidad no afecta directamente a los salarios en la edad adulta (controlando por otros factores de localización), entonces la proximidad satisface la restricción de exclusión.
Primer estadio: regresa años de escolarización sobre proximidad a universidad más controles. Esto produce valores ajustados de educación que contienen solo la variación impulsada por la proximidad, no por la habilidad. Segundo estadio: regresa el logaritmo del salario sobre esos valores ajustados. El coeficiente de la educación ajustada estima el efecto causal de la escolarización sobre los salarios para las personas cuya educación realmente estuvo influida por la proximidad, lo que los econometristas llaman efecto medio local del tratamiento (LATE).
El instrumento no te da el efecto medio para todo el mundo. Te ofrece una estimación causal creíble para los compliers, quienes cambiaron su escolarización por la proximidad. Es una limitación real de VI, pero honesta.
Variables exógenas y endógenas en inferencia causal
El enfoque de la regresión sobre exogeneidad trata de la correlación con un término de error. El enfoque de inferencia causal trata de algo ligeramente distinto: si una variable causa el resultado a través de una vía que puedes aislar. En el marco de grafos acíclicos dirigidos (DAG) asociado al trabajo de Judea Pearl, las variables exógenas son nodos sin padres en el grafo. Los confundidores son causas comunes tanto del tratamiento como del resultado, y son precisamente lo que genera endogeneidad en el sentido econométrico.
La conexión entre ambos marcos es real, pero no siempre limpia. La endogeneidad econométrica se corresponde, a grandes rasgos, con la presencia de caminos de fondo sin bloquear en un DAG. Controlar por un confundidor equivale a bloquear un camino de fondo. La estimación por VI equivale a encontrar una fuente exógena de variación en el tratamiento.
Conviene señalar algo: en los modelos gráficos, una variable puede ser exógena en un sistema y endógena en otro, justo lo que ilustraba el ejemplo de educación e ingresos. La consecuencia práctica es la misma en cualquier marco: tienes que argumentar tus supuestos causales, no solo ajustar el modelo.
Variables exógenas vs. endógenas en machine learning
En el ML predictivo estándar, la endogeneidad importa poco. Si tu objetivo es minimizar el error de predicción en datos de validación, da igual que tus variables sean exógenas. Un modelo con predictores endógenos puede generalizar bien. El coeficiente sesgado es un problema de interpretación, no de predicción.
La distinción empieza a importar cuando interpretas coeficientes de forma causal o usas el modelo para guiar intervenciones. Imagina que una empresa entrena un modelo de churn y actúa sobre sus variables, segmentando clientes según el volumen reciente de tickets de soporte. La pregunta causal aparece: ¿el volumen de tickets causa el churn, o es un síntoma de la misma insatisfacción subyacente que impulsa ambos? Actuar sobre un predictor endógeno como si fuera causa puede llevar a intervenciones ineficaces o contraproducentes.
Los métodos de ML causal (double machine learning, causal forests, policy learning) incorporan explícitamente los requisitos de exogeneidad que el ML estándar ignora. Usan variación tipo instrumento o experimental para estimar efectos robustos a la endogeneidad. Exigen más en términos de datos y supuestos de identificación, pero son la herramienta adecuada cuando el objetivo es evaluar políticas y no solo predecir.
Ideas erróneas comunes
Aquí tienes algunas ideas equivocadas que quizá te encuentres.
Las variables independientes siempre son exógenas
"Variable independiente" solo significa "predictor". No dice nada sobre si esa variable es exógena. En la regresión de salarios, la educación es la variable independiente y es endógena. Son clasificaciones distintas.
Endógeno significa lo mismo que variable dependiente
"Variable dependiente" es el resultado que modelas, el lado izquierdo. "Variable endógena" describe un predictor que está correlacionado con el término de error, en el lado derecho. Pueden solaparse en sistemas de ecuaciones simultáneas, pero no son sinónimos.
Exogeneidad significa estar completamente desvinculada de otras variables
La exogeneidad no exige independencia estadística respecto a otros regresores. Dos predictores pueden estar correlacionados entre sí y ambos ser exógenos, siempre que ninguno esté correlacionado con el término de error. La exogeneidad trata específicamente de la relación con ε.
Los controles estadísticos eliminan automáticamente la endogeneidad
Añadir controles ayuda cuando la endogeneidad proviene de un factor omitido que puedes observar y medir. Pero muchos confundidores (habilidad, motivación, redes sociales) no se observan. Incluir más controles no resuelve el problema si la variable omitida clave no está en tus datos.
Conclusión
Exógena y endógena describen de dónde viene una variable y cómo se relaciona con el resto del modelo, no simplemente en qué lado de la ecuación aparece. Un predictor es exógeno cuando se determina fuera del sistema y no está correlacionado con el término de error. Es endógeno cuando está enredado con factores no observados que también impulsan el resultado.
La distinción importa porque la endogeneidad rompe MCO. Las variables omitidas, la simultaneidad y el error de medida crean correlación entre predictores y el término de error, empujando las estimaciones hacia números que no representan el efecto causal que buscas. Corregirlo requiere entender por qué surge la endogeneidad y luego elegir el método (instrumentos, efectos fijos, diseño cuasi-experimental) adecuado para esa fuente. No hay una solución universal, y los métodos que más se acercan exigen supuestos que puedes defender, pero nunca probar del todo.
Si quieres profundizar en la mecánica de la regresión detrás de todo esto, nuestro curso Intermediate Regression in R cubre los supuestos en detalle, y nuestro curso Causal Inference with R retoma exactamente donde termina este artículo, incluyendo variables instrumentales, diferencias en diferencias y discontinuidad en la regresión.
Vinod Chugani comenzó su carrera en Tokio como el jefe más joven del equipo de ventas para hedge funds de JPMorgan y más tarde batió un récord individual de ventas en Lehman Brothers, para después crear un negocio de distribución de electrónica en 30 países que superó los 100 millones de SG$ en ingresos antes de dar el salto a los datos. Graduado en Economía por Duke y antiguo alumno de NYC Data Science Academy, fue uno de los tres becados entre más de 100 solicitantes para el curso Building AI Applications de Hugo Bowne-Anderson en Maven. Hoy escribe en DataCamp, KDnuggets, Machine Learning Mastery y Statology sobre temas que van desde estadística hasta IA agentiva, y mentoriza a profesionales de datos en NYC Data Science Academy con más de 1.000 sesiones uno a uno a sus espaldas.
FAQs
¿Cuál es la manera más simple de entender la diferencia entre variables exógenas y endógenas?
Una variable exógena se determina fuera del modelo y no se correlaciona con el término de error (piensa en la lluvia que afecta a los rendimientos de los cultivos). Una variable endógena está moldeada por factores dentro del modelo, incluidos los no observados. En una regresión salarial, la educación es endógena porque la habilidad impulsa tanto las elecciones educativas como los ingresos, y la habilidad también está en el término de error.
¿Puede la misma variable ser exógena en un estudio y endógena en otro?
Sí. La exogeneidad no es una propiedad de la variable en sí; depende del modelo y los supuestos concretos. El precio es exógeno cuando lo fija un regulador externo, pero endógeno en un mercado competitivo donde la oferta y la demanda lo determinan conjuntamente.
¿La endogeneidad solo importa en economía y econometría?
No. Es un problema en cualquier ámbito donde estimes efectos causales con datos observacionales: epidemiología, ciencia política, sociología y machine learning aplicado. La terminología varía por campo, pero los problemas subyacentes (confusión, causalidad inversa, error de medida) son universales.
Si tengo un dataset grande, ¿desaparecerá el sesgo por endogeneidad?
No. El error muestral se reduce al crecer la muestra, pero el sesgo por endogeneidad no. Es un problema estructural, no de ruido. Con datos infinitos, MCO seguiría convergiendo al número equivocado si no abordas la endogeneidad.
¿Cuál es la diferencia entre sesgo por variables omitidas y endogeneidad?
El sesgo por variables omitidas es una causa de la endogeneidad. Cuando una variable relevante se deja fuera y se correlaciona con un predictor, ese predictor se vuelve endógeno. La endogeneidad es el concepto más amplio; el sesgo por variables omitidas es un mecanismo concreto que la produce.
¿Cómo sé si mi instrumento es válido?
Debes comprobar dos condiciones. La relevancia (que el instrumento se correlacione con la variable endógena) es comprobable vía el estadístico F del primer estadio, donde F > 10 es un umbral orientativo común. La restricción de exclusión (que el instrumento afecte al resultado solo a través de la variable endógena) no es comprobable solo con datos. Requiere un argumento teórico, y la solidez de ese argumento es lo que separa los estudios VI creíbles de los cuestionables.
