Ir al contenido principal

Correlación vs. causalidad: entiende la diferencia en el análisis de datos

Aprende la diferencia clave entre correlación y causalidad en el análisis de datos. Descubre ejemplos reales y evita errores habituales al interpretar datos.
Actualizado 17 sept 2026  · 8 min leer

Explorar con IA

ChatGPTClaudePerplexity

Como parte del mes de la competencia en datos, esta serie aclara conceptos clave del mundo de los datos, responde a esas preguntas que quizá no te atreves a hacer y, de paso, nos divertimos. Si quieres empezar por el principio, lee la primera entrega de la serie: ¿Qué es un dataset?

Correlation vs. Causation

¿Has oído la frase «correlación no implica causalidad»? Es una trampa habitual que confunde tanto a entusiastas como a profesionales de los datos. En este artículo, veremos las diferencias clave entre correlación y causalidad, desmontaremos mitos y compartiremos ejemplos reales para ayudarte a evitar uno de los mayores errores al interpretar datos.

¿Qué es la correlación?

La correlación mide la relación entre dos cosas. Es decir, cuando una sube, ¿la otra sube o baja? El diagrama de dispersión de abajo muestra datos de la American Community Survey de 2017. En el eje x se ve el ingreso anual medio de cada uno de los cincuenta estados de EE. UU., y en el eje y, el alquiler mensual medio de esos estados. A medida que aumentan los ingresos, también lo hacen los pagos de alquiler.

Average Monthly Rent

Ingreso anual frente al alquiler mensual medio (en USD)

Si una cosa sube cuando la otra sube —como en este caso—, decimos que están positivamente correlacionadas. Si una baja cuando la otra sube, están negativamente correlacionadas.

En estadística y ciencia de datos, correlación es un término más preciso que se refiere a la fuerza de una relación lineal entre dos variables. En la variación del diagrama de dispersión de abajo, se ha ajustado una línea recta a los datos. La línea sigue bastante bien a los puntos, lo que indica una relación lineal entre ingresos y alquiler.

line between the two variables

Una línea ajustada entre las dos variables, que indica una relación positiva entre ambas

En cambio, en el siguiente ejemplo, usando el clásico dataset de diamonds, si representamos el precio de un diamante frente a su peso en quilates y trazamos una línea de mejor ajuste, verás que la línea se curva hacia arriba. Es decir, el precio aumenta más rápido que de forma lineal.

positive relationship between the two things

La correlación captará la relación positiva entre ambas cosas —a mayor peso, mayor precio—, pero no el carácter no lineal de esa relación.

¿Qué es la causalidad?

La causalidad es una afirmación más fuerte que la correlación. Significa que los cambios en una cosa hacen que otra cambie. Verás muchos ejemplos de causalidad en recomendaciones médicas: «fumar causa cáncer» o «tomar ibuprofeno reduce el dolor».

También hay muchos ejemplos de causalidad en el día a día. Comer sano mejora los resultados en tu estilo de vida, entrenar hace que estés en mejor forma y estudiar en DataCamp hace que sepas más sobre datos.

La falacia correlación-causalidad

La falacia correlación-causalidad ocurre cuando se asume una relación de causa-efecto únicamente a partir de una correlación. En el ejemplo de ingresos y alquiler, los datos mostraban que los pagos de alquiler están positivamente correlacionados con el nivel de ingresos. Sin embargo, la economía es compleja y esos datos no bastan para afirmar algo más contundente como que tener más ingresos causa alquileres más altos.

Esta falacia es muy común en casi cualquier sociedad, ya que todo el que trabaja en marketing quiere que creas que comprar su producto hará tu vida mejor, sin tomarse el tiempo de realizar un experimento científico riguroso que lo demuestre. Esta idea se llevó al extremo en el tema pop de los 90 de The Tamperer, If you Buy This Record (Your Life Will Be Better). Una correlación puede darse en tres casos principales, pero la causalidad no.

Relación coincidental

Con suficientes datos, dos cosas completamente independientes pueden mostrar correlación. El ejemplo siguiente está tomado del excelente sitio Spurious Correlations de Tyler Vigen. La gráfica de líneas muestra que la tasa de divorcios en el estado de Maine (EE. UU.) está muy correlacionada con el consumo de margarina per cápita.

divorce rate in the US state of Maine

Sería absurdo pensar que comer más o menos margarina puede influir en la tasa de divorcios a nivel estatal, así que no podemos hablar de causalidad. La correlación que se muestra aquí es puramente casual.

Ni siquiera los inversores se libran de esta falacia lógica. El indicador de la Super Bowl sugiere que el mercado bursátil subirá si un equipo de la National Football Conference gana el torneo, y que bajará si gana un equipo de la American Football Conference.

Variable de confusión

Las correlaciones pueden aparecer cuando una tercera cosa (una «variable de confusión») afecta tanto a la supuesta causa como al supuesto efecto.

Un ejemplo clásico es que las quemaduras solares están correlacionadas con las ventas de helado. Sería ridículo decir que comer helado causa más quemaduras solares. Una explicación más razonable es que, con tiempo caluroso y soleado, la gente es más propensa a comer helado y también a tomar el sol. Así que el tiempo es la variable de confusión.

En 2001 un artículo científico observó que quienes comen muchas verduras y aceite de oliva tienen menos arrugas en la piel. Es una observación válida, pero Ben Goldacre señaló en una charla TED que muchos nutricionistas se lanzaron a afirmar que comer aceite de oliva hace que tengas menos arrugas. Esto ignora el efecto de varios factores de confusión. El aceite de oliva es caro en comparación con otros aceites, por lo que, si puedes permitírtelo, es más probable que tengas un trabajo en interiores con menos exposición al sol y que fumes menos. Por no mencionar cientos de otras diferencias de estilo de vida que no se consideraron en el estudio.

Causalidad inversa

La causalidad inversa se da cuando se confunde qué cosa causa a cuál. Un ejemplo tonto: cuando los aerogeneradores giran más rápido, también se detecta mayor velocidad del viento, así que concluyes que el viento lo provocan los aerogeneradores al girar. Si lo piensas un momento, verás que la causalidad es justo al revés: el viento hace girar los aerogeneradores.

Entender la dirección de la causalidad es un problema común en el análisis de datos médicos. Por ejemplo, existe una correlación positiva entre depresión y consumo de cannabis. Es decir, las personas con depresión tienen más probabilidades de consumir cannabis. Por ejemplo, este artículo científico encontró que en 2016 las personas con depresión tenían un 216% más de probabilidades de fumar cannabis casi a diario que quienes no estaban deprimidos.

Se ha debatido mucho qué causa a qué. ¿Fumar cannabis causa depresión o tener depresión hace más probable el consumo de cannabis? Este artículo científico sugiere que puede haber causalidad en ambas direcciones. También hay indicios de que el uso de cannabis puede conducir al inicio de la depresión; sin embargo, hay evidencias sólidas que apuntan a la asociación inversa, es decir, que la depresión puede llevar al inicio o al aumento de la frecuencia de consumo de cannabis.

¿Qué necesitas para establecer causalidad?

Determinar la causalidad puede ser más complicado de lo que parece. Para establecerla, necesitas cuatro cosas.

  1. Correlación: aunque una correlación entre dos cosas no garantiza causalidad, sí es una condición necesaria. Si no hay correlación, no hay relación causal.
  2. Relación temporal: aquello que atribuyes como causa de lo que analizas debe ocurrir antes de lo que consideras el efecto.
  3. Mecanismo: debe existir una explicación de cómo la primera cosa causaría la segunda.
  4. Control de variables de confusión: hay que controlar el efecto de posibles variables de confusión mediante un diseño experimental cuidadoso, una recogida de datos adecuada y métodos estadísticos.

Estudios observacionales y experimentales

Al explorar relaciones entre variables, hay dos tipos de estudio.

  • Estudios observacionales: recogen datos de forma que no afectan a cómo se generan esos datos. El estudio del aceite de oliva mencionado antes es un ejemplo: registraba qué dieta seguían las personas, en lugar de imponer que unas cocinaran con aceite de oliva y otras no.
  • Experimentos: asignan aleatoriamente a las personas a distintos «tratamientos». Es habitual en pruebas de medicamentos, donde unas personas reciben el fármaco real y otras un placebo.

Los estudios observacionales suelen dificultar mucho, o imposibilitar, determinar la causalidad. En cambio, los experimentos (si se diseñan y ejecutan correctamente) sí permiten establecerla. Puedes leer más sobre experimentos en la siguiente entrega de Data Demystified sobre A/B testing.

¿Quieres saber más?

En resumen, la falacia correlación-causalidad se ha estudiado ampliamente y es uno de los mayores escollos en los que puedes caer al empezar tu formación en datos. Ten en cuenta lo siguiente:

  • La correlación mide la relación entre dos cosas.
  • No siempre puedes inferir una relación causal entre ellas.
  • Para determinar causalidad, necesitas realizar un experimento.

Para llevar tus habilidades al siguiente nivel, haz Introduction to Statistics y empieza tu camino hacia la competencia en datos. La siguiente entrega de la serie Data Demystified profundiza en la experimentación, centrándose en una práctica llamada A/B testing. Mientras tanto, echa un vistazo a estos recursos:

Correlación vs. causalidad: preguntas frecuentes

¿Puede haber causalidad sin correlación?

No, no puede haber causalidad sin correlación. Para que una variable cause a otra, debe existir una relación entre ellas. La correlación es una condición necesaria para la causalidad, pero no suficiente por sí sola. Si no hay correlación, es muy poco probable que una cosa esté causando la otra.

¿Cómo distingo entre correlación y causalidad en mis datos?

Para distinguir entre correlación y causalidad, necesitas ir más allá del análisis de datos básico. Empieza por identificar si existe correlación entre las variables. Después, comprueba tres elementos clave: (1) una relación temporal (la causa debe suceder antes que el efecto), (2) un mecanismo plausible que explique cómo la causa lleva al efecto y (3) controlar cualquier variable de confusión mediante diseño experimental o métodos estadísticos avanzados.

¿Qué métodos puedo usar para probar la causalidad?

La mejor manera de probar la causalidad es mediante experimentos, como los ensayos controlados aleatorizados (RCT), donde los sujetos se asignan al azar a distintos grupos y se exponen a diferentes tratamientos. El A/B testing es otro método habitual en entornos de negocio. Además, puedes usar técnicas estadísticas como el análisis de regresión, las pruebas de causalidad de Granger o el modelado de ecuaciones estructurales para inferir causalidad a partir de datos observacionales, aunque estos métodos son menos concluyentes que los experimentos bien diseñados.

¿Es posible que dos cosas estén correlacionadas pero no tengan una relación directa?

Sí, dos cosas pueden estar correlacionadas sin tener una relación directa debido a la presencia de variables de confusión. Un tercer factor puede influir en ambas variables, creando la ilusión de una relación directa cuando no existe. Por ejemplo, las ventas de helado y las quemaduras solares están correlacionadas, pero la causa real de ambas es el clima cálido, no el consumo de helado.

¿Qué es una correlación espuria?

Una correlación espuria ocurre cuando dos variables parecen estar relacionadas pero, en realidad, no existe una conexión lógica entre ellas. Estas correlaciones suelen ser coincidencias y pueden llevar a error si no se analizan correctamente. Por ejemplo, se ha observado que la tasa de divorcios en Maine se correlaciona con el consumo de margarina per cápita, pero obviamente no hay ninguna relación significativa entre ambos factores.

Temas
Alfabetización informática

Cursos de competencia en datos

Curso

Introducción a la estadística

4 h
159.8K
Estadística básica sin programar: medidas de tendencia central y dispersión, distribuciones de probabilidad, pruebas de hipótesis y más.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

¿Qué es el análisis de datos? Una guía experta con ejemplos

Explora el mundo del análisis de datos con nuestra completa guía. Conoce su importancia, proceso, tipos, técnicas, herramientas y principales carreras en 2023
Matt Crabtree's photo

Matt Crabtree

10 min

blog

Intervalos de confianza frente a intervalos de predicción: Comprender la diferencia

Este artículo te enseña el significado, las diferencias y los casos de uso adecuados de los intervalos de predicción y los intervalos de confianza en los análisis estadísticos y de regresión. También te muestra cómo implementar estos intervalos en R.
Arun Nanda's photo

Arun Nanda

15 min

blog

Clasificación en machine learning: Introducción

Aprende sobre la clasificación en machine learning viendo qué es, cómo se utiliza y algunos ejemplos de algoritmos de clasificación.
Zoumana Keita 's photo

Zoumana Keita

14 min

blog

¿Qué es la ciencia de datos? Definición, ejemplos, herramientas y más

La ciencia de datos es un campo interdisciplinar que utiliza métodos, procesos, algoritmos y sistemas científicos para extraer conocimientos e ideas de datos estructurados y sin estructurar.
Matt Crabtree's photo

Matt Crabtree

15 min

Tutorial

Matriz de correlaciones en Excel: Guía completa para crear e interpretar

Aprende el concepto estadístico de correlación, y sigue el cálculo e interpretación de correlaciones para un conjunto de datos de muestra, en un tutorial paso a paso.
Arunn Thevapalan's photo

Arunn Thevapalan

9 min

Tutorial

Tutorial de tablas de contingencia en R

En este tutorial, aprenderás a crear tablas de contingencia y a probar y cuantificar las relaciones visibles en ellas.
Łukasz Deryło's photo

Łukasz Deryło

10 min

Ver MásVer Más