Pular para o conteúdo principal

Correlação vs. causalidade: entenda a diferença na análise de dados

Aprenda a diferença crucial entre correlação e causalidade na análise de dados. Entenda exemplos do mundo real e evite armadilhas comuns ao interpretar dados.
Atualizado 17 de set. de 2026  · 8 min lido

Explorar com IA

ChatGPTClaudePerplexity

Como parte do Data Literacy Month, esta série vai esclarecer conceitos-chave do universo de dados, responder às perguntas que você talvez tenha vergonha de fazer e se divertir ao longo do caminho. Se quiser começar do início, leia nossa primeira publicação da série: O que é um dataset?

Correlação vs. causalidade

Você já ouviu a frase "correlação não implica causalidade"? É uma armadilha comum que pega tanto entusiastas quanto profissionais de dados. Neste artigo, vamos explorar as diferenças entre correlação e causalidade, desmistificar mitos e trazer exemplos reais para ajudar você a evitar um dos maiores erros na interpretação de dados.

O que é correlação?

Correlação é uma medida do relacionamento entre duas coisas. Ou seja, quando uma sobe, a outra sobe ou desce? O gráfico de dispersão abaixo mostra dados da American Community Survey de 2017. No eixo x, você vê a renda média anual de cada um dos cinquenta estados dos EUA e, no eixo y, os pagamentos médios de aluguel mensal nesses estados. À medida que as rendas aumentam, os aluguéis também aumentam.

Aluguel médio mensal

renda anual em comparação com aluguel mensal médio (em USD)

Se uma coisa sobe quando a outra sobe — como neste caso — dizemos que há correlação positiva. Se uma cai quando a outra sobe, a correlação é negativa.

Em estatística e ciência de dados, correlação é um conceito mais preciso, referindo-se à força de um relacionamento linear entre duas coisas. Na variação do gráfico de dispersão abaixo, uma linha reta foi ajustada aos dados. A linha acompanha bem os pontos, indicando uma relação linear entre renda e aluguel.

linha entre as duas variáveis

Uma linha ajustada entre as duas variáveis, indicando um relacionamento positivo entre elas

Por outro lado, no exemplo abaixo, usando o clássico dataset de diamonds, se plotarmos o preço de um diamante em função do seu peso em quilates e traçarmos a linha de melhor ajuste, veremos que a linha se curva para cima. Ou seja, o preço cresce mais rápido do que linearmente.

relacionamento positivo entre as duas coisas

A correlação vai capturar o relacionamento positivo entre as duas coisas — à medida que o peso aumenta, o preço também — mas não o aspecto não linear dessa relação.

O que é causalidade?

Causalidade é uma afirmação mais forte do que correlação. Significa que mudanças em uma coisa fazem outra coisa mudar. Você vê muitos exemplos de causalidade em recomendações médicas, por exemplo: "fumar causa câncer" ou "tomar ibuprofeno reduz a dor".

Também dá para ver vários exemplos de causalidade no dia a dia. Comer de forma saudável leva a melhores resultados de qualidade de vida, treinar faz você ficar em melhor forma e estudar na DataCamp faz você aprender mais sobre dados.

O erro de confundir correlação com causalidade

O erro correlação-causalidade acontece quando as pessoas assumem uma relação de causa e efeito apenas a partir de uma correlação. No exemplo de renda e aluguel, os dados mostraram que pagamentos de aluguel são positivamente correlacionados com renda. No entanto, economia é complexa, e os dados são insuficientes para fazer a afirmação mais ousada de que renda mais alta causa aluguéis mais altos.

Esse erro é comum em praticamente toda sociedade, já que todo mundo que trabalha com marketing gostaria que você acreditasse que comprar o produto deles vai melhorar sua vida — sem necessariamente fazer um experimento científico rigoroso para testar isso. Essa ideia foi levada ao limite pela música pop dos anos 1990 do The Tamperer, If you Buy This Record (Your Life Will Be Better). Uma correlação pode ocorrer em três situações principais, mas a causalidade não.

Relação coincidencial

Com dados suficientes, duas coisas completamente não relacionadas podem mostrar correlação. O exemplo abaixo vem do excelente site Spurious Correlations, de Tyler Vigen. O gráfico de linhas mostra que a taxa de divórcio no estado do Maine, nos EUA, é altamente correlacionada com o consumo per capita de margarina.

taxa de divórcio no estado do Maine, EUA

Seria absurdo pensar que comer mais ou menos margarina influenciaria a taxa de divórcios em nível estadual, então não podemos afirmar causalidade. A correlação mostrada aqui é puramente coincidencial.

Nem investidores estão imunes a essa falácia lógica. O Super Bowl Indicator sugere que o mercado de ações vai subir se um time da National Football Conference vencer o Super Bowl. Se um time da American Football Conference vencer, ele cairá.

Variável de confusão

Podem surgir correlações quando uma terceira coisa (uma "variável de confusão") afeta tanto a suposta causa quanto o suposto efeito.

Um exemplo clássico é que queimaduras de sol estão correlacionadas com vendas de sorvete. Seria tolice dizer que comer sorvete causa mais queimaduras de sol. Uma explicação mais razoável é que em dias quentes e ensolarados as pessoas tendem a consumir mais sorvete e também a tomar mais sol. Ou seja, o clima é a variável de confusão.

Em 2001, um artigo científico observou que pessoas que comem muitos vegetais e azeite têm menos rugas. É uma observação válida, mas Ben Goldacre apontou em uma palestra TED que nutricionistas se apegaram a esse resultado e começaram a afirmar que consumir azeite faz você ter menos rugas. Isso ignora o efeito de vários fatores de confusão. Azeite é caro em comparação com outros óleos, então, se você pode comprá-lo, é mais provável que tenha um trabalho em ambiente interno, com menos exposição ao sol, e menos probabilidade de fumar — sem falar em centenas de outras diferenças de estilo de vida não consideradas no estudo.

Causalidade reversa

Causalidade reversa é quando as pessoas se confundem sobre o que causa o quê. Um exemplo bobo: quando turbinas eólicas giram mais rápido, também se detecta vento mais forte, então alguém poderia concluir que o vento é causado pelas turbinas girando. Pensando um pouco, dá para perceber que a causalidade é o contrário: é o vento que faz as turbinas girarem.

Entender a direção da causalidade é um problema comum na análise de dados médicos. Por exemplo, há correlação positiva entre depressão e uso de cannabis. Ou seja, pessoas com depressão são mais propensas a fumar cannabis. Este artigo científico, por exemplo, constatou que em 2016 pessoas com depressão tinham 216% mais chances de fumar cannabis quase diariamente do que pessoas sem depressão. 

Tem havido muito debate sobre o que causa o quê. Fumar cannabis causa depressão, ou ter depressão torna a pessoa mais propensa a usar cannabis? Este artigo científico sugere que a causalidade pode ocorrer nos dois sentidos. Há também alguma evidência de que o uso de cannabis pode levar ao início da depressão; porém, evidências fortes apontam para a associação inversa, isto é, que a depressão pode levar ao início ou ao aumento da frequência de uso de cannabis.

Do que você precisa para estabelecer causalidade?

Determinar causalidade pode ser mais difícil do que parece. Para estabelecer causalidade, você precisa de quatro coisas.

  1. Correlação: embora a correlação entre duas coisas não garanta causalidade, ela é uma condição necessária. Se não há correlação, não há relação causal.
  2. Relação temporal: aquilo que você atribui como causa do que está analisando precisa acontecer antes do que você considera ser o efeito.
  3. Mecanismo: deve haver uma explicação de como a primeira coisa levaria à segunda.
  4. Controle de variáveis de confusão: é preciso controlar o efeito de possíveis variáveis de confusão com um desenho experimental cuidadoso, coleta de dados e métodos estatísticos.

Estudos observacionais e experimentais

Ao explorar relações entre coisas, existem dois tipos de estudo.

  • Estudos observacionais coletam dados de um jeito que não afeta como esses dados são gerados. O estudo do azeite mencionado antes é um exemplo: ele registrou o que as pessoas comiam, em vez de impor que alguns cozinhassem com azeite e outros não.
  • Experimentos atribuem aleatoriamente pessoas a diferentes "tratamentos". Isso é comum em testes de medicamentos, em que alguns recebem o remédio de verdade e outros, placebo.

Estudos observacionais geralmente tornam muito difícil — ou impossível — determinar causalidade. Já experimentos (bem desenhados e executados) permitem estabelecer causalidade. Você pode ler mais sobre experimentos na próxima publicação de Data Demystified sobre testes A/B.

Quer aprender mais?

Em resumo, a falácia correlação-causalidade é amplamente estudada e é uma das maiores armadilhas no início da sua jornada de capacitação em dados. Lembre-se:

  • Correlação mede o relacionamento entre duas coisas.
  • Nem sempre é possível inferir uma relação causal entre elas.
  • Para determinar causalidade, é preciso realizar um experimento.

Para levar suas habilidades para o próximo nível, faça o curso Introduction to Statistics e comece sua jornada de letramento em dados. A próxima publicação da série Data Demystified aprofunda a parte de experimentação, com foco em uma prática chamada A/B testing. Enquanto isso, confira estes recursos: 

Perguntas frequentes sobre correlação vs. causalidade

É possível ter causalidade sem correlação?

Não, não existe causalidade sem correlação. Para uma variável causar outra, precisa haver uma relação entre elas. Correlação é uma condição necessária para a causalidade, mas não é suficiente por si só. Se não há correlação, é muito improvável que uma coisa esteja causando a outra.

Como diferenciar correlação de causalidade nos meus dados?

Para distinguir entre correlação e causalidade, é preciso ir além da análise simples dos dados. Comece identificando se existe correlação entre as variáveis. Depois, verifique três elementos-chave: (1) uma relação temporal (a causa precisa acontecer antes do efeito), (2) um mecanismo plausível que explique como a causa leva ao efeito e (3) controle de variáveis de confusão por meio de desenho experimental ou métodos estatísticos avançados.

Quais métodos posso usar para testar causalidade?

A melhor forma de testar causalidade é por meio de experimentos, como ensaios clínicos randomizados (RCTs), nos quais os participantes são designados aleatoriamente para grupos diferentes e expostos a tratamentos distintos. Testes A/B são outro método comum em contextos de negócios. Além disso, é possível usar técnicas estatísticas como regressão, testes de causalidade de Granger ou modelagem de equações estruturais para inferir causalidade a partir de dados observacionais, embora esses métodos sejam menos conclusivos do que experimentos bem desenhados.

É possível que duas coisas sejam correlacionadas, mas não tenham relação direta?

Sim, duas coisas podem estar correlacionadas sem terem uma relação direta devido à presença de variáveis de confusão. Um terceiro fator pode influenciar ambas as variáveis, criando a ilusão de uma relação direta quando ela não existe. Por exemplo, vendas de sorvete e queimaduras de sol são correlacionadas, mas a verdadeira causa por trás de ambas é o clima quente, não o consumo de sorvete.

O que é uma correlação espúria?

Uma correlação espúria ocorre quando duas variáveis parecem estar relacionadas, mas, na realidade, não existe conexão lógica entre elas. Essas correlações costumam ser coincidenciais e podem induzir ao erro se não forem analisadas corretamente. Por exemplo, já foi constatado que a taxa de divórcios no Maine se correlaciona com o consumo per capita de margarina, mas obviamente esses dois fatores não têm conexão significativa.

Tópicos
Alfabetização em dados

Cursos de letramento em dados

Curso

Introdução à estatística

4 h
159.8K
Aprenda os fundamentos da estatística, com medidas de centro e dispersão, distribuições de probabilidade e testes de hipóteses sem usar código!
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

O que é análise de dados? Um guia especializado com exemplos

Explore o mundo da análise de dados com nosso guia abrangente. Saiba mais sobre sua importância, processo, tipos, técnicas, ferramentas e as principais carreiras em 2023
Matt Crabtree's photo

Matt Crabtree

10 min

blog

Analista de dados versus analista de negócios: Quais são as diferenças?

Quais são as principais diferenças entre um analista de dados e um analista de negócios? Leia tudo sobre eles neste guia completo.
Austin Chia's photo

Austin Chia

8 min

blog

O que é data wrangling? Um guia prático com exemplos

Aprenda os conceitos e fundamentos do data wrangling com exemplos práticos. Use essas habilidades no dia a dia para gerar dados limpos e úteis para seus modelos.
Tim Lu's photo

Tim Lu

12 min

blog

O que é ciência de dados? Definição, exemplos, ferramentas e mais

A ciência de dados é um campo interdisciplinar que usa métodos científicos, processos, algoritmos e sistemas para extrair conhecimento e percepções de dados estruturados e não estruturados.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

Intervalos de confiança versus intervalos de previsão: Entendendo a diferença

Este artigo ensina a você o significado, as diferenças e os casos de uso apropriados de intervalos de previsão e intervalos de confiança em análises estatísticas e de regressão. Ele também mostra a você como implementar esses intervalos no R.
Arun Nanda's photo

Arun Nanda

15 min

blog

A importância dos dados: 5 principais motivos

Por que os dados são importantes? Saiba mais sobre a importância dos dados no mundo atual e descubra alguns cursos para ajudá-lo a aprimorar suas próprias habilidades com dados.
Kurtis Pykes 's photo

Kurtis Pykes

6 min

Ver MaisVer Mais