Pular para o conteúdo principal

Análise de contingência usando R

Neste tutorial, você vai aprender com um exemplo como funciona a "análise de contingência" ou o "teste qui-quadrado de independência" e como executá-lo com eficiência no R.
Atualizado 17 de set. de 2026  · 6 min lido

Explorar com IA

ChatGPTClaudePerplexity

A análise de contingência é um teste de hipótese usado para verificar se duas variáveis categóricas são independentes ou não. Em outras palavras, estamos perguntando: "Dá para prever o valor de uma variável se soubermos o valor da outra?". Se a resposta for sim, dizemos que as variáveis em questão não são independentes. Se a resposta for não, dizemos que elas são independentes. O teste utiliza tabelas de contingência e, por isso, é conhecido como "análise de contingência". Ele também é chamado de "teste qui-quadrado de independência", pois a estatística de teste segue uma distribuição qui-quadrado e o objetivo é verificar se duas variáveis categóricas são independentes ou não.

A hipótese nula do teste afirma que as duas variáveis são independentes, e a hipótese alternativa afirma que elas não são independentes.

Vamos entender a "análise de contingência" ou o "teste qui-quadrado de independência" com um exemplo.

Suponha que queremos saber se a preferência por esporte é independente de gênero. Para isso, perguntamos a cem mulheres e cem homens qual esporte preferem praticar entre arco e flecha, boxe e ciclismo, e resumimos os dados na tabela de dupla entrada a seguir.

Análise de contingência usando R

A tabela acima é chamada de tabela observada, pois contém as contagens observadas.

O teste qui-quadrado de independência compara as contagens observadas com as contagens esperadas. Portanto, nossa próxima tarefa é derivar a tabela esperada, contendo as contagens esperadas com base na tabela observada. A tabela esperada representa como esperamos que a tabela de dupla entrada seja caso as duas variáveis categóricas sejam independentes. Pela teoria das probabilidades, sabemos que dois eventos são independentes se a probabilidade conjunta é igual ao produto das probabilidades marginais. Vamos usar esse conceito para calcular as contagens esperadas em cada uma das seis células. Vamos calcular a contagem esperada da primeira célula. Primeiro, calculamos a probabilidade conjunta multiplicando a probabilidade de ser mulher (100/200) pela probabilidade de preferir arco e flecha (45/200). Tendo a probabilidade conjunta (100/200 * 45/200), multiplicamos pelo tamanho da amostra (200) e obtemos a contagem esperada da primeira célula, que é 22,5. Da mesma forma, calculamos as contagens esperadas para as outras cinco células. A tabela a seguir é a que esperaríamos ver se gênero e preferência esportiva fossem independentes.

Análise de contingência usando R

Agora que temos as contagens esperadas e observadas, nossa próxima tarefa é verificar o quanto as contagens observadas diferem das esperadas. Para isso, calculamos uma estatística de teste conhecida como qui-quadrado, pois ela segue a distribuição qui-quadrado. A seguir está a fórmula para calcular o valor da estatística qui-quadrado.

Análise de contingência usando R

Pela fórmula acima, vemos que o valor da estatística qui-quadrado pode ser 0 (quando não há diferença alguma entre as contagens observadas e esperadas), mas nunca pode ser negativo. Isso torna o teste qui-quadrado de independência unilateral (cauda à direita).

Usando a fórmula, vamos calcular o valor da estatística qui-quadrado para o nosso exemplo. Esse é o valor observado da estatística de teste.

Análise de contingência usando R

Agora é hora de decidir se rejeitamos ou não a hipótese nula. Tomamos a decisão comparando o valor observado da estatística de teste com seu valor crítico ou analisando o p-valor. Se o valor observado exceder o valor crítico, ou se o p-valor for menor ou igual ao nível de significância, rejeitamos a hipótese nula e concluímos que existe uma relação estatisticamente significativa entre as duas variáveis categóricas — ou seja, elas não são independentes. Sabendo o nível de significância (geralmente 0,05) e os graus de liberdade, obtemos o valor crítico na tabela qui-quadrado. O nível de significância é a probabilidade de rejeitar uma hipótese nula verdadeira. Para uma tabela com r linhas e c colunas, os graus de liberdade podem ser calculados pela fórmula a seguir.

Análise de contingência usando R

Portanto, no nosso exemplo, temos 2 graus de liberdade.

Análise de contingência usando R

Pela tabela abaixo, vemos que o valor crítico da estatística de teste é 5,99 para nível de significância de 0,05 e 2 graus de liberdade.

Análise de contingência usando R

Como o valor observado da estatística de teste é maior que o seu valor crítico (19,798 > 5,99), podemos rejeitar a hipótese nula e concluir que a preferência por esporte não é independente de gênero.

Vamos ver agora como executar o teste qui-quadrado de independência na linguagem R

É muito fácil realizar o teste qui-quadrado de independência usando a função nativa chisq.test().

A seguir, a tabela observada.

observed_table <- matrix(c(35, 15, 50, 10, 30, 60), nrow = 2, ncol = 3, byrow = T)
rownames(observed_table) <- c('Female', 'Male')
colnames(observed_table) <- c('Archery', 'Boxing', 'Cycling')
observed_table
##        Archery Boxing Cycling
## Female      35     15      50
## Male        10     30      60

Para realizar o teste, aplicamos a função chisq.test() à tabela observada.

X <- chisq.test(observed_table)
X
##
##  Pearson's Chi-squared test
##
## data:  observed_table
## X-squared = 19.798, df = 2, p-value = 5.023e-05

Pelo resultado acima, vemos que o p-valor é menor que o nível de significância (0,05). Portanto, podemos rejeitar a hipótese nula e concluir que as duas variáveis (gênero e preferência esportiva) não são independentes.

Se quisermos ver a tabela esperada, também é possível.

X$expected
##        Archery Boxing Cycling
## Female    22.5   22.5      55
## Male      22.5   22.5      55

Espero que você tenha gostado deste artigo. Se quiser aprender mais em R, faça o curso Statistical Modeling in R (Part 1) da DataCamp.

Tópicos
R
Ciência de dados
Data Analysis

Cursos de R

Curso

Introdução ao R

4 h
3.1M
Domine os conceitos básicos de análise de dados em R, incluindo vetores, listas e quadros de dados, e pratique o R com conjuntos de dados reais.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

Tutorial

Teste de qui-quadrado em planilhas

Neste tutorial, você aprenderá a realizar o teste qui-quadrado em planilhas.
Avinash Navlani's photo

Avinash Navlani

10 min

Tutorial

Testes T no tutorial do R: Saiba como realizar testes T

Determine se há uma diferença significativa entre as médias dos dois grupos usando t.test() no R.
Abid Ali Awan's photo

Abid Ali Awan

10 min

Tutorial

Tutorial de regressão linear no R

Neste tutorial, você aprenderá os fundamentos de um modelo estatístico muito popular: a regressão linear.

Eladio Montero Porras

15 min

multiple linear regression

Tutorial

Regressão linear múltipla no R: Tutorial com exemplos

Uma visão geral completa para entender as regressões lineares múltiplas no R por meio de exemplos.
Zoumana Keita 's photo

Zoumana Keita

12 min

Tutorial

Tutorial de regressão logística no R

Descubra tudo sobre a regressão logística: como ela difere da regressão linear, como ajustar e avaliar esses modelos no R com a função glm() e muito mais!
Vidhi Chugh's photo

Vidhi Chugh

14 min

Tutorial

Criação de modelos de redes neurais (NN) em R

Neste tutorial, você aprenderá a criar um modelo de rede neural no R.
Abid Ali Awan's photo

Abid Ali Awan

10 min

Ver MaisVer Mais