Cours
L’analyse de contingence est un test d’hypothèse qui permet de vérifier si deux variables catégorielles sont indépendantes ou non. En d’autres termes, on se demande : « Peut-on prédire la valeur d’une variable si l’on connaît la valeur de l’autre ? ». Si la réponse est oui, on dira que les variables ne sont pas indépendantes. Si la réponse est non, on dira qu’elles sont indépendantes. Le test s’appuie sur des tableaux de contingence, d’où son nom d’« analyse de contingence ». On parle aussi de « test du khi deux d’indépendance » car la statistique de test suit une loi du khi deux et sert à évaluer l’indépendance de deux variables catégorielles.
L’hypothèse nulle du test stipule que les deux variables sont indépendantes ; l’hypothèse alternative stipule qu’elles ne le sont pas.
Voyons l’« analyse de contingence » ou le « test du khi deux d’indépendance » au travers d’un exemple.
Supposons que nous souhaitions savoir si le choix d’un sport est indépendant du genre. Nous avons donc demandé à cent hommes et cent femmes quel sport ils préféraient pratiquer parmi le tir à l’arc, la boxe et le cyclisme, puis avons résumé les réponses dans le tableau croisé suivant.

Le tableau ci-dessus est dit « observé » car il contient les effectifs observés.
Le test du khi deux d’indépendance compare les effectifs observés aux effectifs attendus. Notre prochaine étape consiste donc à déduire, à partir du tableau observé, le tableau attendu contenant les effectifs attendus. Ce tableau représente la forme que prendrait le tableau croisé si les deux variables étaient indépendantes. En théorie des probabilités, deux événements sont indépendants si leur probabilité conjointe est égale au produit de leurs probabilités marginales. Nous allons utiliser ce principe pour calculer les effectifs attendus dans chacune des six cases. Calculons l’effectif attendu de la première case. On commence par déterminer la probabilité conjointe en multipliant la probabilité d’être une femme (100/200) par la probabilité de préférer le tir à l’arc (45/200). Une fois la probabilité conjointe obtenue (100/200 * 45/200), en la multipliant par la taille de l’échantillon (200), on obtient l’effectif attendu de la première case, soit 22,5. On calcule de la même manière les effectifs attendus des cinq autres cases. Le tableau suivant est celui que l’on s’attendrait à observer si le genre et la préférence sportive étaient indépendants.

Maintenant que nous avons les effectifs attendus et observés, il s’agit de mesurer dans quelle mesure ils diffèrent. Pour cela, on calcule une statistique de test appelée statistique du khi deux, car elle suit une loi du khi deux. Voici la formule permettant de la calculer.

On voit, d’après cette formule, que la statistique du khi deux peut valoir 0 (lorsqu’il n’y a aucune différence entre observé et attendu) mais ne peut jamais être négative. Le test du khi deux d’indépendance est donc un test unilatéral.
Appliquons la formule pour calculer la valeur observée de la statistique du test dans notre exemple.

Vient ensuite la décision de rejeter ou non l’hypothèse nulle. On décide en comparant la valeur observée de la statistique de test à sa valeur critique ou en examinant la p-valeur. Si la valeur observée dépasse la valeur critique, ou si la p-valeur est inférieure ou égale au seuil de signification, on peut rejeter l’hypothèse nulle et conclure à une relation statistiquement significative entre les deux variables catégorielles, c’est-à-dire à une non-indépendance. Connaissant le seuil de signification (généralement 0,05) et les degrés de liberté, on peut lire la valeur critique dans la table du khi deux. Le seuil de signification est la probabilité de rejeter à tort une hypothèse nulle vraie. Pour un tableau à r lignes et c colonnes, les degrés de liberté se calculent ainsi :

Ainsi, dans notre exemple, nous avons 2 degrés de liberté.

D’après le tableau ci-dessous, la valeur critique de la statistique de test est de 5,99 pour un seuil de signification de 0,05 et 2 degrés de liberté.

Puisque la valeur observée de la statistique de test est supérieure à sa valeur critique (19,798 > 5,99), nous pouvons rejeter l’hypothèse nulle et conclure que le choix du sport n’est pas indépendant du genre.
Voyons maintenant comment réaliser le test du khi deux d’indépendance avec le langage R
Il est très simple d’effectuer le test du khi deux d’indépendance grâce à la fonction intégrée chisq.test().
Voici le tableau observé.
observed_table <- matrix(c(35, 15, 50, 10, 30, 60), nrow = 2, ncol = 3, byrow = T)
rownames(observed_table) <- c('Female', 'Male')
colnames(observed_table) <- c('Archery', 'Boxing', 'Cycling')
observed_table
## Archery Boxing Cycling
## Female 35 15 50
## Male 10 30 60
Pour effectuer le test, il suffit d’appliquer la fonction chisq.test() au tableau observé.
X <- chisq.test(observed_table)
X
##
## Pearson's Chi-squared test
##
## data: observed_table
## X-squared = 19.798, df = 2, p-value = 5.023e-05
On constate que la p-valeur est inférieure au seuil de signification (0,05). Nous pouvons donc rejeter l’hypothèse nulle et conclure que les deux variables (genre et préférence sportive) ne sont pas indépendantes.
Si vous souhaitez afficher le tableau attendu, c’est possible également.
X$expected
## Archery Boxing Cycling
## Female 22.5 22.5 55
## Male 22.5 22.5 55
Nous espérons que cet article vous a plu. Pour aller plus loin en R, suivez le cours Statistical Modeling in R (Part 1) de DataCamp.