Accéder au contenu principal

Données décryptées : panorama des statistiques descriptives

Dans le cinquième volet de Données décryptées, nous passons en revue les bases des statistiques descriptives, l’un des domaines fondamentaux de la data science.
Actualisé 18 sept. 2026  · 6 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Bienvenue dans la cinquième partie de notre série mensuelle Données décryptées. Dans le cadre du mois de la culture des données, cette série clarifie des notions clés du monde de la donnée, répond aux questions que vous n’osez peut-être pas poser et, au passage, se veut ludique. Pour reprendre depuis le début, lisez notre premier article : Qu’est-ce qu’un jeu de données ?

An Overview of Descriptive Statistics

Dans cet article, nous allons plonger au cœur des statistiques descriptives, l’un des piliers de la data science. 

Qu’est-ce que les statistiques descriptives ?

Les statistiques descriptives sont l’outil principal de l’analytique descriptive, l’un des quatre types d’analytique. Pour bien comprendre les statistiques descriptives, il est utile de commencer par la notion de variable. 

Une variable est une quantité que l’on peut mesurer ou compter. Par exemple, dans un groupe de personnes, vous pouvez mesurer la taille de chacun : c’est une variable. De même, vous pouvez compter combien de personnes ont chaque couleur de cheveux : la couleur de cheveux est alors aussi une variable.

Les statistiques descriptives sont des nombres qui résument des variables. Leur calcul est si courant que plusieurs appellations existent : « statistiques de synthèse » ou « agrégations » renvoient à la même idée.

Dans les sections suivantes, nous présentons les principales techniques en statistiques descriptives, issues de notre cours d’introduction aux statistiques

Effectifs et proportions

Avec des variables catégorielles — c’est-à-dire des données composées de groupes discrets comme la couleur de cheveux — les façons les plus naturelles de les résumer sont de les compter ou d’exprimer des proportions. 

Par exemple, quatre personnes ont les cheveux noirs, deux châtains, deux blonds, une rousse et une grise. Autrement, on peut dire que 40 % des personnes ont les cheveux noirs, 20 % châtains, 20 % blonds, 10 % roux et 10 % gris. 

Couleur de cheveux

Effectif

Proportion

Noir

4

40 %

Châtain

2

20 %

Blond

2

20 %

Roux

1

10 %

Gris

1

10 %

Mesures de tendance centrale

Les mesures de tendance centrale, plus connues sous le nom de moyennes, résument vos données en capturant une valeur qui décrit le centre de leur distribution. Voici les plus courantes. 

Mode

Le mode est le type de moyenne le plus simple à calculer : c’est la valeur la plus fréquente. Dans l’exemple des couleurs de cheveux, le noir est la couleur la plus courante, donc le mode est « noir ».

Moyenne arithmétique

La moyenne arithmétique est sans doute la moyenne la plus connue. Si l’on parle d’« average » sans préciser, on fait généralement référence à la moyenne arithmétique. 

Sa formule consiste à additionner toutes les valeurs puis à diviser par le nombre de valeurs. Par exemple, si vous avez une variable qui contient la taille de 10 personnes, vous additionnez toutes les tailles et divisez par 10. 

L’un des atouts (et, comme nous le verrons, une faiblesse) de la moyenne est qu’elle utilise chaque point de donnée dans le calcul. Autrement dit, elle exploite un maximum d’information.

Il existe d’autres types de moyenne, comme la moyenne géométrique et la moyenne harmonique, réservées à des usages plus spécifiques.

Médiane

La médiane se calcule en triant les valeurs de la plus petite à la plus grande, puis en prenant la valeur du milieu. 

Dans l’exemple des tailles, il faut trier de la plus faible à la plus élevée et choisir la valeur médiane de la variable, ici la cinquième. La médiane est dite « robuste » car elle varie peu si l’une des valeurs change. 

Pour l’illustrer, supposons qu’un nouveau point corresponde à une personne exceptionnellement grande ou petite. La moyenne arithmétique changerait sensiblement, car les valeurs extrêmes influencent le résultat. La médiane, elle, varierait à peine puisque la position centrale reste quasiment inchangée.  

Autres mesures de position

Parfois, une valeur centrale ne résume pas utilement votre variable. Vous pouvez vous intéresser au minimum (plus petite valeur) ou au maximum (plus grande valeur). Ces autres mesures de l’ordre des valeurs sont appelées mesures de position.

Une autre mesure clé est le percentile. Il découpe les données en 100 intervalles contenant chacun la même quantité de données. Le 100e percentile correspond au maximum, et le 50e percentile à la médiane. Les percentiles sont moins pertinents quand on ne dispose que de 10 observations, comme dans l’exemple des tailles, mais très utiles pour des jeux de données plus volumineux. 

Une variante des percentiles est celle des quartiles, où l’on divise les données en quatre intervalles plutôt qu’en 100.

Mesures de dispersion

Il arrive que l’on s’intéresse moins à la valeur des observations qu’à leurs écarts entre elles. Les statistiques descriptives qui quantifient ces différences sont appelées mesures de dispersion (ou de variation).

Étendue

La mesure de dispersion la plus simple est l’étendue, égale au maximum moins le minimum. Pour les tailles, l’étendue est la taille maximale moins la taille minimale. 

Variance

La variance est une mesure de dispersion plus technique, souvent utilisée avec la moyenne arithmétique. Elle se calcule comme la somme des carrés des écarts entre chaque valeur et la moyenne, le tout divisé par un de moins que le nombre d’observations.

Pour l’illustrer, prenons un exemple encore plus simple de la variable taille. Supposons que nous ayons relevé la taille de quatre personnes, comme dans le tableau ci-dessous.

Nom

Taille

Isabella Leslie-Miller

158

Valeria Kogan-Higgs

172

Hadrien Lacroix

177

Sara Billen

183

La moyenne arithmétique des tailles est ici de 172,5 cm (somme des tailles divisée par 4). 

Dans cet exemple, la variance serait 

((158 - 172,5) ^ 2 + (172 - 172,5) ^ 2 + (177 - 172,5) ^ 2 + (183 - 172,5) ^ 2) / (4 - 1) = 113 cm2.

Comme pour la moyenne, le fait d’utiliser chaque observation rend cette mesure très informative, mais aussi potentiellement plus sensible aux variations des données.

Corrélation

La corrélation mesure la relation linéaire entre deux variables. Autrement dit, quand une variable augmente, l’autre a-t-elle tendance à augmenter ou à diminuer ? Plusieurs algorithmes permettent de la calculer, mais le score est toujours compris entre moins un et un. 

Pour deux variables X et Y, on interprète la corrélation comme suit.

Score de corrélation

Interprétation

-1

Quand X augmente, Y diminue. Plus la valeur est proche de -1, plus la relation est forte. 

Entre -1 et 0

Quand X augmente, Y diminue. Plus on se rapproche de 0, plus la relation est faible. 

0

Il n’y a pas de relation linéaire entre X et Y, donc pas de corrélation.

Entre 0 et 1

Quand X augmente, Y augmente. Plus on se rapproche de 0, plus la relation est faible. 

1

Quand X augmente, Y augmente. Plus la valeur est proche de 1, plus la relation est forte. 

Notez que la corrélation ne tient pas compte des effets non linéaires : si X et Y ne sont pas reliées par une droite, le score de corrélation peut être peu pertinent.

Envie d’en savoir plus ?

Nous espérons que cette brève introduction aux statistiques descriptives vous a plu. Dans le prochain article, nous approfondirons la corrélation. Nous verrons notamment d’où vient l’adage corrélation n’est pas causalité et comment éviter cet écueil.

Sujets
Maîtrise des données

Cours sur la culture des données

Cours

Introduction aux statistiques

4 h
160.4K
Explorez les bases de la statistique : centre, dispersion, lois de probabilité et tests d’hypothèse, sans écrire une seule ligne de code.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow