Accéder au contenu principal

Données démystifiées : des visualisations qui mettent en évidence les distributions

Dans la partie 10 de Données démystifiées, nous allons plonger au cœur de la visualisation de données, avec un focus sur les graphiques qui représentent des distributions.
Actualisé 18 sept. 2026  · 8 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Bienvenue dans la dixième partie de notre série "Données démystifiées" qui s’étend sur tout le mois. Dans le cadre du Mois de la culture des données, cette série clarifie les notions essentielles du monde des données, répond aux questions que vous n’osez peut-être pas poser et le fait avec pédagogie et plaisir. Pour reprendre au début, lisez notre premier article : Qu’est-ce qu’un jeu de données ?

Bannière Données démystifiées : des visualisations qui mettent en évidence les distributions

Cette semaine, nous passons en revue les visualisations de données les plus courantes et la manière de les interpréter. La visualisation de données est souvent le meilleur point d’entrée vers la data science ; cet article s’intéresse aux visualisations qui représentent des distributions et à la façon de les lire.

Des visualisations pour représenter une distribution

Un cas d’usage majeur de la visualisation de données consiste à représenter la distribution d’une variable. Comprendre une distribution vous permet de cerner des propriétés statistiques clés des données que vous visualisez et d’aider votre public à prendre des décisions éclairées, basées sur les données, sur des éléments essentiels. Avant de vous lancer, gardez en tête ces quelques repères utiles pour visualiser des distributions :

  1. Quelle est la forme de la distribution ? Est-elle symétrique ou non ?
  2. Quelle est la dispersion de la distribution ? Autrement dit, l’écart entre la plus petite et la plus grande valeur du jeu de données.
  3. Y a-t-il des valeurs aberrantes dans la distribution ?
  4. Observe-t-on un motif particulier ? La distribution est-elle aléatoire ou présente-t-elle une forme évidente ?
  5. Quelle est la valeur moyenne (moyenne, mode, médiane) ?

Les quatre visualisations ci-dessous permettent de répondre à ces questions. 

Histogrammes

Un histogramme est un graphique à barres qui montre la distribution d’une variable numérique. C’est un moyen efficace de mettre en évidence les caractéristiques majeures d’une distribution, surtout lorsque le jeu de données est volumineux. Des exemples parlants : la distribution des salaires des employés d’une entreprise ou les taux de glycémie d’une cohorte de patients. 

Histogramme de l’âge au décès des hommes australiens en 2022

Histogramme de l’âge au décès des hommes australiens en 2022 (Source : Oosterbaan)

Pour construire un histogramme, on découpe d’abord la variable numérique en classes (ou "bins") puis on compte la fréquence d’occurrence de chaque classe. L’axe horizontal indique les classes, tandis que l’axe vertical représente la fréquence ou le pourcentage d’occurrences par classe. Un histogramme met immédiatement en évidence l’asymétrie d’une distribution ou l’endroit où elle culmine. Voici des exemples issus de notre cours Data Visualization for Everyone. 

histogrammes symétriques, asymétriques à gauche ou à droite

Un histogramme peut être symétrique, asymétrique à gauche ou à droite. (Source : DataCamp)

histogrammes multimodaux

 Un histogramme peut présenter plusieurs modes (Source : DataCamp)

Bien que les histogrammes et les diagrammes en barres se ressemblent, ils n’ont pas la même finalité et ne doivent pas être confondus. Voici les principales différences.

 

Histogramme

Diagramme en barres

Différence fonctionnelle

Afficher la distribution d’une variable numérique.

Comparer des valeurs entre catégories.

Différence visuelle

Pas d’espace entre les barres.

Généralement, un espace sépare les barres.

Courbes de densité

Comme un histogramme, une courbe de densité représente la distribution d’une variable numérique. Contrairement à l’histogramme, elle utilise une ligne lissée au lieu de barres. L’axe horizontal correspond à la variable numérique, et l’axe vertical à la fonction de densité de probabilité. La probabilité que la variable se situe dans un intervalle donné est égale à l’aire sous la courbe. 

courbes de densité des poids de naissance de souris

La probabilité qu’une souris ait un poids de naissance entre 1,0 et 1,2 gramme correspond à l’aire sous la courbe de densité (Source : SPSS)

Une courbe de densité peut révéler plus clairement la forme de la distribution qu’un histogramme. Un histogramme avec un nombre de classes trop faible ou trop élevé peut masquer la forme réelle de la distribution sous-jacente. À l’inverse, une courbe de densité ne nécessite pas de discrétisation en classes et affiche des courbes lisses.

histogramme avec nombre de classes moyen histogramme avec peu de classes histogramme avec beaucoup de classes

Le choix du nombre de classes dans un histogramme est crucial. (Source : Laerd Statistics)

Une courbe de densité est également plus efficace qu’un histogramme pour comparer plusieurs distributions.

comparaison de distributions avec histogrammes comparaison de distributions avec courbes de densité

Comparer des distributions : courbes de densité vs histogrammes (Source : Koehrsen Will)

Boîtes à moustaches

Les histogrammes sont bien adaptés pour afficher la distribution globale des données, mais les boîtes à moustaches (box plots) excellent pour en proposer une synthèse. 

anatomie d’une boîte à moustaches

L’anatomie d’une boîte à moustaches (Source : Galarnyk)

Visualiser des données avec une boîte à moustaches met en évidence les éléments suivants :

  1. La médiane : la valeur centrale d’un jeu de données ; 50 % des valeurs lui sont inférieures et 50 % lui sont supérieures. 
  2. Le troisième quartile (quartile supérieur) : le 75e percentile ; 75 % des valeurs lui sont inférieures et 25 % lui sont supérieures. 
  3. Le premier quartile (quartile inférieur) : le 25e percentile ; 25 % des valeurs lui sont inférieures et 75 % lui sont supérieures. 
  4. L’écart interquartile (IQR) : troisième quartile moins premier quartile.
  5. La borne supérieure adjacente : communément appelée le « maximum » ; elle correspond au troisième quartile plus 1,5 fois l’écart interquartile.
  6. La borne inférieure adjacente : communément appelée le « minimum » ; elle correspond au premier quartile moins 1,5 fois l’écart interquartile.
  7. Les valeurs aberrantes : toute valeur au-dessus du « maximum » ou en dessous du « minimum ».

Diagramme en violon

Un diagramme en violon est un hybride entre une boîte à moustaches et une courbe de densité. 

distribution du montant total de l’addition avec un diagramme en violon

Un diagramme en violon montrant la distribution du montant total de l’addition (Source : DataCamp)

Comme une courbe de densité, un diagramme en violon affiche une distribution de densité. Comme une boîte à moustaches, il présente aussi des statistiques de synthèse. Les diagrammes en violon sont très efficaces pour représenter et résumer simultanément la distribution d’une variable numérique. 

anatomie d’un diagramme en violon

L’anatomie d’un diagramme en violon (Source : Hintze et Nelson)

Commencez la visualisation de données dès aujourd’hui

Nous espérons que cette courte introduction à la visualisation de données vous a plu. Dans le prochain article de la série, nous verrons comment les médias traitent de l’IA et comment développer un esprit critique face aux dernières avancées du domaine. Pour démarrer votre apprentissage des données dès aujourd’hui, explorez les ressources suivantes. 

Sujets
Maîtrise des données

Cours de visualisation de données

Cours

Comprendre la visualisation des données

2 h
261.9K
Découvrez les bases de la visualisation de données grâce à une approche intuitive, sans écrire une seule ligne de code.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow