Cours
Bienvenue dans la dixième partie de notre série "Données démystifiées" qui s’étend sur tout le mois. Dans le cadre du Mois de la culture des données, cette série clarifie les notions essentielles du monde des données, répond aux questions que vous n’osez peut-être pas poser et le fait avec pédagogie et plaisir. Pour reprendre au début, lisez notre premier article : Qu’est-ce qu’un jeu de données ?

Cette semaine, nous passons en revue les visualisations de données les plus courantes et la manière de les interpréter. La visualisation de données est souvent le meilleur point d’entrée vers la data science ; cet article s’intéresse aux visualisations qui représentent des distributions et à la façon de les lire.
Des visualisations pour représenter une distribution
Un cas d’usage majeur de la visualisation de données consiste à représenter la distribution d’une variable. Comprendre une distribution vous permet de cerner des propriétés statistiques clés des données que vous visualisez et d’aider votre public à prendre des décisions éclairées, basées sur les données, sur des éléments essentiels. Avant de vous lancer, gardez en tête ces quelques repères utiles pour visualiser des distributions :
- Quelle est la forme de la distribution ? Est-elle symétrique ou non ?
- Quelle est la dispersion de la distribution ? Autrement dit, l’écart entre la plus petite et la plus grande valeur du jeu de données.
- Y a-t-il des valeurs aberrantes dans la distribution ?
- Observe-t-on un motif particulier ? La distribution est-elle aléatoire ou présente-t-elle une forme évidente ?
- Quelle est la valeur moyenne (moyenne, mode, médiane) ?
Les quatre visualisations ci-dessous permettent de répondre à ces questions.
Histogrammes
Un histogramme est un graphique à barres qui montre la distribution d’une variable numérique. C’est un moyen efficace de mettre en évidence les caractéristiques majeures d’une distribution, surtout lorsque le jeu de données est volumineux. Des exemples parlants : la distribution des salaires des employés d’une entreprise ou les taux de glycémie d’une cohorte de patients.

Histogramme de l’âge au décès des hommes australiens en 2022 (Source : Oosterbaan)
Pour construire un histogramme, on découpe d’abord la variable numérique en classes (ou "bins") puis on compte la fréquence d’occurrence de chaque classe. L’axe horizontal indique les classes, tandis que l’axe vertical représente la fréquence ou le pourcentage d’occurrences par classe. Un histogramme met immédiatement en évidence l’asymétrie d’une distribution ou l’endroit où elle culmine. Voici des exemples issus de notre cours Data Visualization for Everyone.

Un histogramme peut être symétrique, asymétrique à gauche ou à droite. (Source : DataCamp)

Un histogramme peut présenter plusieurs modes (Source : DataCamp)
Bien que les histogrammes et les diagrammes en barres se ressemblent, ils n’ont pas la même finalité et ne doivent pas être confondus. Voici les principales différences.
|
Histogramme |
Diagramme en barres |
|
|
Différence fonctionnelle |
Afficher la distribution d’une variable numérique. |
Comparer des valeurs entre catégories. |
|
Différence visuelle |
Pas d’espace entre les barres. |
Généralement, un espace sépare les barres. |
Courbes de densité
Comme un histogramme, une courbe de densité représente la distribution d’une variable numérique. Contrairement à l’histogramme, elle utilise une ligne lissée au lieu de barres. L’axe horizontal correspond à la variable numérique, et l’axe vertical à la fonction de densité de probabilité. La probabilité que la variable se situe dans un intervalle donné est égale à l’aire sous la courbe.

La probabilité qu’une souris ait un poids de naissance entre 1,0 et 1,2 gramme correspond à l’aire sous la courbe de densité (Source : SPSS)
Une courbe de densité peut révéler plus clairement la forme de la distribution qu’un histogramme. Un histogramme avec un nombre de classes trop faible ou trop élevé peut masquer la forme réelle de la distribution sous-jacente. À l’inverse, une courbe de densité ne nécessite pas de discrétisation en classes et affiche des courbes lisses.
![]() |
![]() |
![]() |
Le choix du nombre de classes dans un histogramme est crucial. (Source : Laerd Statistics)
Une courbe de densité est également plus efficace qu’un histogramme pour comparer plusieurs distributions.
![]() |
![]() |
Comparer des distributions : courbes de densité vs histogrammes (Source : Koehrsen Will)
Boîtes à moustaches
Les histogrammes sont bien adaptés pour afficher la distribution globale des données, mais les boîtes à moustaches (box plots) excellent pour en proposer une synthèse.

L’anatomie d’une boîte à moustaches (Source : Galarnyk)
Visualiser des données avec une boîte à moustaches met en évidence les éléments suivants :
- La médiane : la valeur centrale d’un jeu de données ; 50 % des valeurs lui sont inférieures et 50 % lui sont supérieures.
- Le troisième quartile (quartile supérieur) : le 75e percentile ; 75 % des valeurs lui sont inférieures et 25 % lui sont supérieures.
- Le premier quartile (quartile inférieur) : le 25e percentile ; 25 % des valeurs lui sont inférieures et 75 % lui sont supérieures.
- L’écart interquartile (IQR) : troisième quartile moins premier quartile.
- La borne supérieure adjacente : communément appelée le « maximum » ; elle correspond au troisième quartile plus 1,5 fois l’écart interquartile.
- La borne inférieure adjacente : communément appelée le « minimum » ; elle correspond au premier quartile moins 1,5 fois l’écart interquartile.
- Les valeurs aberrantes : toute valeur au-dessus du « maximum » ou en dessous du « minimum ».
Diagramme en violon
Un diagramme en violon est un hybride entre une boîte à moustaches et une courbe de densité.

Un diagramme en violon montrant la distribution du montant total de l’addition (Source : DataCamp)
Comme une courbe de densité, un diagramme en violon affiche une distribution de densité. Comme une boîte à moustaches, il présente aussi des statistiques de synthèse. Les diagrammes en violon sont très efficaces pour représenter et résumer simultanément la distribution d’une variable numérique.

L’anatomie d’un diagramme en violon (Source : Hintze et Nelson)
Commencez la visualisation de données dès aujourd’hui
Nous espérons que cette courte introduction à la visualisation de données vous a plu. Dans le prochain article de la série, nous verrons comment les médias traitent de l’IA et comment développer un esprit critique face aux dernières avancées du domaine. Pour démarrer votre apprentissage des données dès aujourd’hui, explorez les ressources suivantes.
- Découvrez notre programme pour le Mois de la culture des données
- Lancez-vous avec notre parcours de compétences Understanding Data Topics
- Abonnez-vous au podcast DataFramed
- Consultez nos prochains événements
- Lisez le prochain article de la série Données démystifiées sur la manière d’éviter le piège du battage médiatique autour de l’IA




