Cours
Les histogrammes sont couramment utilisés en analyse de données pour représenter graphiquement la distribution d'un jeu de données. Ils permettent de visualiser la répartition des valeurs et d'identifier des motifs, des tendances et des anomalies.
Cet article présente les histogrammes de fréquences et vous guide pas à pas pour en créer un. Nous verrons également les différents types d'histogrammes, quelques technologies populaires pour les réaliser, les erreurs fréquentes à éviter et les bonnes pratiques à adopter.
Qu'est-ce qu'un histogramme de fréquences ?
Un histogramme de fréquences est une représentation graphique de la distribution d'un jeu de données. Il est construit à partir d'une série de classes (ou intervalles) qui couvrent l'étendue des données. Chaque classe est associée à une fréquence, c'est-à-dire le nombre d'observations appartenant à cet intervalle. Les classes sont reportées sur l'axe horizontal et les fréquences sur l'axe vertical, ce qui donne un graphique en barres. La hauteur de chaque barre correspond au nombre d'observations dans la classe.
Les histogrammes sont répandus car ils remplissent plusieurs fonctions essentielles en analyse de données :
- Résumer de grands volumes de données : Face à des jeux de données volumineux, les histogrammes offrent une synthèse claire et lisible, permettant d'appréhender rapidement la distribution d'ensemble sans se perdre dans le détail point par point.
- Détecter les valeurs aberrantes : En visualisant la distribution, les histogrammes facilitent l'identification des valeurs aberrantes — des points très éloignés du reste des données. Elles peuvent révéler des erreurs, des anomalies ou des phénomènes notables qui méritent une analyse plus poussée.
- Comprendre les formes de distribution : Les histogrammes aident à repérer l'asymétrie (skewness), la multimodalité (nombre de pics) et la dispersion (étendue). Ces éléments sont cruciaux pour le choix des modèles et des hypothèses statistiques.
- Comparer des jeux de données : Placés côte à côte, les histogrammes permettent de comparer visuellement des distributions et de mettre au jour des similitudes ou différences invisibles dans les données brutes.
Maintenant que nous avons défini les histogrammes de fréquences et leur rôle en analytics, voyons comment en créer un à partir d'un exemple.
Comment créer un histogramme de fréquences
Imaginez que, en tant qu'analyste de données, vous deviez analyser les ventes quotidiennes d'un magasin sur le dernier mois.
Votre objectif est de comprendre la distribution des ventes quotidiennes pour déceler des motifs, évaluer la performance et fournir des insights utiles à la gestion des stocks et aux stratégies commerciales. Dans ce cadre, vous décidez d'utiliser un histogramme pour faire émerger des enseignements.
Voici les étapes à suivre pour construire votre histogramme de fréquences :
Étape 1 : recueillir votre jeu de données
Supposons que vous ayez travaillé avec l'équipe data de votre organisation pour extraire les données des bases de ventes. Vous avez organisé ces données dans un tableau comme ci-dessous :
Jeu de données de ventes. Image de l'auteur.
Étape 2 : déterminer les classes
Choisissez ensuite des classes adaptées en fonction de l'étendue et de la distribution des données.
Après analyse, vous constatez que la plus petite valeur est 20, la plus grande 135, et que vous avez 30 observations. En appliquant la règle de la racine carrée (nous y reviendrons), √30 ≈ 5,5, vous pouvez retenir six classes. Il faut donc diviser une étendue de 115 en six classes, ce qui donne une largeur de classe d'environ 19 unités.
Pour simplifier, utilisons des classes de 20 unités :
- 20–39
- 40–59
- 60–79
- 80–99
- 100–119
- 120–139
Étape 3 : calculer les fréquences par classe
Comptez le nombre d'observations dans chaque intervalle et dressez le tableau comme ci-dessous :

Calcul des fréquences par classe. Image de l'auteur.
Étape 4 : tracer l'histogramme
Tracez une ligne horizontale (axe des x) pour les classes et une ligne verticale (axe des y) pour les fréquences. Pour chaque classe, dessinez une barre dont la hauteur correspond à la fréquence.
Votre histogramme devrait ressembler à ceci :
Tracé de l'histogramme. Image de l'auteur.
Étape 5 : ajouter les libellés et mettre en forme
Intitulez l'axe des x « Unités vendues » et l'axe des y « Fréquence ». Ajoutez un titre comme « Histogramme des ventes quotidiennes ». Veillez à ce que les barres soient bien espacées et distinctes pour une lecture claire.
Le diagramme final devrait ressembler à ceci :

Libellage et mise en forme de l'histogramme. Image de l'auteur.
Et voilà ! Vous avez construit l'histogramme de fréquences pour votre analyse.
Les différents types d'histogrammes de fréquences
Il existe plusieurs variantes d'histogrammes de fréquences, qui se distinguent par la façon de représenter les données.
- Histogramme de fréquences (absolues) : l'histogramme classique affiche le nombre d'observations dans chaque classe. Comme nous l'avons vu, il permet de comprendre la distribution et la concentration des données et c'est le type le plus courant.
- Histogramme de fréquences relatives : au lieu des comptes absolus, il affiche la proportion d'observations par classe par rapport au total. Il est particulièrement utile pour comparer plusieurs jeux de données, car il normalise les effectifs et facilite la comparaison de distributions de tailles différentes.
- Histogramme de fréquences cumulées : il présente les totaux cumulés, ce qui aide à visualiser comment les fréquences s'accumulent sur l'étendue des données. Pratique pour identifier des percentiles et comprendre l'effet cumulé.
Selon vos cas d'usage, ces variantes permettent de mettre au jour des insights différents ; connaître leur existence est donc précieux.
Technologies adaptées pour créer des histogrammes de fréquences
Même si nous avons vu comment en créer un à la main, de nombreux outils et technologies permettent de générer des histogrammes avec des fonctionnalités variées.
Voici quelques solutions populaires :
- Microsoft Excel ou Google Sheets : Excel est un tableur largement utilisé, doté d'outils de visualisation intégrés. Google Sheets est son pendant cloud, avec des capacités similaires. Les deux permettent de créer des histogrammes. Vous pouvez apprendre à les réaliser avec notre tutoriel Visualizing Data in Excel.
- PowerBI : PowerBI est un outil de business intelligence qui facilite la visualisation des données et le partage d'insights au sein de l'organisation. Les histogrammes font partie de ses visualisations. Le cours Exploratory Data Analysis with PowerBI vous apprendra à créer des histogrammes de façon interactive et à réaliser d'autres analyses.
- Python : Langage polyvalent très populaire, Python propose de nombreuses bibliothèques de visualisation (matplotlib, seaborn, plotly, etc.) pour créer des histogrammes. Le cours Introduction to Data Science in Python détaille pas à pas la création d'histogrammes (et d'autres graphiques).
- R : Autre langage phare de la data science, R est particulièrement adapté aux histogrammes grâce à ses capacités d'analyse avancées et à ses bibliothèques de visualisation comme ggplot2. Ce tutoriel en six étapes sous R vous guide pour en construire.
- Tableau : Logiciel de BI très répandu, Tableau permet de transformer des données brutes en tableaux de bord interactifs et partagés, y compris des histogrammes. Le cours Analyzing Data in Tableau couvre en détail leur création.
Bien sûr, la liste n'est pas exhaustive : de nombreux autres outils en ligne existent. N'hésitez pas à explorer et à adopter celui qui répond le mieux aux besoins de votre projet analytique.
Erreurs fréquentes et bonnes pratiques
Parce que l'histogramme est perçu comme un diagramme « de base », on l'apprend rarement de façon formelle, ce qui mène à des erreurs. Voici les pièges courants et comment les éviter :
1. Choisir la largeur des classes (et le nombre de classes)
Des largeurs de classes inadaptées peuvent fortement affecter l'allure et la justesse de l'histogramme.
Des classes trop larges regroupent trop d'observations et masquent des motifs importants. Les détails fins de la distribution deviennent difficiles à percevoir.
À l'inverse, des classes trop étroites couvrent un intervalle minime et génèrent beaucoup de barres avec peu d'observations, surchargeant la lecture et rendant les tendances difficiles à discerner.
Des tailles de classes incohérentes faussent la visualisation et compliquent l'interprétation.
Bonnes pratiques
Commencez par garantir une largeur identique pour toutes les classes. Cette cohérence facilite la comparaison des fréquences entre intervalles.
Plusieurs règles aident à déterminer une largeur (et un nombre) de classes pertinents :
- Règle de la racine carrée : utiliser la racine carrée du nombre d'observations comme nombre de classes. Par exemple, pour 100 observations, √100 = 10 classes. Une approche simple et souvent efficace.
- Formule de Sturges : calcule le nombre de classes en fonction du nombre d'observations. Utile pour des jeux de données importants, elle offre un bon compromis entre trop peu et trop de classes.
Formule de Sturges. Source : Wikipedia
En pratique, la meilleure largeur de classe se trouve souvent par itérations. Démarrez avec une règle simple, puis ajustez à la hausse ou à la baisse en évaluant la lisibilité et la richesse des informations.
2. Libellés et échelles
L'attention se porte parfois uniquement sur le diagramme, au détriment des libellés et des échelles.
Des axes mal ou insuffisamment renseignés empêchent de comprendre ce que représente l'histogramme.
Lorsqu'on compare plusieurs histogrammes, des échelles de l'axe des y différentes faussent la comparaison. Si l'un va de 0 à 100 et l'autre de 0 à 50, les hauteurs ne sont pas comparables, ce qui peut induire en erreur.
Au sein d'un même histogramme, une échelle incohérente peut également déformer la perception. Si l'axe des y ne commence pas à zéro ou utilise des intervalles irréguliers, les différences entre classes peuvent paraître exagérées ou minimisées.
Bonnes pratiques
Renseignez clairement les axes x et y, en précisant l'unité si nécessaire. Ajoutez un titre descriptif qui contextualise l'histogramme.
Utilisez une échelle cohérente pour l'axe des y, notamment lors de comparaisons. Idéalement, commencez à zéro pour refléter fidèlement la distribution. Si ce n'est pas possible, indiquez clairement le point de départ et conservez des intervalles réguliers.
3. Gestion des valeurs aberrantes
Les valeurs aberrantes sont des observations très éloignées du cœur de la distribution et influencent sa forme. L'erreur classique consiste à les exclure systématiquement.
Les supprimer peut masquer la réalité de la distribution, par exemple une longue traîne ou une asymétrie. Un jeu avec quelques valeurs très élevées peut sembler asymétrique si on les conserve, mais paraître symétrique si on les écarte.
Parfois, ces valeurs traduisent des phénomènes importants. Dans des ventes, une valeur extrême peut révéler une commande exceptionnelle liée à une campagne ou un achat en gros. Les ignorer, c'est risquer de passer à côté d'informations clés.
Bonnes pratiques
Incluez les valeurs aberrantes pour offrir une vue complète de la distribution, en veillant à choisir une échelle de l'axe des y qui les prenne en compte sans écraser le reste.
Si vous décidez de les exclure (erreurs, valeurs extrêmes non pertinentes, etc.), expliquez-le clairement dans le texte ou la légende pour assurer transparence et compréhension.
En appliquant ces bonnes pratiques, votre histogramme transmettra les bons messages et vous aidera dans les analyses en aval.
Conclusion
Cet article vous a présenté les histogrammes de fréquences, leurs variantes et leur importance en analytics. Après une construction manuelle, nous avons listé quelques outils et technologies pour les créer, puis passé en revue les erreurs fréquentes et les bonnes pratiques.
Nous vous invitons à mettre vos compétences en pratique en créant et interprétant des histogrammes sur plusieurs jeux de données pour gagner en aisance. Répéter les analyses et confronter les résultats vous aidera à progresser en analyse de données.
Bonne continuation !
En tant que data scientist senior, je conçois, développe et déploie des solutions d'apprentissage automatique à grande échelle pour aider les entreprises à prendre de meilleures décisions basées sur les données. En tant que rédacteur spécialisé dans la science des données, je partage mes apprentissages, mes conseils de carrière et des tutoriels pratiques approfondis.
Foire aux questions
Comment déterminer le bon nombre de classes pour mon histogramme ?
Le nombre de classes approprié peut être déterminé à l'aide de repères tels que la règle de la racine carrée ou la formule de Sturges. Ajustez ensuite en fonction du contexte et du jeu de données pour éviter un histogramme trop simplifié ou trop complexe.
Pourquoi dois-je utiliser des largeurs de classes cohérentes dans mon histogramme ?
Des largeurs de classes cohérentes sont essentielles pour représenter fidèlement la distribution. Des largeurs variables faussent la lecture, compliquent la comparaison des fréquences entre classes et peuvent conduire à de mauvaises interprétations.
Quelle est la différence entre un histogramme de fréquences et un histogramme de fréquences relatives ?
Un histogramme de fréquences affiche le nombre absolu d'observations par classe, tandis qu'un histogramme de fréquences relatives montre la proportion d'observations par rapport au total. Les fréquences relatives sont utiles pour comparer des jeux de données de tailles différentes en normalisant les effectifs.
Comment gérer les valeurs aberrantes dans mon histogramme ?
Inclure les valeurs aberrantes dans l'histogramme offre une vision complète de la distribution. Les exclure peut conduire à mal estimer l'étendue et la variabilité. Si vous choisissez de les retirer pour des raisons précises, expliquez clairement votre choix afin d'assurer transparence et compréhension.
