Kurs
Histogramme werden in der Datenanalyse häufig verwendet, um die Verteilung eines Datensatzes grafisch darzustellen. So lässt sich erkennen, wie sich Daten über verschiedene Werte verteilen – und Muster, Trends sowie Auffälligkeiten werden sichtbar.
Dieser Artikel führt dich in Häufigkeitshistogramme ein und zeigt dir Schritt für Schritt, wie du eines erstellst. Außerdem lernst du verschiedene Histogramm-Typen kennen, beliebte Technologien zu ihrer Erstellung, typische Fehler, die du vermeiden solltest, und Best Practices.
Was ist ein Häufigkeitshistogramm?
Ein Häufigkeitshistogramm ist eine grafische Darstellung der Verteilung eines Datensatzes. Ein Histogramm besteht aus sogenannten Klassen (Bins), also Intervallen, die den Wertebereich der Daten abdecken. Jede Klasse hat eine Häufigkeit: die Anzahl der Datenpunkte in diesem Intervall. Die Klassen werden auf der Horizontalen, die Häufigkeiten auf der Vertikalen aufgetragen – es entsteht eine Balkendarstellung. Die Höhe eines Balkens entspricht der Häufigkeit in der jeweiligen Klasse.
Histogramme sind verbreitet, weil sie in der Datenanalyse mehrere zentrale Aufgaben erfüllen:
- Große Datensätze zusammenfassen: Bei großen Datenmengen liefern Histogramme eine klare, kompakte Übersicht. So erfasst du die Gesamtverteilung schnell, ohne dich in einzelnen Werten zu verlieren.
- Ausreißer erkennen: Histogramme machen die Verteilung sichtbar und erleichtern das Entdecken von Ausreißern – Datenpunkten, die stark vom Rest abweichen. Solche Ausreißer können auf Fehler, Anomalien oder relevante Phänomene hinweisen, die du weiter untersuchen solltest.
- Verteilungsmuster verstehen: Histogramme helfen, Muster wie Schiefe (Asymmetrie der Verteilung), Modalität (Anzahl der Gipfel) und Streuung (Wertebereich) zu erkennen. Dieses Verständnis ist für statistisches Modellieren entscheidend, da es die Modellauswahl und Annahmen beeinflusst.
- Vergleiche anstellen: Histogramme eignen sich auch, um verschiedene Datensätze zu vergleichen. Nebeneinander geplottet lassen sich Gemeinsamkeiten und Unterschiede der Verteilungen leicht erkennen – etwas, das in Rohdaten oft verborgen bleibt.
Da wir nun wissen, was Häufigkeitshistogramme sind und wofür sie in der Datenanalyse genutzt werden, erstellen wir als Nächstes eines anhand eines Beispiels.
So erstellst du ein Häufigkeitshistogramm
Stell dir vor, du sollst als Data Analyst die täglichen Verkaufszahlen eines Einzelhandelsgeschäfts für den vergangenen Monat analysieren.
Dein Ziel ist es, die Verteilung der Tagesumsätze zu verstehen, Muster zu erkennen, die Performance zu bewerten und Insights für Bestandsmanagement und Vertriebsstrategien zu liefern. Im Rahmen der Analyse entscheidest du, dass ein Histogramm hilfreiche Erkenntnisse liefern kann.
Folgende Schritte führen dich zu deinem Häufigkeitshistogramm:
Schritt 1: Datensatz zusammenstellen
Angenommen, du hast mit dem Datenteam gesprochen und die Daten aus den Vertriebsdatenbanken eurer Organisation abgerufen. Du hast sie wie unten in Tabellenform aufbereitet:
Sales-Datensatz. Bild: Autor.
Schritt 2: Klassen festlegen
Wähle als Nächstes geeignete Klassen basierend auf Wertebereich und Verteilung der Daten.
Nach der Analyse stellst du fest: Der kleinste Wert ist 20, der größte 135, und es gibt 30 Beobachtungen. Nach der Quadratwurzelregel (dazu später mehr) gilt: √30 ≈ 5,5 – sechs Klassen sind also sinnvoll. Die Spannweite 115 wird auf sechs Klassen verteilt, womit sich eine Klassenbreite von etwa 19 Einheiten ergibt.
Zur Einfachheit verwenden wir Klassenbreiten von 20 Einheiten:
- 20–39
- 40–59
- 60–79
- 80–99
- 100–119
- 120–139
Schritt 3: Häufigkeiten je Klasse berechnen
Zähle, wie viele Beobachtungen in jedes Intervall fallen, und trage sie wie unten zusammen:

Häufigkeiten je Klasse berechnen. Bild: Autor.
Schritt 4: Histogramm zeichnen
Zeichne eine horizontale Achse (x-Achse) für die Klassen und eine vertikale Achse (y-Achse) für die Häufigkeiten. Zeichne für jede Klasse einen Balken, dessen Höhe der Häufigkeit entspricht.
Dein Histogramm sollte in etwa so aussehen:
Histogramm plotten. Bild: Autor.
Schritt 5: Beschriften und formatieren
Beschrifte die x-Achse mit „Units Sold“ und die y-Achse mit „Frequency“. Füge einen Titel wie „Histogram of Daily Sales Data“ hinzu. Achte auf gleichmäßige Abstände und klar unterscheidbare Balken für eine gute Lesbarkeit.
So sollte das fertige Diagramm aussehen:

Beschriftung und Formatierung des Histogramms. Bild: Autor.
Fertig! Du hast das Häufigkeitshistogramm für deine Analyse erstellt.
Arten von Häufigkeitshistogrammen
Es gibt verschiedene Arten von Häufigkeitshistogrammen, die sich in der Darstellung leicht unterscheiden.
- Häufigkeitshistogramm: Das klassische Histogramm zeigt die absoluten Häufigkeiten der Datenpunkte in den definierten Klassen. Wie oben gesehen, hilft es, Verteilung und Ballung der Datenpunkte zu verstehen und ist die am häufigsten verwendete Variante.
- Relatives Häufigkeitshistogramm: Hier werden statt absoluter Zählungen die relativen Häufigkeiten (Anteile) pro Klasse dargestellt. Das ist besonders hilfreich, um Datensätze zu vergleichen, da die Daten normalisiert werden und sich Verteilungen mit unterschiedlichen Gesamtumfängen besser gegenüberstellen lassen.
- Kumulatives Häufigkeitshistogramm: Diese Variante zeigt die aufsummierten Häufigkeiten über den Wertebereich hinweg. Sie ist nützlich, um Perzentile zu identifizieren und kumulative Effekte zu verstehen.
Diese Varianten ermöglichen je nach Anwendung unterschiedliche Einblicke – es lohnt sich also, sie zu kennen.
Geeignete Technologien zur Erstellung von Häufigkeitshistogrammen
Auch wenn wir oben ein Histogramm manuell erstellt haben, kannst du es mit verschiedenen Tools und Technologien erzeugen – jeweils mit eigenen Stärken und Funktionen.
Beliebte Optionen sind:
- Microsoft Excel oder Google Sheets: Microsoft Excel ist eine weit verbreitete Tabellenkalkulation mit integrierten Diagrammtools. Google Sheets ist das cloudbasierte Pendant mit ähnlichen Möglichkeiten. Beide werden oft in Analyseprojekten eingesetzt und können Histogramme erstellen. Wie das geht, lernst du in unserem Tutorial „Visualizing Data in Excel“.
- PowerBI: PowerBI ist ein Business-Intelligence-Tool, mit dem du Daten visualisieren und Insights in der Organisation teilen kannst. Histogramme gehören zum Visualisierungsumfang. Der Kurs „Exploratory Data Analysis with PowerBI“ zeigt dir interaktiv, wie du Histogramme erstellst und weitere Analyseaufgaben löst.
- Python: Python, eine populäre Programmiersprache, bietet zahlreiche Visualisierungsbibliotheken wie matplotlib, seaborn und plotly, mit denen du Histogramme erstellen kannst. Der Kurs „Introduction to Data Science in Python“ führt hands-on in Histogramme und weitere Visualisierungen ein.
- R: R ist eine weitere verbreitete Data-Science-Sprache, die sich dank starker Analysefunktionen und Bibliotheken wie ggplot2 hervorragend für Histogramme eignet. Dieses sechsstufige Tutorial in R zeigt dir die Erstellung.
- Tableau: Tableau ist eine weitere BI-Software, mit der sich Rohdaten in interaktive, teilbare Dashboards verwandeln lassen – inklusive Histogrammen. Der Kurs „Analyzing Data in Tableau“ erklärt die Erstellung im Detail.
Natürlich ist diese Liste nicht vollständig – es gibt viele weitere Online-Tools für Histogramme. Probiere aus, was für dein Analyseprojekt am besten passt.
Häufige Fehler und Best Practices
Weil Histogramme als Grundlagenwerkzeug gelten, werden sie oft nie wirklich sauber gelernt – was schnell zu Fehlern führt. Hier sind typische Stolperfallen und wie du sie vermeidest:
1. Klassenbreite (und Anzahl der Klassen) wählen
Ungeeignete Klassenbreiten beeinflussen Darstellung und Aussagekraft eines Histogramms erheblich.
Zu breite Klassen fassen zu viele Datenpunkte zusammen und verschleiern wichtige Muster und Unterschiede. Feine Details gehen verloren.
Zu schmale Klassen decken sehr kleine Wertebereiche ab. Dadurch entstehen viele Klassen mit wenigen Beobachtungen – unnötige Detailfülle, die überfordert und Muster schwer erkennbar macht.
Uneinheitliche Klassenbreiten führen zu irreführenden Visualisierungen und erschweren die Interpretation.
Best Practices
Sorge zunächst für einheitliche Klassenbreiten im gesamten Histogramm. Diese Konsistenz erleichtert den Vergleich der Häufigkeiten.
Für die Wahl der Klassenbreite (und -anzahl) helfen Faustregeln:
- Quadratwurzelregel: Verwende als Anzahl der Klassen die Quadratwurzel der Beobachtungszahl. Bei 100 Datenpunkten also √100 = 10 Klassen. Das ist ein einfacher, meist praktikabler Startwert.
- Sturges’ Formel: Berechnet die Klassenanzahl in Abhängigkeit von der Beobachtungszahl und eignet sich besonders für größere Datensätze, um ein gutes Mittelmaß zu finden.
Sturges’ Regel. Quelle: Wikipedia
In der Praxis findest du die passende Klassenbreite oft iterativ. Starte mit einer Faustregel und justiere nach oben oder unten, bis das Histogramm klar und aussagekräftig ist.
2. Beschriftung und Skalierung
Ein häufiger Fehler ist, sich nur auf das Diagramm zu konzentrieren – und Beschriftungen sowie Skalen zu vernachlässigen.
Sind Achsen falsch oder unzureichend beschriftet, bleibt unklar, was dargestellt wird.
Beim Vergleich mehrerer Histogramme kann eine uneinheitliche y-Achsen-Skalierung den Eindruck verfälschen. Nutzt ein Diagramm 0 bis 100 und ein anderes 0 bis 50, sind Balkenhöhen nicht direkt vergleichbar – das kann zu falschen Schlüssen führen.
Auch innerhalb eines einzelnen Histogramms kann eine ungeeignete Skalierung täuschen. Beginnt die y-Achse nicht bei null oder sind Intervalle unregelmäßig, werden Unterschiede über- oder untertrieben – mit falschen Interpretationen als Folge.
Best Practices
Beschrifte x- und y-Achse klar und korrekt. Benenne genau, was dargestellt wird, und gib Einheiten an, falls relevant. Verwende einen aussagekräftigen Titel mit Kontext.
Nutze eine konsistente y-Achsen-Skala, insbesondere beim Vergleich mehrerer Histogramme. So spiegeln Balkenhöhen Häufigkeiten korrekt wider und Vergleiche bleiben sinnvoll. Lasse die y-Achse nach Möglichkeit bei null starten. Wenn das nicht praktikabel ist, gib den Startpunkt klar an und verwende gleichmäßige Intervalle.
3. Umgang mit Ausreißern
Ausreißer sind Datenpunkte, die deutlich außerhalb des Hauptclusters liegen und die Form der Verteilung beeinflussen. Ein häufiger Fehler ist, sie einfach auszublenden.
Das Entfernen kann das wahre Verteilungsbild verfälschen – etwa lange „Schwänze“ oder Schiefe verdecken. Ein Datensatz mit wenigen extrem hohen Werten wirkt mit Ausreißern schief, ohne sie hingegen scheinbar symmetrischer.
Zudem können Ausreißer wichtige Phänomene abbilden. In Verkaufsdaten könnte ein Ausreißer auf eine ungewöhnlich große Bestellung hinweisen – vielleicht durch eine erfolgreiche Kampagne oder einen Großeinkauf. Wer sie ignoriert, verpasst wertvolle Hinweise.
Best Practices
Beziehe Ausreißer in das Histogramm ein, um die Verteilung vollständig zu zeigen. Achte darauf, die y-Achse so zu skalieren, dass die Hauptdaten nicht „zusammengedrückt“ werden.
Wenn du Ausreißer aus triftigen Gründen ausschließt (z. B. Fehler, irrelevante Extremwerte), erkläre das transparent im Begleittext oder in der Legende. So bleibt deine Darstellung nachvollziehbar.
Wenn du diese Best Practices befolgst, vermittelt dein Histogramm die beabsichtigten Erkenntnisse und unterstützt die weiteren Analyseschritte in deinen Projekten.
Fazit
In diesem Artikel hast du Häufigkeitshistogramme, ihre Varianten und ihre Bedeutung für die Datenanalyse kennengelernt. Nach der manuellen Erstellung haben wir beliebte Tools und Technologien vorgestellt und typische Fehler samt Best Practices beschrieben.
Setze dein Wissen in die Praxis um: Erstelle und interpretiere Histogramme für verschiedene Datensätze, um Routine zu gewinnen. Übung in Analyseaufgaben und die Auswertung der Ergebnisse machen dich in der Datenanalyse wirklich souverän.
Viel Erfolg beim Lernen!
Als Senior Data Scientist konzipiere, entwickle und implementiere ich umfangreiche Machine-Learning-Lösungen, um Unternehmen dabei zu helfen, bessere datengestützte Entscheidungen zu treffen. Als Data-Science-Autorin teile ich Erfahrungen, Karrieretipps und ausführliche praktische Anleitungen.
Häufige Fragen
Wie bestimme ich die passende Anzahl an Klassen (Bins) für mein Histogramm?
Die passende Anzahl an Klassen lässt sich mit Faustregeln wie der Quadratwurzelregel oder Sturges’ Formel bestimmen. Passe die Anzahl abhängig von Kontext und Datensatz an, damit das Histogramm weder zu grob noch zu kleinteilig wird.
Warum sollte ich in meinem Histogramm einheitliche Klassenbreiten verwenden?
Einheitliche Klassenbreiten sind entscheidend, damit die Verteilung korrekt und vergleichbar dargestellt wird. Unterschiedliche Breiten verzerren das Bild, erschweren den Vergleich der Häufigkeiten und können zu Fehlinterpretationen führen.
Worin besteht der Unterschied zwischen einem Häufigkeitshistogramm und einem relativen Häufigkeitshistogramm?
Ein Häufigkeitshistogramm zeigt die absolute Anzahl der Datenpunkte je Klasse. Ein relatives Häufigkeitshistogramm stellt den Anteil der Datenpunkte an der Gesamtzahl dar. Relative Histogramme eignen sich gut für Vergleiche verschiedener Datensätze, da sie die Häufigkeiten normalisieren und Verteilungen mit unterschiedlichen Gesamtumfängen leichter vergleichbar machen.
Wie gehe ich in meinem Histogramm mit Ausreißern um?
Wenn du Ausreißer in deinem Histogramm berücksichtigst, erhältst du ein vollständiges Bild der Verteilung. Das Ausschließen kann dazu führen, dass der tatsächliche Wertebereich und die Varianz unterschätzt werden. Wenn du Ausreißer aus bestimmten Gründen entfernst, erkläre das klar und begründe es, um Transparenz und Vollständigkeit zu gewährleisten.



