Weiter zum Inhalt

Data Demystified: Ein Überblick über die beschreibende Statistik

Im fünften Teil von Data Demystified geben wir einen Überblick über die Grundlagen der beschreibenden Statistik, einem der Kernbereiche der Data Science.
Aktualisiert 18. Sept. 2026  · 6 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Willkommen zu Teil fünf unserer einmonatigen Serie Data Demystified. Im Rahmen des Data Literacy Month klärt diese Serie zentrale Konzepte aus der Datenwelt, beantwortet Fragen, die du dich vielleicht nie zu stellen getraut hast, und macht dabei Spaß. Wenn du am Anfang starten willst, lies den ersten Teil der Serie: What is a Dataset?

Ein Überblick über die beschreibende Statistik

In diesem Beitrag tauchen wir tief in die beschreibende Statistik ein, einen der Grundpfeiler der Data Science. 

Was ist beschreibende Statistik?

Beschreibende Statistik ist das zentrale Werkzeug der deskriptiven Analytik, eine der vier Arten von Analytics. Um beschreibende Statistik zu verstehen, hilft es, zuerst den Begriff Variable zu klären. 

Eine Variable ist eine Größe, die man messen oder zählen kann. Bei einer Gruppe von Menschen könntest du zum Beispiel die Körpergröße jeder Person messen. Das wäre eine Variable. Genauso könntest du zählen, wie viele Personen welche Haarfarbe haben – auch Haarfarbe ist eine Variable.

Beschreibende Statistiken sind Kennzahlen, die Variablen zusammenfassen. Solche Kennzahlen sind so allgegenwärtig, dass sich mehrere Bezeichnungen eingebürgert haben: „Summary Statistics“ oder „Aggregationen“ meinen dasselbe wie beschreibende Statistiken.

In den nächsten Abschnitten stellen wir die wichtigsten Techniken der beschreibenden Statistik vor – alle entnommen aus unserem Introduction to Statistics-Kurs. 

Zählungen und Anteile

Bei kategorialen Variablen – also Daten, die aus klar abgegrenzten Gruppen wie Haarfarben bestehen – fasst man am natürlichsten zusammen, indem man zählt oder über Anteile spricht. 

Beispiel: Vier Personen hatten schwarze Haare, zwei braune, zwei blonde, eine rothaarige Person und eine Person mit grauen Haaren. Alternativ kannst du sagen: 40% hatten schwarze Haare, 20% braune, 20% blonde, 10% rote und 10% graue Haare. 

Haarfarbe

Anzahl

Anteil

Schwarz

4

40%

Braun

2

20%

Blond

2

20%

Rot

1

10%

Grau

1

10%

Lageparameter

Lageparameter, umgangssprachlich oft als Durchschnitte bezeichnet, fassen Daten zusammen, indem sie einen Wert liefern, der die Mitte der Verteilung beschreibt. Das sind die gängigsten Lageparameter. 

Modus

Der Modus ist der am einfachsten zu berechnende Durchschnitt: Es ist der am häufigsten vorkommende Wert. Im Haarfarbenbeispiel ist Schwarz am häufigsten, also ist der Modus „Schwarz“.

Arithmetischer Mittelwert

Der bekannteste Durchschnitt ist der arithmetische Mittelwert. Wenn man im Alltag vom „Durchschnitt“ spricht, ist normalerweise dieser gemeint. 

Die Formel: Alle Werte addieren und durch die Anzahl der Werte teilen. Hast du zum Beispiel die Körpergröße von 10 Personen, addierst du alle Größen und teilst durch 10. 

Eine Stärke (und wie wir gleich sehen auch eine Schwäche) des Mittels ist, dass jeder Datenpunkt in die Berechnung eingeht. Es nutzt also die maximal verfügbare Information.

Es gibt weitere Mittelwerte mit speziellen Anwendungsfällen, etwa das geometrische und das harmonische Mittel.

Median

Der Median wird berechnet, indem man die Werte vom kleinsten zum größten sortiert und den mittleren Wert nimmt. 

Im Größenbeispiel sortierst du die Größen aufsteigend und wählst den mittleren Punkt der Verteilung – hier den fünften Wert. Der Median gilt als „robuste“ Kennzahl, da er sich kaum ändert, wenn ein einzelner Wert stark abweicht. 

Zur Veranschaulichung: Kommt ein extrem großer oder kleiner Messwert hinzu, ändert sich der arithmetische Mittelwert deutlich, weil Ausreißer ihn stark beeinflussen. Der Median hingegen variiert nur wenig, weil sich die mittlere Position kaum verschiebt.  

Weitere Lagekennzahlen

Manchmal ist ein Mittelwert keine hilfreiche Zusammenfassung. Vielleicht interessieren dich Minimum (kleinster Wert) oder Maximum (größter Wert). Solche Kennzahlen zur Größe der Werte nennt man Lagekennzahlen.

Eine weitere wichtige Lagekennzahl ist das Perzentil. Dabei teilt man die Daten über Schwellenwerte in 100 gleich große Teile. Das 100. Perzentil entspricht dem Maximum, das 50. dem Median. Bei nur 10 Datenpunkten, wie im Größenbeispiel, sind Perzentile weniger aussagekräftig, bei größeren Datensätzen jedoch sehr nützlich. 

Eine Variante sind Quartile, bei denen die Daten in vier statt in 100 Teile aufgeteilt werden.

Streuungsmaße

Oft interessiert weniger die Größe der Werte als deren Unterschiedlichkeit. Beschreibende Statistiken, die diese Unterschiedlichkeit messen, heißen Streuungs- oder Variationsmaße.

Spannweite

Das einfachste Streuungsmaß ist die Spannweite: Maximum minus Minimum. Im Größenbeispiel also die größte minus die kleinste gemessene Körpergröße. 

Varianz

Die Varianz ist ein technischeres Streuungsmaß, das häufig zusammen mit dem arithmetischen Mittel verwendet wird. Sie berechnet sich als Summe der quadrierten Abstände jedes Werts vom Mittelwert, geteilt durch eins weniger als die Anzahl der Datenpunkte.

Zur Veranschaulichung betrachten wir ein noch einfacheres Beispiel mit vier Körpergrößen, wie in der Tabelle unten.

Name

Größe

Isabella Leslie-Miller

158

Valeria Kogan-Higgs

172

Hadrien Lacroix

177

Sara Billen

183

Der arithmetische Mittelwert der Größen beträgt hier 172,5 cm (Summe der Größen geteilt durch 4). 

In diesem Beispiel wäre die Varianz 

((158 - 172,5) ^ 2 + (172 - 172,5) ^ 2 + (177 - 172,5) ^ 2 + (183 - 172,5) ^ 2) / (4 - 1) = 113 cm2.

Wie beim Mittelwert gilt: Weil jeder Datenpunkt in die Berechnung einfließt, ist die Kennzahl sehr aussagekräftig, kann sich aber bei Datenänderungen auch stark verändern.

Korrelation

Korrelation misst den linearen Zusammenhang zwischen zwei Variablen. Steigt die eine Variable, steigt oder fällt dann die andere? Es gibt mehrere Verfahren zur Berechnung, der Wert liegt jedoch immer zwischen minus eins und eins. 

Für zwei Variablen X und Y gilt folgende Interpretation:

Korrelationswert

Interpretation

-1

Wenn X steigt, fällt Y. Je näher an -1, desto stärker der Zusammenhang. 

Zwischen -1 und 0

Wenn X steigt, fällt Y. Je näher an 0, desto schwächer der Zusammenhang. 

0

Es gibt keinen linearen Zusammenhang zwischen X und Y, also keine Korrelation.

Zwischen 0 und 1

Wenn X steigt, steigt Y. Je näher an 0, desto schwächer der Zusammenhang. 

1

Wenn X steigt, steigt Y. Je näher an 1, desto stärker der Zusammenhang. 

Wichtig: Korrelation erfasst keine nichtlinearen Effekte. Haben X und Y keinen annähernd geradlinigen Zusammenhang, ist der Korrelationswert möglicherweise wenig aussagekräftig.

Du willst mehr lernen?

Wir hoffen, dir hat dieser kurze Einstieg in die beschreibende Statistik gefallen. Im nächsten Teil gehen wir tiefer auf Korrelation ein. Konkret schauen wir uns an, woher das Sprichwort Correlation does not imply causation kommt und wie du diese Falle vermeidest.

Themen
Datenkompetenz

Kurse zur Datenkompetenz

Kurs

Einführung in die Statistik

4 Std.
159.8K
In diesem Kurs bekommst du einen Überblick über Maßzahlen für Zentrum und Streuung, Wahrscheinlichkeitsverteilungen und Hypothesentests.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow