Kurs
Als Teil des Data Literacy Month klärt diese Serie zentrale Begriffe aus der Datenwelt, beantwortet Fragen, die du dich vielleicht nicht zu stellen traust, und hat dabei auch noch Spaß. Wenn du am Anfang starten willst, lies den ersten Beitrag der Serie: What is a Dataset?

Schon mal den Satz „Correlation does not imply causation“ gehört? Dieser Denkfehler passiert Datenfans wie Profis gleichermaßen. In diesem Artikel schauen wir uns die wichtigsten Unterschiede zwischen Korrelation und Kausalität an, räumen mit Mythen auf und teilen Beispiele aus der Praxis – damit du einen der größten Fehler bei der Dateninterpretation vermeidest.
Was ist Korrelation?
Korrelation misst die Beziehung zwischen zwei Dingen. Steigt das eine, geht das andere dann mit nach oben oder nach unten? Das Streudiagramm unten zeigt Daten aus der American Community Survey 2017. Auf der x-Achse siehst du das durchschnittliche Jahreseinkommen in den 50 US-Bundesstaaten, auf der y-Achse die durchschnittlichen monatlichen Mietzahlungen. Mit steigendem Einkommen steigen auch die Mieten.

Jahreseinkommen im Vergleich zur durchschnittlichen Monatsmiete (in USD)
Wenn das eine steigt, während das andere ebenfalls steigt – wie hier –, spricht man von einer positiven Korrelation. Sinkt das eine, wenn das andere steigt, ist die Korrelation negativ.
In Statistik und Data Science ist Korrelation präziser definiert und bezeichnet die Stärke einer linearen Beziehung zwischen zwei Variablen. In der Variante des Streudiagramms unten wurde eine Gerade durch die Daten gelegt. Die Linie folgt den Punkten recht eng – ein Hinweis auf eine lineare Beziehung zwischen Einkommen und Miete.

Eine angepasste Linie zwischen den beiden Variablen zeigt eine positive Beziehung
Zum Vergleich: Im folgenden Beispiel mit dem klassischen diamonds-Datensatz steigt der Preis eines Diamanten mit dem Gewicht in Karat nicht linear. Legt man eine Ausgleichskurve an, siehst du, dass sie nach oben gekrümmt ist – der Preis wächst schneller als linear.

Die Korrelation erfasst zwar die positive Beziehung – mit mehr Gewicht steigt auch der Preis –, aber nicht den nichtlinearen Charakter dieser Beziehung.
Was ist Kausalität?
Kausalität ist eine stärkere Aussage als Korrelation. Sie bedeutet, dass Veränderungen einer Sache eine andere Sache verändern. In medizinischen Empfehlungen findet man viele Beispiele, etwa „Rauchen verursacht Krebs“ oder „Ibuprofen senkt das Schmerzempfinden“.
Auch im Alltag gibt es unzählige Kausalzusammenhänge: Gesunde Ernährung führt zu besseren Gesundheitsoutcomes, Training bringt dich in Form, und Lernen auf DataCamp führt dazu, dass du mehr über Daten weißt.
Der Korrelation-Kausalität-Fehlschluss
Vom Korrelation-Kausalität-Fehlschluss spricht man, wenn allein aus einer Korrelation fälschlicherweise auf eine Ursache-Wirkung-Beziehung geschlossen wird. Im Beispiel mit Einkommen und Miete zeigte sich, dass Mietzahlungen positiv mit dem Einkommen korrelieren. Ökonomische Zusammenhänge sind jedoch komplex, und die Daten reichen nicht aus, um die deutlich gewagtere Behauptung aufzustellen, höheres Einkommen verursache höhere Mieten.
Dieser Fehlschluss ist weit verbreitet – nicht zuletzt, weil Marketing dich gern glauben lässt, der Kauf ihres Produkts mache dein Leben besser, ohne die Mühe einer sauberen wissenschaftlichen Studie. Dieses Prinzip trieb The Tamperer in den 90ern auf die Spitze mit If you Buy This Record (Your Life Will Be Better). Eine Korrelation kann in drei Hauptfällen auftreten, ohne dass Kausalität vorliegt.
Zufällige Beziehung
Mit genügend Daten können zwei völlig unabhängige Größen korreliert erscheinen. Das folgende Beispiel stammt von Tyler Vigens hervorragender Seite Spurious Correlations. Die Liniendiagramme zeigen eine starke Korrelation zwischen der Scheidungsrate im US-Bundesstaat Maine und dem Margarineverbrauch pro Kopf.

Es wäre absurd zu glauben, mehr oder weniger Margarine zu essen könnte die Scheidungsrate eines Bundesstaats beeinflussen – Kausalität können wir hier also ausschließen. Die Korrelation ist rein zufällig.
Auch Anleger sind nicht immun gegen solche Trugschlüsse. Der Super Bowl Indicator suggeriert, der Aktienmarkt steige, wenn ein Team der National Football Conference den Super Bowl gewinnt; sie falle, wenn ein Team der American Football Conference siegt.
Verzerrende Drittvariable
Korrelationen können entstehen, wenn eine dritte Größe (eine „verzerrende Variable“) sowohl die vermeintliche Ursache als auch die vermeintliche Wirkung beeinflusst.
Ein Klassiker: Sonnenbrände korrelieren mit dem Verkauf von Eiscreme. Daraus zu schließen, Eisessen verursache mehr Sonnenbrände, wäre unsinnig. Plausibler ist: Bei heißem, sonnigem Wetter essen Menschen eher Eis – und gehen auch eher in die Sonne. Das Wetter ist die verzerrende Variable.
Im Jahr 2001 stellte eine wissenschaftliche Arbeit fest, dass Personen mit viel Gemüse- und Olivenölkonsum weniger Falten haben. Eine valide Beobachtung – aber Ben Goldacre merkte in einem TED Talk an, dass Ernährungsberater daraus vorschnell schlossen, Olivenölessen führe zu weniger Falten. Dabei wurden mehrere Störfaktoren ignoriert: Olivenöl ist teurer als andere Öle; wer es sich leisten kann, hat eher einen Bürojob mit weniger Sonne und raucht seltener – ganz zu schweigen von Hunderten weiterer Lebensstilunterschiede, die die Studie nicht erfasst.
Umgekehrte Kausalität
Von umgekehrter Kausalität spricht man, wenn Ursache und Wirkung verwechselt werden. Ein albernes Beispiel: Wenn Windräder sich schneller drehen, misst man auch höhere Windgeschwindigkeiten – also folgert man, Wind werde durch drehende Windräder verursacht. Denkt man kurz nach, ist klar: Der Wind lässt die Räder drehen, nicht umgekehrt.
Die Richtung der Kausalität zu verstehen, ist in der medizinischen Datenanalyse ein häufiges Problem. Es gibt zum Beispiel eine positive Korrelation zwischen Depression und Cannabiskonsum: Depressive Menschen rauchen häufiger Cannabis. Diese Studie fand 2016 um 216% höhere Chancen für Beinahe-Tageskonsum bei Menschen mit Depression im Vergleich zu nicht Depressiven.
Es gibt viel Debatte darüber, was was verursacht: Führt Cannabiskonsum zu Depressionen – oder erhöht Depression die Wahrscheinlichkeit, Cannabis zu konsumieren? Diese Arbeit legt nahe, dass Kausalität in beide Richtungen wirken kann. Es gibt Hinweise, dass Cannabiskonsum Depressionen auslösen kann; starke Evidenz spricht jedoch für die inverse Assoziation, also dass Depression zu Beginn oder Häufung des Konsums führt.
Was brauchst du, um Kausalität nachzuweisen?
Kausalität festzustellen, ist oft schwerer als gedacht. Dafür brauchst du vier Dinge.
- Korrelation: Eine Korrelation garantiert keine Kausalität, ist aber Voraussetzung. Ohne Korrelation keine kausale Beziehung.
- Zeitliche Abfolge: Die vermutete Ursache muss vor der beobachteten Wirkung eintreten.
- Mechanismus: Es braucht eine plausible Erklärung, wie die Ursache zur Wirkung führt.
- Kontrolle von Störvariablen: Mögliche verzerrende Variablen müssen durch sauberes Studiendesign, Datenerhebung und statistische Methoden kontrolliert werden.
Beobachtungs- und Experimentierstudien
Um Beziehungen zwischen Variablen zu untersuchen, gibt es zwei Studientypen.
- Beobachtungsstudien erheben Daten, ohne die Entstehung der Daten zu beeinflussen. Die oben genannte Olivenöl-Studie ist ein Beispiel: Sie hat die Ernährungsweisen erfasst, ohne vorzuschreiben, wer mit Olivenöl kochen muss und wer nicht.
- Experimente ordnen Personen per Zufall verschiedenen „Behandlungen“ zu. Das ist typisch in der Medikamentenprüfung, wo einige das echte Präparat und andere ein Placebo erhalten.
Beobachtungsstudien erschweren oder verhindern meist den Nachweis von Kausalität. Korrekt geplante und durchgeführte Experimente erlauben dagegen kausale Schlussfolgerungen. Mehr dazu findest du im nächsten Teil von Data Demystified zum Thema A/B-Testing.
Mehr lernen?
Der Korrelation-Kausalität-Fehlschluss ist umfassend untersucht und einer der größten Stolpersteine zu Beginn deiner Datenweiterbildung. Merke dir:
- Korrelation misst die Beziehung zwischen zwei Variablen.
- Aus Korrelation lässt sich nicht automatisch auf Kausalität schließen.
- Um Kausalität zu bestimmen, brauchst du ein Experiment.
Wenn du deine Fähigkeiten aufs nächste Level bringen willst, starte mit Introduction to Statistics und beginne deine Reise zur Datenkompetenz. Der nächste Beitrag der Serie „Data Demystified“ vertieft das Thema Experimente mit Fokus auf A/B-Testing. Bis dahin empfehlen wir diese Ressourcen:
Korrelation vs. Kausalität: Häufige Fragen
Kann es Kausalität ohne Korrelation geben?
Nein, Kausalität kann nicht ohne Korrelation bestehen. Damit eine Variable eine andere verursacht, muss es eine Beziehung zwischen ihnen geben. Korrelation ist eine notwendige, aber keine hinreichende Bedingung für Kausalität. Gibt es keine Korrelation, ist es äußerst unwahrscheinlich, dass das eine das andere verursacht.
Wie unterscheide ich in meinen Daten zwischen Korrelation und Kausalität?
Um zwischen Korrelation und Kausalität zu unterscheiden, reicht einfache Datenanalyse nicht aus. Prüfe zunächst, ob eine Korrelation zwischen den Variablen besteht. Untersuche dann drei Schlüsselelemente: (1) eine zeitliche Abfolge (die Ursache muss vor der Wirkung liegen), (2) einen plausiblen Mechanismus, der erklärt, wie die Ursache zur Wirkung führt, und (3) die Kontrolle möglicher Störvariablen durch Studiendesign oder fortgeschrittene statistische Methoden.
Welche Methoden kann ich nutzen, um Kausalität zu testen?
Am besten lässt sich Kausalität durch Experimente testen, etwa randomisierte kontrollierte Studien (RCTs), in denen Probanden zufällig Gruppen und Behandlungen zugeteilt werden. A/B-Tests sind eine gängige Methode im Business-Kontext. Zusätzlich kannst du statistische Verfahren wie Regressionsanalyse, Granger-Kausalitätstests oder Strukturgleichungsmodelle nutzen, um aus Beobachtungsdaten auf Kausalität zu schließen – diese sind jedoch weniger schlüssig als gut konzipierte Experimente.
Ist es möglich, dass zwei Dinge korrelieren, ohne in direktem Zusammenhang zu stehen?
Ja, zwei Dinge können aufgrund von Störvariablen korreliert sein, ohne direkt miteinander zusammenzuhängen. Ein dritter Faktor kann beide Variablen beeinflussen und so den Anschein einer direkten Beziehung erwecken. Beispiel: Eisverkäufe und Sonnenbrände korrelieren, aber die eigentliche Ursache für beides ist warmes Wetter – nicht der Eisverzehr.
Was ist eine Scheinkorrelation?
Von Scheinkorrelation spricht man, wenn zwei Variablen zusammenhängen zu scheinen, ohne dass es eine sinnvolle Verbindung gibt. Solche Zusammenhänge sind oft zufällig und können in die Irre führen, wenn sie nicht sorgfältig analysiert werden. Beispiel: Die Scheidungsrate in Maine korrelierte mit dem Margarineverbrauch pro Kopf – offensichtlich ohne inhaltlichen Zusammenhang.