Weiter zum Inhalt

Scheinkorrelation: Eine wichtige statistische Falle (und wie du sie vermeidest)

Zu wissen, warum Scheinkorrelationen entstehen – von Konfoundern bis Stichprobenverzerrung – trennt echte Erkenntnisse vom Zufallstreffer.
Aktualisiert 29. Juli 2026  · 9 Min. lesen

Mit KI erkunden

In ChatGPT öffnenIn Claude öffnenIn Perplexity öffnen

In Statistik und Machine Learning ist ein Muster nicht automatisch eine Antwort.

Du hast sicher die Grafik gesehen, die Eiscreme-Verkäufe mit Ertrinkungsraten verknüpft, oder die Verbindung zwischen Nicolas‑Cage‑Filmen und Todesfällen in Schwimmbädern. Solche Beispiele bleiben im Kopf und zeigen klar: Korrelation ist nicht Kausalität. Sie sind aber so überstrapaziert, dass dabei untergeht, warum das Thema in deiner Arbeit wirklich zählt.

Unter einer Scheinkorrelation versteht man einen scheinbaren Zusammenhang zwischen zwei Variablen, der nicht auf einer echten Beziehung beruht. Er entsteht zufällig oder durch eine versteckte Variable, die du nicht erfasst. Wenn du das als wertvolle Information behandelst, jagst du Mustern hinterher, die keinen Sinn ergeben und sich nicht in die Praxis übersetzen lassen.

In diesem Artikel zeige ich dir, warum Scheinkorrelationen entstehen, wie du sie erkennst und wie du verhinderst, darauf Entscheidungen zu stützen.

Aber was ist Korrelation überhaupt? Lies unseren Blogpost Beziehungen in Daten messen, um die verschiedenen Korrelationskoeffizienten und ihre Anwendungen kennenzulernen.

Was ist eine Scheinkorrelation?

Eine Scheinkorrelation ist ein scheinbarer statistischer Zusammenhang zwischen zwei Variablen, der nicht auf einer echten Verbindung zwischen ihnen beruht.

Der Korrelationswert selbst ist real. Die Analyse liefert einen Wert, der sinnvoll aussieht. An der Berechnung ist nichts falsch oder ausgedacht – und genau das ist das Problem.

Es fehlt die Kausalität.

Keine der Variablen bewirkt die andere. Sie können sich gemeinsam bewegen – aus Gründen, die nichts miteinander zu tun haben, oder ganz ohne Grund. Diese Lücke zwischen dem, was die Daten zeigen, und dem, was tatsächlich passiert, ist der Kern von Scheinkorrelation.

Warum Scheinkorrelationen entstehen

Scheinkorrelationen lassen sich fast immer durch einige Mechanismen erklären. Wenn du weißt, worauf du achten musst, vertraust du Korrelationen nicht mehr blind.

Konfundierende Variablen

Ein Confounder ist eine versteckte Variable, die beide gemessenen Größen beeinflusst.

Nimm das klassische Beispiel Eiscreme und Ertrinken. Eiscreme-Verkäufe verursachen keine Ertrinkungsfälle. Heißes Wetter treibt beides – mehr Menschen kaufen Eis und mehr gehen schwimmen, wodurch mehr Ertrinkungsfälle auftreten.

Die Temperatur ist hier der Confounder. Wenn sie nicht erfasst wird, übersiehst du sie schnell.

Zufall

Manchmal bewegen sich zwei Variablen ohne jeden Grund gemeinsam.

Wenn du genug Vergleiche über viele Datensätze hinweg anstellst, werden manche rein zufällig übereinstimmen. So entsteht die Korrelation zwischen Nicolas Cage und Pool-Ertrinkungen – zwei unabhängige Zeitreihen, die über Jahre hinweg zufällig gleich liefen.

Mit genügend Variablen ist ein gewisser Anteil zufälliger Übereinstimmungen zu erwarten.

Einige Variablen entwickeln sich über die Zeit ähnlich, und diese Überlappung wirkt wie ein Zusammenhang – selbst wenn keiner besteht.

Denk an Bevölkerungszahl, BIP, Internetnutzung oder Kunststoffproduktion. Vieles davon wächst seit Jahrzehnten. Vergleichst du beliebige zwei davon, erhältst du eine starke Korrelation – schlicht, weil beide steigen.

Gemeinsam ist nur die Richtung; zwischen den Variablen selbst besteht keine Verbindung.

Stichprobenverzerrung

Eine Scheinkorrelation kann auch aus den erhobenen Daten stammen – nicht aus der Welt, die sie abbilden sollen.

Wenn deine Stichprobe die Zielpopulation nicht widerspiegelt, entsteht ein Zusammenhang, der nur in deinem Datensatz existiert. Befragst du Kundinnen und Kunden ausschließlich in der App, korreliert „App-Nutzung“ plötzlich mit allem Möglichen. Nicht, weil App-Nutzung das verursacht, sondern weil deine Stichprobe Richtung App‑Nutzer verzerrt ist.

Beispiele für Scheinkorrelationen

Scheinkorrelationen sind häufiger, als du denkst. So erkennst du sie und reagierst richtig.

Klassische statistische Beispiele

Die Korrelation zwischen Eiscreme und Ertrinken kennen alle. Beide steigen und fallen gemeinsam, aber keine verursacht die andere. Heißes Wetter ist der Confounder und treibt beide zugleich.

Das Nicolas‑Cage‑Beispiel ist anders. Seine Filmausbeute korreliert über die Jahre mit der Zahl der Pool‑Ertrinkungen, ganz ohne Confounder. Reiner Zufall – zwei unabhängige Trends, die zufällig zusammenpassten.

Beide Beispiele verdeutlichen Scheinkorrelation – in der Praxis ist sie leider selten so offensichtlich.

Beispiele aus Business und Forschung

In der Business-Analytik verstecken sich Scheinkorrelationen oft hinter Zahlen, die scheinbar zusammengehören.

Stell dir vor, ein Unternehmen trackt wöchentliches Marketingbudget und wöchentlichen Umsatz über zwei Jahre. Mit diesem Python‑Code kannst du mitgehen:

import numpy as np
import pandas as pd

np.random.seed(42)
weeks = 104

# Seasonal effect
seasonality = 10 * np.sin(np.linspace(0, 8 * np.pi, weeks)) + 20

marketing_spend = seasonality + np.random.normal(0, 2, weeks)
revenue = seasonality * 50 + np.random.normal(0, 30, weeks)

df = pd.DataFrame({
    "week": range(1, weeks + 1),
    "marketing_spend": marketing_spend,
    "revenue": revenue
})

print(df["marketing_spend"].corr(df["revenue"]))
Output: 0.9707905810711147

Du erhältst eine starke positive Korrelation zwischen marketing_spend und revenue. Es ist verlockend, daraus „Mehr Marketing steigert den Umsatz“ zu lesen – vielleicht stimmt das, aber der obige Code beweist es nicht. Beide Variablen werden vom gleichen saisonalen Nachfragezyklus getrieben. Gibt das Unternehmen in Wochen mit natürlicher Spitzen-Nachfrage mehr aus, zeigt sich die Korrelation – unabhängig davon, ob das Marketing selbst wirkt oder nicht.

Das ist ein häufiger Fehler in Business-Analysen.

Kundenverhalten und Marketingergebnisse bewegen sich mit Jahreszeiten, Konjunktur oder vielen anderen versteckten Faktoren. Zwei korrelierende Metriken sagen dir nicht, welche – wenn überhaupt eine – verantwortlich ist.

Beispiele aus dem Machine Learning

ML‑Modelle kennen keinen Begriff von „Ursache“. Sie suchen Muster, die die Fehlermetrik senken. Wenn eine Abkürzung auf den Trainingsdaten funktioniert, nimmt das Modell sie.

Zum Beispiel:

  • Hintergrundabhängigkeit: Ein Bildklassifikator lernt „grüne Weiden = Kuh“ statt die Kuh selbst. Zeigst du eine Kuh am Strand, scheitert er.
  • Demografische/geografische Stellvertreter: Ein auf historischen Daten trainiertes Modell nutzt die Postleitzahl als Proxy für Einkommen oder Ethnie – auch wenn diese Variablen gar nicht im Training sind.
  • Datensatz-Artefakte: Ein medizinisches Bildmodell lernt, dass Aufnahmen eines bestimmten Krankenhauses mit älterem Gerät mit einer Krankheit korrelieren, weil dort schwerere Fälle behandelt wurden – nicht, weil das Gerät etwas zur Krankheit verrät.

Dasselbe Prinzip als synthetisches Beispiel zum Ausprobieren: Ein Modell sagt Kreditausfallrisiko voraus, und zip_code dient als Proxy für income – die tatsächlich relevante Variable.

import numpy as np
import pandas as pd
from sklearn.linear_model import LogisticRegression

np.random.seed(42)
n = 1000

# Zip code correlates with income, income drives default risk
zip_code = np.random.choice([1, 2, 3], size=n)
income = 80000 - zip_code * 15000 + np.random.normal(0, 5000, n)
default_risk = (income < 40000).astype(int)

df = pd.DataFrame({"zip_code": zip_code, "income": income, "default": default_risk})

model = LogisticRegression()
model.fit(df[["zip_code"]], df["default"])
print(model.score(df[["zip_code"]], df["default"]))

Beispiel-Score des Machine-Learning-Modells

Beispiel-Score des Machine-Learning-Modells

Dieses Modell kann das Ausfallrisiko allein mit zip_code prognostizieren, ohne je income gesehen zu haben. Auf diesem Datensatz klappt das, aber in einer neuen Stadt, in der das Muster zwischen Postleitzahl und Einkommen nicht gilt, fällt die Genauigkeit ab.

Das ist das Problem mit Abkürzungslernen.

Ein auf einer Scheinkorrelation basierendes Modell kann auf Trainingsdaten gut abschneiden und trotzdem scheitern, sobald es in einer Umgebung eingesetzt wird, in der diese Korrelation nicht gilt.

Wie du Scheinkorrelationen erkennst

Die schlechte Nachricht: Scheinkorrelationen lassen sich nicht völlig vermeiden. Die gute: Mit den richtigen Gewohnheiten fängst du die meisten ab.

Hier sind ein paar praktische Tipps:

  • Konfounder prüfen: Bevor du einer Korrelation vertraust, frag dich, was beide Variablen gleichzeitig treiben könnte. Temperatur und Saisonalität sind oft Kandidaten.
  • Domänenwissen nutzen: Ergibt ein Zusammenhang fachlich keinen Sinn, überschreibe dieses Bauchgefühl nicht mit einer Zahl.
  • Daten visualisieren: Ein Scatterplot oder Zeitreihendiagramm zeigt oft gemeinsame Trends oder Ausreißer, die ein Korrelationskoeffizient verdeckt.
  • Weitere Tests durchführen: Partielle Korrelationen oder Checks über Subgruppen hinweg können einen Zusammenhang bestätigen oder widerlegen.
  • Wenn möglich experimentieren: Randomisierte kontrollierte Studien eliminieren Confounder, weil du die Zuweisung steuerst.

Kurz gesagt: Ein Korrelationskoeffizient sagt dir, dass sich zwei Dinge gemeinsam bewegt haben. Ob das etwas bedeutet, musst du entscheiden.

Scheinkorrelation vs. andere statistische Konzepte

Einige Begriffe werden fälschlich als Synonym für Scheinkorrelation verwendet – das stiftet Verwirrung. In diesem Abschnitt erkläre ich, was dahintersteckt und wo die Unterschiede liegen.

Scheinkorrelation vs. Konfundierung

Konfundierung ist ein spezifischer Grund für eine Scheinkorrelation. Kein Synonym.

Konfundierung liegt vor, wenn eine dritte Variable beide gemessenen Variablen beeinflusst und so einen scheinbar direkten Zusammenhang erzeugt. Temperatur kann konfundieren, weil sie sowohl Eiscreme-Verkäufe als auch Ertrinken treibt.

Scheinkorrelation ist der Oberbegriff. Er umfasst Konfundierung, aber auch Zufall, Stichprobenverzerrung und gemeinsame Zeittrends – alles ohne versteckte Drittvariable. Das Nicolas‑Cage‑Beispiel ist keine Konfundierung, weil es keine Variable gibt, die Filmausstoß mit Pooltoten verbindet. Es ist Zufall – aber dennoch eine Scheinkorrelation.

Jede konfundierte Beziehung ist scheinhaft. Nicht jede scheinhafte Beziehung ist konfundiert.

Scheinkorrelation vs. Kausalität

Scheinkorrelation und Kausalzusammenhang können denselben Scatterplot liefern. Der Unterschied liegt darunter – und bestimmt, was du mit den Daten anfangen kannst.

Hier eine Tabelle mit den Unterschieden:

  Scheinkorrelation Kausalität
Beziehung Keine echte Verbindung zwischen den Variablen Eine Variable beeinflusst die andere direkt
Interpretation Irreführend, wenn als bedeutungsvoll behandelt Spiegelt einen realen Mechanismus
Prognosenutzen Außerhalb des Ursprungssamples unzuverlässig Hält mit neuen Daten, solange sich der Mechanismus nicht ändert
Basis für Kausalbehauptungen Keine Unterstützt Kausalbehauptungen, wenn sauber nachgewiesen

Eine Scheinkorrelation impliziert niemals Kausalität – egal wie stark der Korrelationskoeffizient aussieht. Kausalität erfordert kontrollierte Experimente oder etablierte kausale Inferenzmethoden, die über einen einzelnen Test hinausgehen.

Wie du das Risiko von Scheinkorrelationen reduzierst

Scheinkorrelationen im Nachhinein zu erkennen, ist hilfreich. Besser ist, sie von Anfang an zu vermeiden.

Baue dir dafür folgenden Workflow auf:

  • Bessere Daten erheben: Viele Scheinkorrelationen starten mit einer Stichprobe, die die Zielpopulation nicht abbildet. Prüfe vor der Analyse, ob Erhebung und Rahmenbedingungen passen.
  • Randomisierte Experimente nutzen: Randomisierung ist der beste Schutz vor Konfoundern, weil sie versteckte Variablen gleichmäßig verteilt. Wenn möglich, führe A/B‑Tests statt rein beobachtender Analysen durch.
  • Auf neuen Datensätzen validieren: Ein Zusammenhang, der nur in einem Datensatz auftritt, ist verdächtig. Teste ihn über andere Zeiträume, Personen, Populationen oder Quellen, bevor du ihn ernst nimmst.
  • Kausalanalyse durchführen: Methoden wie das Kontrollieren von Konfoundern oder kausale Graphen gehen über „gemeinsam bewegt“ hinaus und prüfen echte Einflüsse.
  • Domänenexpertise einbeziehen: Fachwissen entlarvt oft scheinhafte Beziehungen, die ein Test übersieht. Hält eine Korrelation der Facheinschätzung nicht stand, stelle sie in Frage, bevor du weiter darauf aufbaust.

Zugegeben: Keine Maßnahme fängt alles ab. In Kombination senken sie aber das Risiko, auf unsicheren Schlussfolgerungen oder Modellen aufzubauen.

Fazit

Ein hoher Korrelationskoeffizient wirkt wie eine Antwort – für erfahrene Datenprofis ist er vor allem eine Frage.

Die Zahl sagt, dass sich zwei Dinge gemeinsam bewegt haben. Sie sagt nicht, warum. Wer sie als Kausalitätsbeweis liest, produziert Fehlannahmen, missversteht Forschung, trifft schlechte Geschäftsentscheidungen und baut Modelle, die bei neuen Daten versagen. Was hinter den Zahlen steckt, ist wichtiger als die Zahl selbst.

Darum entstehen die stärksten Schlussfolgerungen nie allein aus Statistik, sondern aus der Kombination von Statistik und Domänenwissen. So kommst du zu Ergebnissen, die auch außerhalb des Datensatzes bestehen.

Wenn dich Korrelation und Scheinkorrelation noch verwirren, schau dir unsere Kurse zu Wahrscheinlichkeit und Statistik an – von Einführung bis Versuchsplanung und Hypothesentests.


Josef Waples's photo
Author
Josef Waples
Themen

Lerne mit DataCamp

Kurs

Datenwissenschaft verstehen

2 Std.
863.7K
Dieser Einführungskurs vermittelt dir die Grundlagen von Data Science – keine Programmierkenntnisse erforderlich.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

Tutorial

Fibonacci-Folge in Python: Lerne und entdecke Programmiertechniken

Finde raus, wie die Fibonacci-Folge funktioniert. Schau dir die mathematischen Eigenschaften und die Anwendungen in der echten Welt an.
Laiba Siddiqui's photo

Laiba Siddiqui

Tutorial

Python-Tutorial zum Verknüpfen von Zeichenfolgen

Lerne verschiedene Methoden zum Verknüpfen von Zeichenfolgen in Python kennen, mit Beispielen, die jede Technik zeigen.
DataCamp Team's photo

DataCamp Team

Tutorial

So kürzt man eine Zeichenfolge in Python: Drei verschiedene Methoden

Lerne die Grundlagen zum Entfernen von führenden und nachfolgenden Zeichen aus einer Zeichenfolge in Python.
Adel Nehme's photo

Adel Nehme

Tutorial

Wie man Listen in Python aufteilt: Einfache Beispiele und fortgeschrittene Methoden

Lerne, wie du Python-Listen mit Techniken wie Slicing, List Comprehensions und itertools aufteilen kannst. Finde heraus, wann du welche Methode für die beste Datenverarbeitung nutzen solltest.
Allan Ouko's photo

Allan Ouko

Mehr AnzeigenMehr Anzeigen