Перейти к основному контенту

Ложная корреляция: важная статистическая ловушка (и как её избежать)

Понимание того, почему возникают ложные взаимосвязи — от смешивающих факторов до смещения выборки, — отличает реальную находку от статистического совпадения.
Обновлено 29 июл. 2026 г.  · 9 мин читать

Изучить с помощью AI

Открыть в ChatGPTОткрыть в ClaudeОткрыть в Perplexity

В статистике и машинном обучении шаблон ещё не означает ответ.

Вероятно, вы видели график, связывающий продажи мороженого с числом утоплений или тот, что связывает фильмы с участием Николаса Кейджа с гибелью людей в бассейнах. Они привлекают внимание и запоминаются, но это наглядные примеры того, что корреляция не означает причинно-следственную связь. К тому же они настолько заезжены, что теряется суть: почему эта проблема важна в вашей работе.

Ложную корреляцию можно понимать как кажущуюся связь между двумя переменными, которая не вызвана реальным отношением между ними. Связь возникает по совпадению или из-за скрытой переменной, которую вы не отслеживаете. Если принять её за ценную информацию, вы потратите время на погоню за шаблонами, которые не имеют смысла и не работают в реальном мире.

В этой статье я объясню, почему возникают ложные корреляции, как их распознать и как избежать принятия решений на их основе.

Но что вообще такое корреляция? Прочитайте наш пост в блоге Измерение взаимосвязей в данных, чтобы узнать о разных типах коэффициентов корреляции и их применениях.

Что такое ложная корреляция?

Ложная корреляция — это кажущаяся статистическая связь между двумя переменными, не вызванная реальным отношением между ними.

Значение корреляции само по себе реально. При проведении анализа вы получаете число, которое выглядит значимым и правдоподобным. В самих вычислениях нет ошибки или вымысла — и именно в этом проблема.

Не хватает причинно-следственной связи.

Одна переменная не «заставляет» происходить другую. Они могут меняться вместе по причинам, не связанным друг с другом, или вообще без причины. Именно это расхождение между тем, что показывают данные, и тем, что происходит на самом деле, и есть ложная корреляция.

Почему возникают ложные корреляции

Ложные корреляции почти всегда объясняются несколькими механизмами, и как только вы знаете, на что смотреть, вы перестанете слепо доверять корреляции.

Смешивающие факторы (confounding variables)

Смешивающая переменная — это скрытый фактор, который влияет на обе измеряемые вами величины.

Возьмём классический пример с мороженым и утоплениями. Продажи мороженого не вызывают утоплений. Ими обоими управляет жаркая погода: больше людей покупают мороженое и больше людей купаются — значит, больше утоплений.

Температура — это здесь смешивающий фактор. Если вы её не отслеживаете, легко упустить важное.

Совпадение

Иногда две переменные движутся вместе вовсе без причины.

Если провести достаточно сравнений на достаточно большом числе наборов данных, некоторые из них совпадут просто по случайности. Так и возникает корреляция между фильмами Николаса Кейджа и гибелью людей в бассейнах — два не связанных друг с другом временных ряда, которые по счастливой случайности менялись схожим образом в одни и те же годы.

При большом числе переменных некоторая доля случайных совпадений ожидаема.

Общие тренды

Некоторые величины просто меняются одновременно во времени, и это совпадение может выглядеть как связь, даже если её нет.

Подумайте о численности населения, ВВП, использовании интернета и производстве пластика. Многие из них растут десятилетиями. Если сравнить любую пару, вы получите высокую корреляцию просто потому, что обе величины растут.

Но у них совпадает лишь направление, а связи между самими переменными нет.

Смещение выборки

Ложная корреляция может возникать и из-за данных, которые вы собрали, а не из-за мира, который они должны представлять.

Если ваша выборка не отражает изучаемую популяцию, вы можете получить взаимосвязь, существующую только в вашем наборе данных. Например, опросите клиентов исключительно через приложение — и обнаружите, что «использование приложения» коррелирует с самыми разными вещами. Не потому, что использование приложения их вызывает, а потому, что ваша выборка смещена в сторону людей, пользующихся приложениями.

Примеры ложной корреляции

Ложная корреляция встречается чаще, чем вы думаете. Вот как её распознать и что с этим делать.

Классические статистические примеры

Корреляцию между мороженым и утоплениями знают все. Продажи мороженого и смертность от утопления растут и падают вместе, но одно не вызывает другое. Жаркая погода — смешивающий фактор, который одновременно влияет на оба показателя.

Пример с Николасом Кейджем иной. Число его фильмов по годам коррелирует с числом утоплений в бассейнах за тот же период, и тут нет никакого смешивающего фактора. Это совпадение — два несвязанных тренда, которые случайно совпали.

Оба примера демонстрируют суть ложной корреляции, но, к сожалению, в реальных кейсах так очевидно это не видно.

Примеры из бизнеса и исследований

В бизнес-аналитике ложные корреляции часто прячутся за числами, которые, кажется, должны быть связаны.

Представьте, что компания отслеживает еженедельные расходы на маркетинг и еженедельную выручку за два года. Вы можете использовать этот код на Python, чтобы повторить пример:

import numpy as np
import pandas as pd

np.random.seed(42)
weeks = 104

# Seasonal effect
seasonality = 10 * np.sin(np.linspace(0, 8 * np.pi, weeks)) + 20

marketing_spend = seasonality + np.random.normal(0, 2, weeks)
revenue = seasonality * 50 + np.random.normal(0, 30, weeks)

df = pd.DataFrame({
    "week": range(1, weeks + 1),
    "marketing_spend": marketing_spend,
    "revenue": revenue
})

print(df["marketing_spend"].corr(df["revenue"]))
Output: 0.9707905810711147

Вы получите сильную положительную корреляцию между marketing_spend и revenue. Легко трактовать это как «рост маркетинговых расходов увеличивает выручку», и, возможно, так и есть, но приведённый код этого не доказывает. Обе переменные движутся под влиянием одного и того же сезонного цикла спроса. Если компания тратит больше в те недели, когда спрос и так высок, корреляция появится независимо от того, работает ли сам маркетинг.

Это распространённая ошибка во многих бизнес-аналитических проектах.

Поведением клиентов и результатами маркетинга управляют сезоны, экономика и десятки других скрытых факторов. Корреляция двух метрик не говорит, какая из них — если вообще какая-то — за что отвечает.

Примеры из машинного обучения

Модели машинного обучения не знают, что такое «причина». Они просто находят любой паттерн, который снижает метрику ошибки, и если на обучающих данных работает ярлык, модель им воспользуется.

Например:

  • Зависимость от фона: классификатор изображений, обученный распознавать коров, ассоциирует зелёные пастбища со «коровой», а не само животное. Покажите ему корову на пляже — он ошибётся.
  • Демографические и географические прокси: модель, обученная на исторических данных, подхватывает почтовый индекс как прокси для дохода или расы, даже если этих переменных нет в обучающем наборе.
  • Артефакты набора данных: модель медицинской визуализации «узнаёт», что снимки со старого аппарата одной больницы коррелируют с болезнью, потому что эта больница лечила более тяжёлые случаи, а не потому, что снимок сам по себе раскрывает что-то о болезни.

Тот же принцип — на синтетическом примере, который вы можете запустить сами. Модель предсказывает риск дефолта по кредиту, и zip_code выступает прокси для income — переменной, которая действительно важна.

import numpy as np
import pandas as pd
from sklearn.linear_model import LogisticRegression

np.random.seed(42)
n = 1000

# Zip code correlates with income, income drives default risk
zip_code = np.random.choice([1, 2, 3], size=n)
income = 80000 - zip_code * 15000 + np.random.normal(0, 5000, n)
default_risk = (income < 40000).astype(int)

df = pd.DataFrame({"zip_code": zip_code, "income": income, "default": default_risk})

model = LogisticRegression()
model.fit(df[["zip_code"]], df["default"])
print(model.score(df[["zip_code"]], df["default"]))

Оценка модели в примере машинного обучения

Оценка модели в примере машинного обучения

Эта модель может предсказывать риск дефолта, используя один лишь zip_code, ни разу «не увидев» income. На этом наборе данных она работает, но если дать ей новый город, где связь между почтовым индексом и доходом не соблюдается, точность модели упадёт.

В этом и проблема «обучения по ярлыкам».

Модель, построенная на ложной корреляции, может показывать хорошие результаты на обучающих данных и всё равно провалиться, как только столкнётся со средой, где эта корреляция не действует.

Как обнаружить ложную корреляцию

Плохая новость: вы не можете полностью исключить ложные корреляции. Хорошая: вы можете выработать привычки, которые помогут отлавливать их большинство.

Вот несколько практических советов:

  • Ищите смешивающие факторы: прежде чем доверять корреляции, спросите себя, что ещё может управлять обеими переменными. Частые «подозреваемые» — температура и сезонность.
  • Используйте предметные знания: если связь не укладывается в вашу картину предметной области, не позволяйте статистике заглушить интуицию.
  • Визуализируйте данные: диаграмма рассеяния или график временного ряда часто выявляют общий тренд или явные выбросы, которые скрывает коэффициент корреляции.
  • Проводите дополнительные статистические проверки: частичная корреляция или проверка устойчивости связи в разных подгруппах могут подтвердить или опровергнуть корреляцию.
  • По возможности проводите эксперименты: рандомизированные контролируемые испытания устраняют смешивающие факторы, поскольку вы контролируете, какая группа получает какое воздействие.

Короче говоря, коэффициент корреляции сообщает, что две величины менялись вместе. Значит ли это что-то — решать вам.

Ложная корреляция и другие статистические понятия

Несколько терминов часто используют как синонимы ложной корреляции, из-за чего возникает путаница. В этом разделе я покажу, что это за понятия и чем они отличаются.

Ложная корреляция vs смешение (confounding)

Смешение — это лишь одна из причин ложной корреляции. Это не синоним.

Смешение возникает, когда третья переменная влияет на обе измеряемые вами величины, создавая видимость прямой связи там, где её нет. Температура может быть смешивающим фактором, так как она влияет и на продажи мороженого, и на утопления.

Ложная корреляция — понятие шире. Оно охватывает смешение, но также и совпадения, смещение выборки и общие тренды во времени — всё это без скрытой третьей переменной. Пример с Николасом Кейджем — вовсе не про смешение, так как нет переменной, связывающей кинопроизводство со смертями в бассейнах. Это просто случайность. Но это всё равно ложная корреляция.

Итак, любая связь, обусловленная смешением, — ложная. Но не всякая ложная связь обусловлена смешением.

Ложная корреляция vs причинность

Ложная корреляция и причинная связь могут дать один и тот же график рассеяния. Разница — в том, что стоит за ним, и эта разница определяет, что вы можете делать с данными.

Вот таблица с ключевыми отличиями:

  Ложная корреляция Причинность
Связь Реальной связи между переменными нет Одна переменная напрямую влияет на другую
Интерпретация Вводит в заблуждение, если считать её значимой Отражает реальный механизм
Прогностическая полезность Ненадёжна за пределами исходного набора данных Сохраняется на новых данных, если механизм не меняется
Способность обосновывать причинные утверждения Отсутствует Позволяет делать причинные выводы при условии корректного установления причинности

Ложная корреляция никогда не подразумевает причинности, каким бы сильным ни казался коэффициент корреляции. Доказательство причинности требует контролируемых экспериментов или признанных методов причинного вывода, выходящих за рамки одного статистического теста.

Как снизить риск ложных корреляций

Умение распознать ложную корреляцию постфактум полезно само по себе. Но гораздо лучше выстроить процесс, который предотвращает её изначально.

В этом процессе стоит сделать следующее:

  • Собирайте лучшие данные: многие ложные корреляции начинаются с выборки, не представляющей исследуемую совокупность. Прежде чем анализировать что-либо, убедитесь, что сбор данных охватывает нужную популяцию и условия.
  • Используйте рандомизированные эксперименты, когда это возможно: рандомизация — лучшая защита от смешения, так как равномерно распределяет скрытые факторы между группами. Если можете провести A/B-тест вместо опоры на наблюдательные данные — сделайте это.
  • Валидируйте на новых наборах данных: корреляция, проявляющаяся лишь в одном наборе, — тревожный сигнал. Протестируйте, сохраняется ли связь на данных из другого периода, от другого автора, другой популяции или из другого источника, прежде чем ей доверять.
  • Проводите причинный анализ: методы вроде учёта смешивающих факторов или причинные графы позволяют выйти за рамки «две величины меняются вместе» и проверить, влияет ли одна на другую.
  • Привлекайте экспертов предметной области: специалист часто заметит ложную связь там, где статистический тест промолчит. Если корреляция не выдерживает проверки предметными знаниями, усомнитесь в ней, прежде чем на ней строить выводы.

По правде говоря, ни один из этих шагов не гарантирует, что вы поймаете каждую ложную корреляцию, но вместе они снижают риск построить вывод или модель, которым нельзя доверять.

Заключение

Высокий коэффициент корреляции может показаться ответом, но для более опытных специалистов по данным это на самом деле вопрос.

Число говорит, что две величины менялись вместе. Почему — не говорит. Превращая это в «доказательство» причинности, вы закладываете основу для неверных предположений, искажённого прочтения исследований, ошибочных бизнес-решений и моделей, которые рушатся при столкновении с новыми данными. То, что стоит за числами, важнее самих чисел.

Именно поэтому самые надёжные выводы рождаются не из одной статистики, а из сочетания статистики и предметной экспертизы. Используя обе, вы получите выводы, которые выдерживают проверку вне набора данных, из которого они получены.

Если понятия корреляции и ложной корреляции кажутся запутанными, изучите нашу подборку курсов по вероятности и статистике. Мы покрываем всё — от введения до планирования эксперимента и проверки гипотез.

Темы

Учитесь с DataCamp

Course

Понимание науки о данных

2 ч
863.7K
Введение в data science без программирования.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow