Ana içeriğe atla

Yanıltıcı Korelasyon: Önemli Bir İstatistiksel Tuzak (ve Kaçınma Yolları)

Karıştırıcılardan örnekleme yanlılığına kadar yanıltıcı ilişkilerin nedenlerini bilmek, gerçek bir bulguyu istatistiksel bir tesadüften ayırır.
Güncel 29 Tem 2026  · 9 dk. oku

Yapay Zekâyla Keşfet

ChatGPT'de açClaude'da açPerplexity'de aç

İstatistik ve makine öğreniminde, bir desen bir yanıt ile aynı şey değildir.

Muhtemelen dondurma satışlarını boğulma oranlarına bağlayan grafiği ya da Nicolas Cage filmlerini havuzlardaki ölüm vakalarına bağlayan grafiği görmüşsünüzdür. Dikkatinizi çeker ve akılda kalıcıdırlar, ancak korelasyonun nedensellik anlamına gelmediğinin açık örnekleridir. Ayrıca, o kadar fazla kullanılırlar ki bu sorunun işinizde neden önemli olduğunu gözden kaçırırlar.

Yanıltıcı korelasyonu, iki değişken arasındaki, gerçek bir bağlantıdan kaynaklanmayan görünür bir ilişki olarak düşünebilirsiniz. Sadece tesadüf ya da izlemekte olmadığınız gizli bir değişken yüzünden bağlantılı görünür. Bunu değerli bir bilgi gibi ele alırsanız, mantık dışı ve gerçek dünyaya tercüme olmayan desenlerin peşinden giderek zaman kaybedersiniz.

Bu yazıda, yanıltıcı korelasyonların neden ortaya çıktığını, nasıl fark edeceğinizi ve kararlarınızı buna dayandırmaktan nasıl kaçınacağınızı anlatacağım.

Peki korelasyon nedir? Farklı korelasyon katsayıları türlerini ve uygulamalarını öğrenmek için Veride İlişkileri Ölçme başlıklı blog yazımızı okuyun.

Yanıltıcı Korelasyon Nedir?

Yanıltıcı korelasyon, iki değişken arasında, aralarında gerçek bir bağlantı olmamasına rağmen görünen istatistiksel bir ilişkidir.

Korelasyon değeri bizzat gerçektir. Analizi çalıştırdığınızda anlamlı ve makul görünen bir değer elde edersiniz. Hesaplama kısmında yanlış ya da uydurma hiçbir şey yoktur ve sorun da tam olarak budur.

Eksik olan şey nedenselliktir.

Bir değişkendeki hiçbir şey diğerinin olmasına neden olmuyor. Birbiriyle ilgisi olmayan nedenlerle birlikte hareket ediyor olabilirler ya da hiç gerçek bir neden yoktur. Verinin gösterdiği şey ile gerçekte olup biten arasındaki fark, yanıltıcı korelasyonun özüdür.

Yanıltıcı Korelasyonlar Neden Olur?

Yanıltıcı korelasyonlar çoğu zaman birkaç mekanizmayla açıklanabilir ve neye bakmanız gerektiğini bildiğinizde korelansa körü körüne güvenmezsiniz.

Karıştırıcı değişkenler

Karıştırıcı, ölçtüğünüz her iki şeyi de etkileyen gizli bir değişkendir.

Klasik dondurma ve boğulma örneğini ele alalım. Dondurma satışları boğulmalara neden olmaz. Sıcak hava ikisini de sürükler — daha fazla insan dondurma alır ve daha fazla insan yüzer, bu da daha fazla boğulma vakası demektir.

Burada karıştırıcı sıcaklıktır. Veriniz bunu izlemiyorsa, gözden kaçırmanız kolaydır.

Tesadüf

Bazen iki değişken tamamen nedensiz yere birlikte hareket eder.

Yeterince çok veri setinde yeterince çok karşılaştırma yaparsanız, bazıları sadece şans eseri örtüşecektir. Nicolas Cage ile havuzda boğulma korelasyonu tam olarak böyle olur — aynı yıllar boyunca birlikte eğilim gösteren, ilgisiz iki zaman serisi.

Yeterince çok değişken devrede olduğunda, belli bir oranda rastgele hizalanma beklenir.

Ortak eğilimler

Bazı değişkenler zaman içinde birlikte hareket eder ve bu örtüşme, ilişki yokken bile ilişki varmış gibi görünebilir.

Nüfus, GSYH, internet kullanımı ve plastik üretimini düşünün. Bunların çoğu on yıllardır artıyor. Bunlardan herhangi ikisini karşılaştırırsanız, yalnızca ikisi de yukarı yönlü bir eğilim gösterdiği için güçlü bir korelasyon elde edersiniz.

Ancak sadece yönü paylaşırlar ve değişkenlerin kendileri arasında bir bağlantı yoktur.

Örnekleme yanlılığı

Yanıltıcı bir korelasyon, temsil etmesi gereken dünyadan değil, topladığınız veriden de kaynaklanabilir.

Örneğiniz incelediğiniz kitleyi yansıtmıyorsa, yalnızca veri setinizde var olan bir ilişkiyle karşılaşabilirsiniz. Örneğin müşterileri yalnızca bir uygulama üzerinden anket yaparsanız, "uygulama kullanımı"nın her türlü şeyle korele olduğunu bulursunuz. Bunun nedeni uygulama kullanımının onlara neden olması değil, örneklemenizin uygulama kullanan kişilere doğru yanlı olmasıdır.

Yanıltıcı Korelasyona Örnekler

Yanıltıcı korelasyon sandığınızdan daha yaygındır. İşte nasıl fark edeceğiniz ve bununla ilgili ne yapacağınız.

Klasik istatistik örnekleri

Herkesin bildiği korelasyon dondurma ve boğulmadır. Dondurma satışları ve boğulma ölümleri birlikte artar ve azalır, ancak hiçbiri diğerine neden olmaz. Karıştırıcı değişken sıcaktır ve ikisini aynı anda sürükler.

Nicolas Cage örneği farklıdır. Yıllar içindeki film çıktısı, aynı dönemdeki havuzda boğulma sayısıyla koreledir ve burada hiçbir karıştırıcı söz konusu değildir. Bu bir tesadüftür — üst üste gelen ilgisiz iki eğilim.

Her iki örnek de yanıltıcı korelasyonun mantığını kanıtlar, ancak ne yazık ki gerçek dünyada bu kadar net görmezsiniz.

İş ve araştırma örnekleri

İş analitiğinde yanıltıcı korelasyonlar, birlikte anlamlı görünen sayıların arkasına saklanma eğilimindedir.

Bir şirketin iki yıl boyunca haftalık pazarlama harcamasını ve haftalık gelirini takip ettiğini hayal edin. Aşağıdaki Python kodunu kullanarak eşlik edebilirsiniz:

import numpy as np
import pandas as pd

np.random.seed(42)
weeks = 104

# Seasonal effect
seasonality = 10 * np.sin(np.linspace(0, 8 * np.pi, weeks)) + 20

marketing_spend = seasonality + np.random.normal(0, 2, weeks)
revenue = seasonality * 50 + np.random.normal(0, 30, weeks)

df = pd.DataFrame({
    "week": range(1, weeks + 1),
    "marketing_spend": marketing_spend,
    "revenue": revenue
})

print(df["marketing_spend"].corr(df["revenue"]))
Output: 0.9707905810711147

marketing_spend ile revenue arasında güçlü bir pozitif korelasyon elde edersiniz. Bunu "pazarlama harcaması geliri artırır" diye okumak cazip gelir ve belki de artırır, ancak yukarıdaki kod bunu kanıtlamaz. Her iki değişken de aynı mevsimsel talep döngüsü tarafından sürülmektedir. Şirket, talebin doğası gereği yüksek olduğu haftalarda daha fazla harcama yaparsa, pazarlamanın kendisi bir şey yapsın ya da yapmasın korelasyon ortaya çıkar.

Bu, birçok iş analitiğinde yapılan yaygın bir hatadır.

Müşteri davranışı ve pazarlama çıktıları gibi şeyler mevsimlerle, ekonomiyle ya da bir düzine başka gizli faktörle birlikte hareket eder. İki metriğin korele olması, hangisinin — varsa — sorumlu olduğunu söylemez.

Makine öğrenimi örnekleri

Makine öğrenimi modelleri "neden"in ne anlama geldiğini bilmez. Hata metriğini düşüren her deseni bulurlar ve eğitim verisinde işe yarayan bir kestirme varsa, model onu kullanır.

Örneğin:

  • Arka plana dayanma: İnekleri tanımak üzere eğitilmiş bir görüntü sınıflandırıcı, hayvanın kendisi yerine yeşil meraları "inek"le ilişkilendirmeyi öğrenir. Ona sahilde bir inek gösterirseniz, başarısız olur.
  • Demografik ve coğrafi vekiller: Geçmiş verilerle eğitilen bir model, eğitim setinde bu değişkenler olmasa bile posta kodunu gelir ya da ırk için bir vekil olarak kullanmayı öğrenir.
  • Veri seti artifaktları: Bir tıbbi görüntüleme modeli, bir hastanenin eski cihazından gelen taramaların hastalıkla korele olduğunu öğrenir; çünkü o hastane daha ağır vakaları tedavi etmiştir, yoksa cihazın çıktısı bizzat hastalık hakkında bir şey ortaya koyduğu için değil.

Aynı fikri, kendiniz çalıştırabileceğiniz sentetik bir örnek olarak burada görebilirsiniz. Bir model kredi temerrüt riskini tahmin eder ve zip_code gerçekte önemli olan değişken olan income için bir vekil görevi görür.

import numpy as np
import pandas as pd
from sklearn.linear_model import LogisticRegression

np.random.seed(42)
n = 1000

# Zip code correlates with income, income drives default risk
zip_code = np.random.choice([1, 2, 3], size=n)
income = 80000 - zip_code * 15000 + np.random.normal(0, 5000, n)
default_risk = (income < 40000).astype(int)

df = pd.DataFrame({"zip_code": zip_code, "income": income, "default": default_risk})

model = LogisticRegression()
model.fit(df[["zip_code"]], df["default"])
print(model.score(df[["zip_code"]], df["default"]))

Makine öğrenimi örneği model skoru

Makine öğrenimi örneği model skoru

Bu model, zip_code tek başına kullanarak, income değişkenini hiç görmeden temerrüt riskini tahmin edebilir. Bu veri setinde işe yarar, ancak posta kodu ve gelir deseninin doğru olmadığı yeni bir şehre verdiğinizde, modelin doğruluğu düşer.

İşte kestirme öğrenmenin sorunu budur.

Yanıltıcı bir korelasyon üzerine kurulu bir model, eğitim verisinde iyi puan alabilir ve bu korelasyonun geçerli olmadığı bir ortamla karşılaştığı anda yine de başarısız olabilir.

Yanıltıcı Bir Korelasyon Nasıl Tespit Edilir

Kötü haber, yanıltıcı korelasyonları tamamen ortadan kaldıramazsınız; ancak çoğunu yakalayacak alışkanlıklar geliştirebilirsiniz.

İşte birkaç pratik ipucu:

  • Karıştırıcı değişkenleri araştırın: Bir korelansa güvenmeden önce, her iki değişkeni de neyin sürüklüyor olabileceğini sorun. Sıcaklık ve mevsimsellik yaygın şüphelilerdir.
  • Alan bilgisini kullanın: Bildikleriniz ışığında bir ilişki mantıklı gelmiyorsa, istatistiğin bu içgüdünüzün önüne geçmesine izin vermeyin.
  • Veriyi görselleştirin: Bir saçılım grafiği ya da zaman serisi grafiği, korelasyon katsayısının gizlediği ortak bir eğilimi veya bariz bir aykırı değeri sıklıkla gösterir.
  • Ek istatistiksel testler uygulayın: Kısmi korelasyon ya da ilişkinin farklı alt gruplarda sürüp sürmediğine bakmak, bir korelasyonu doğrulayabilir veya bozabilir.
  • Mümkün olduğunda deney tasarlayın: Rastgeleleştirilmiş kontrollü deneyler, hangi grubun hangi işlemi alacağını sizin belirlemeniz sayesinde karıştırıcıları ortadan kaldırır.

Kısacası, bir korelasyon katsayısı iki şeyin birlikte hareket ettiğini söyler. Bunun bir anlamı olup olmadığına karar vermek ise size kalır.

Yanıltıcı Korelasyon ile Diğer İstatistiksel Kavramların Karşılaştırılması

Birkaç terim, yanıltıcı korelasyonla birbirinin yerine kullanılır ve bu da epey kafa karışıklığına neden olur. Bu bölümde bu istatistiksel kavramların ne olduğunu ve nasıl farklılaştıklarını göstereceğim.

Yanıltıcı korelasyon ve karıştırıcılık

Karıştırıcılık, yanıltıcı bir korelasyonun belirli bir nedenidir. Onun eş anlamlısı değildir.

Karıştırıcılık, ölçtüğünüz iki değişkeni de etkileyen üçüncü bir değişkenin olduğu ve doğrudanmış gibi görünen ama olmayan bir ilişki yarattığı durumdur. Sıcaklık, hem dondurma satışlarını hem de boğulmaları sürüklediği için karıştırıcı olabilir.

Yanıltıcı korelasyon ise daha geniş bir kategoridir. Karıştırıcılığı kapsar, ama aynı zamanda tesadüfü, örnekleme yanlılığını ve zaman içindeki ortak eğilimleri de kapsar; bunların hiçbiri gizli bir üçüncü değişken içermez. Nicolas Cage örneğinde, film çıktısını havuz ölümlerine bağlayan bir değişken yoktur; bu yalnızca bir şanstır. Ama yine de yanıltıcıdır.

Yani her karıştırılmış ilişki yanıltıcıdır. Her yanıltıcı ilişki karıştırılmış değildir.

Yanıltıcı korelasyon ve nedensellik

Yanıltıcı bir korelasyon ile nedensel bir ilişki aynı saçılım grafiğini üretebilir. Fark, altında olan bitendedir ve bu fark, verilerle ne yapabileceğinizi değiştirir.

İşte farkları özetleyen bir tablo:

  Yanıltıcı korelasyon Nedensellik
İlişki Değişkenler arasında gerçek bir bağlantı yok Bir değişken diğerini doğrudan etkiler
Yorumlama Anlamlıymış gibi ele alınırsa yanıltıcıdır Gerçek bir mekanizmayı yansıtır
Öngörü değeri Orijinal veri seti dışında güvenilmez Mekanizma değişmediği sürece yeni verilerle de geçerlidir
Nedensel iddiaları destekleme gücü Yok Uygun yöntemlerle kurulması koşuluyla nedensel iddiaları destekler

Korelasyon katsayısı ne kadar güçlü görünürse görünsün, yanıltıcı bir korelasyon asla nedensellik ima etmez. Nedenselliği kanıtlamak, tek bir istatistiksel testin ötesine geçen kontrollü deneyler veya yerleşik nedensel çıkarım yöntemleri gerektirir.

Yanıltıcı Korelasyon Riskini Nasıl Azaltırsınız

Baştan sonra yanıltıcı bir korelasyonu tespit edebilmek faydalıdır. Ancak en iyisi, baştan kaçınan bir iş akışı kurabilmektir.

Bu iş akışında yapmanız gerekenler şunlardır:

  • Daha iyi veri toplayın: Yanıltıcı korelasyonların çoğu, çalışmak istediğiniz şeyi temsil etmeyen bir örnekle başlar. Bir şeyi analiz etmeden önce, veri toplamanızın doğru evreni doğru koşullarla kapsadığını kontrol edin.
  • Mümkün olduğunda rastgeleleştirilmiş deneyler kullanın: Rastgeleleştirme, gizli değişkenleri gruplar arasında eşit dağıttığı için karıştırıcılara karşı en iyi savunmadır. Gözlemsel veriye güvenmek yerine A/B testi yapabiliyorsanız, yapın.
  • Yeni veri setlerinde doğrulayın: Yalnızca tek bir veri setinde görünen bir korelasyon, bir şeylerin ters gittiğinin işaretidir. Güvenmeden önce ilişkinin farklı bir zaman dilimi, farklı bir kişi, farklı bir nüfus veya farklı bir kaynaktan gelen verilerde sürüp sürmediğini test edin.
  • Nedensel analiz yapın: Karıştırıcıları kontrol etmek veya nedensel grafikler gibi teknikler, "bu iki şey birlikte hareket ediyor"un ötesine geçmenizi ve birinin diğerini gerçekten etkileyip etkilemediğini sınamanızı sağlar.
  • Alan uzmanlığını dahil edin: Konuyu anlayan biri, istatistiksel testin yakalayamayacağı yanıltıcı bir ilişkiyi çoğu zaman fark eder. Bir korelasyon alan bilgisi karşısında ayakta kalmıyorsa, üzerine inşa etmeden önce sorgulayın.

Doğrusu, bu adımların hiçbiri her yanıltıcı korelasyonu yakalamayı garanti etmez; ancak birlikte uygulandıklarında, güvensiz bir sonuç ya da model oluşturma olasılığını azaltırlar.

Sonuç

Yüksek bir korelasyon katsayısı bir yanıt gibi görünebilir; ancak daha deneyimli veri profesyonelleri için aslında bir sorudur.

Sayı size iki şeyin birlikte hareket ettiğini söyler. Nedenini söylemez ve bunu nedenselliğin kanıtı gibi ele almak, yanlış varsayımlara, yanlış anlaşılan araştırmalara, yanlış iş kararlarına ve modellerin yeni verilerle karşılaştıkları anda başarısız olmasına yol açar. Rakamların arkasındaki şey, rakamların kendisinden daha önemlidir.

Bu yüzden en güçlü sonuçlar asla yalnızca istatistikten değil, istatistik ile alan bilgisinin birleşiminden doğar. İkisini birden kullandığınızda, elde ettiğiniz sonuçlar, onları üreten veri setinin dışında da geçerli olur.

Korelasyon ve yanıltıcı korelasyon kavramını kafa karıştırıcı buluyorsanız, Olasılık ve İstatistik kursları yelpazemizi keşfedin. Deney tasarımına girişten hipotez testine kadar her şeyi ele alıyoruz.


Josef Waples's photo
Author
Josef Waples

Bilimsel dergilerde yayımlanan araştırma makalelerine katkıları olan bir veri bilimi yazarı ve editörüyüm. Özellikle lineer cebir, istatistik, R ve benzeri konularla ilgileniyorum. Aynı zamanda epey satranç da oynarım! 

Konular

DataCamp ile öğrenin

Kurs

Veri Bilimini Anlamak

2 sa
863.7K
Veri bilimine kodlama gerektirmeyen bir giriş.
Ayrıntıları GörRight Arrow
Kursa Başla
Devamını GörRight Arrow