Ana içeriğe atla

Tablolu Temel Modeller Nedir? TabPFN, TabICL ve TabFM Nasıl Eğitimsiz Tahmin Yapar

Tablolu temel modellerin ne olduğunu, bağlama dayalı öğrenmenin nasıl çalıştığını ve karar çerçevesiyle TabPFN veya TabICL’in ne zaman XGBoost’u geçtiğini öğrenin.
Güncel 6 Eki 2026  · 15 dk. oku

Yapay Zeka ile Keşfedin

ChatGPTClaudePerplexity

Aynı sınava giren iki öğrenciyi hayal edin. İlk öğrenci üç hafta boyunca sadece bir modüle çalışır, ikinci öğrenci ise daha önce milyonlarca farklı sınavda pratik yapmıştır ve sınav günü eline yalnızca çözümlü örneklerin olduğu bir kağıt verilir.

Makine öğreniminin büyük kısmı boyunca, tablolu modeller ilk öğrenci gibiydi. Her yeni veri kümesi; sütunları temizlemek, özellik mühendisliği yapmak, XGBoost veya LightGBM’i eğitmek ve hiperparametreleri saatlerce ayarlamak demekti.

Tablolu temel modeller ise ikinci öğrenci gibidir: Etiketli satırlarınızı onlara örnek olarak verirsiniz ve onlar da geri kalanını hiç eğitim gerektirmeden tahmin eder.

2026’da bu fikir araştırma makalelerinden gerçek ürünlere geçti; SAP Prior Labs’a 1 milyar €’dan fazla kaynak ayırdı ve Google kendi modelini yayınladı. Bu yazıda şunlara bakacağız:

  • Tablolu temel modeller nedir
  • Derin öğrenme için tablolu veriler neden bu kadar zordu
  • Bu modeller gerçekte nasıl tahmin yapar
  • 2026’daki başlıca modeller
  • Birini Python’da nasıl deneriz
  • Ne zaman kullanmalı (ve ne zaman kullanmamalı)

Derin öğrenme deneyiminiz azsa endişelenmeyin. Bu yazıdaki kod alışıldık scikit-learn arayüzünü kullanır; önce hızlı bir tazelemeye ihtiyacınız varsa, 20 Dakikada 8 Makine Öğrenimi Modeli temelleri kapsar.

Tablolu Temel Modeller Kısa Özet

  • TabPFN, TabICLv2 ve Google’ın TabFM’i gibi tablolu temel modeller; milyonlarca sentetik tabloda önceden eğitilmiş sinir ağlarıdır; böylece veriniz üzerinde eğitim veya ayar gerektirmeden tahmin yapabilirler.
  • Küçük-orta ölçekli veri kümelerinde (kabaca 300 ila 100.000 satır) rastgele bölmelerle, ayarlı XGBoost, CatBoost ve LightGBM’i çoğu karşılaştırmada artık geride bırakıyorlar.
  • Zaman sıralı, gruplanmış ve çok büyük veri kümelerinde; ayrıca hızlı CPU tahmini ya da kolay açıklanabilirlik gerektiğinde gradyan destekli ağaçlar hâlâ önde.
  • Başlamak için en iyi yer TabICLv2: açık kaynak, ticari kullanım uygun ve pip install tabicl ile kuruluyor.

Tablolu Temel Modeller Nedir?

Tablolu temel model, milyonlarca sentetik tablolu veri kümesinde önceden eğitilmiş, hedef sütunu tahmin etmeye yönelik genel bir strateji öğrenen ve bu stratejiyi yeni bir tabloda bağlama dayalı öğrenme yoluyla, her veri kümesi için eğitim olmadan uygulayan bir sinir ağıdır.

Buradaki büyük değişim, öğrenmenin ne zaman gerçekleştiğidir.

XGBoost’ta öğrenme her yeni model eğittiğinizde veriniz üzerinde olur. Bir tablolu temel modelde ise öğrenme aylar önce ön eğitim sırasında gerçekleşmiştir ve veriniz yalnızca girdidir. Ayrıca sıkça göreceğiniz bazı terimler var; bunları sade bir dille açıklayayım:

  • Bağlama dayalı öğrenme (ICL): Model, etiketli satırlarınızı örnek olarak görür ve kendi ağırlıklarını değiştirmeden yeni satırları tahmin etmek için bunları kullanır.
  • Öncel uyumlu ağ (PFN): Pek çok farklı sahte veri seti üretmeye yarayan bir tarif olan öncelden örneklenmiş verilerle eğitilen model.
  • Sentetik ön eğitim: Gerçekler yerine uydurma tablolarla eğitim.
  • Sıfır atış (zero-shot) tahmin: Tamamen yeni bir veri kümesi üzerinde hiç eğitim veya ince ayar yapmadan tahmin.

Şimdi tablolu temel modellerin boosting yöntemleri ve otomatik makine öğrenimi (AutoML) ile nasıl karşılaştığına bakalım:

  Tablolu temel modeller Gradyan destekli ağaçlar (XGBoost, LightGBM) AutoML (AutoGluon, H2O AutoML)
Yeni veride eğitim süresi Yok Saniyelerden dakikalara, artı ayar Dakikalardan saatlere
Yorumlanabilirlik Sınırlı (SHAP mümkün ama yavaş) İyi (özellik önemi, hızlı SHAP) Değişken, çoğu zaman okunması zor ansambllar
En uygun veri seti boyutu Yüzlerden yaklaşık 100K satıra Binlerden milyonlarca satıra Binlerden milyonlara
GPU gerekir mi? Birkaç bini geçince önerilir Hayır Genellikle hayır
Küçük, rastgele bölünmüş veri setleri Mevcut kıyaslamalarda en iyi Ayarlandığında güçlü Güçlü ama yavaş

Nasıl çalıştıklarına geçmeden önce, onları en ünlü ve yaygın kullanılan modellerle, büyük dil modelleriyle kısaca karşılaştırmak istiyorum.

Tablolu temel modeller vs. büyük dil modelleri

Büyük dil modelleri (LLM’ler) ve tablolu temel modellerin ikisi de transformer kullanır ve girdilerindeki örneklerden öğrenir.

Fark, okumak üzere tasarlandıkları şeydedir. Bir LLM, bir tabloyu uzun bir metin dizesi olarak okur; bu da virgül ve boşluklardan, hangi sayıların aynı sütuna ait olduğunu çıkarması gerektiği anlamına gelir.

Ayrıca bir anlam problemi de vardır.

42 değeri birinin yaşı da olabilir bir gelir rakamı da; sayının kendisi hangisi olduğunu söylemez. Bir tablolu temel model, her sütunu kendi başına bir değişken ve her satırı tek bir örnek olarak ele alacak şekilde eğitilmiştir; dolayısıyla sütunların birbirleriyle nasıl ilişkili olduğuna odaklanır.

Bunu şöyle düşünmeyi seviyorum: Bir LLM veriniz hakkında konuşmakta harikadır; bir tablolu temel model ise onun üzerinde matematik yapmak için tasarlanmıştır.

İkisi birlikte de çalışabilir; H2O.ai’nin tabH2O modelini konumlandırma şekli tam olarak budur: Bir AI ajanın, bir e-tablodan sayısal bir değer gerektiğinde çağırdığı tahmin aracı.

Tablolu Veriler Derin Öğrenme İçin Neden Bu Kadar Zordu?

Tablolu veriler derin öğrenme için zordu çünkü tablolarda, bir sinir ağının bir kez öğrenip tekrar kullanabileceği ortak bir yapı yoktur. Her fotoğrafta bir piksel pikseldir. Bir finans veri setindeki score adlı sütunla bir futbol veri setindeki score adlı sütunun ortak hiçbir yanı yoktur.

Léo Grinsztajn, Edouard Oyallon ve Gaël Varoquaux’nun 2022 tarihli, iyi bilinen Ağaç tabanlı modeller neden hâlâ tablolu verilerde derin öğrenmeyi geçiyor? makalesi, bunu 45 veri setinde test etti ve özellikle gradyan boosting olmak üzere ağaç tabanlı modellerin, yaklaşık 10.000 satırlık orta boy tablolarda derin öğrenmeyi geçtiğini buldu. Saptadıkları nedenler şunlardı:

  • Keskin sıçramalar: Gerçek örüntüler sıklıkla ani basamaklara sahiptir (vergi dilimlerini düşünün). Ağaçlar bunları kolayca işlerken, sinir ağları düzgün fonksiyonlara meyillidir.
  • İşe yaramaz sütunlar: Tablolar genellikle önem taşımayan sütunlar içerir. Ağaçlar bunları basitçe yok sayar; sinir ağlarını ise belirgin biçimde olumsuz etkiler.
  • Sütunların bireysel anlamları vardır: Her sütun kendi başına bir değişkendir ve standart sinir ağları sütunları anlamı kaybettirecek biçimde birbirine karıştırma eğilimindedir.

İki pratik sorun bunu daha da kötüleştirir. Tek bir tablo; sayıları, kategorileri, sıralamaları ve eksik değerleri karıştırabilir ve çoğu iş tablosu yalnızca yüzlerce ya da binlerce satıra sahiptir; bu da sıfırdan eğitilen bir sinir ağı için çok azdır.

Bence en önemli sorun küçük veri setleridir. Sıfırdan 800 satırda eğitilen bir sinir ağının dayanacağı bir şey yoktur; oysa bir ağaç çalışmak için ön bilgiye ihtiyaç duymaz.

Ön eğitim tam olarak bunu çözdü. Bir tablolu temel model, sizinkini görmeden önce zaten milyonlarca küçük, dağınık, uydurma tablo üzerinde pratik yapmıştır; yani sıfırdan başlamaz.

Tablolu Temel Modeller Nasıl Çalışır?

Bir tablolu temel model, etiketli eğitim satırlarınızı ve etiketsiz test satırlarınızı tek bir girdi olarak birlikte alır ve eksik etiketleri tek bir ileri geçişte tahmin eder. Ağırlıkları asla değişmez; tıpkı girdiye birkaç örnek koyduktan sonra bir soruyu cevaplayan bir LLM gibi.

Bu, alışıldık scikit-learn yöntemlerinin ne anlama geldiğini de değiştirir.

TabICL üzerinde .fit() çağırdığınızda, TabICL dokümantasyonu bunun önceden eğitilmiş kontrol noktasını yüklediğini, verinizi ön işlediğini ve sakladığını açıklar. Asıl iş .predict() sırasında olur.

Modelin mevcut scikit-learn kodunuza takılabilmesi için .fit() adı aynı kalır.

TabPFN genel bakış: solda sentetik veri setlerinde kayıpla eğitim ve sağda tek bir ileri geçişte gerçek bir veri setinde tahmin, ayrıca 2D dikkat mimarisi

Şekil 1: TabPFN milyonlarca sentetik veri setinde önceden eğitilir, ardından tek bir ileri geçişte gerçek bir tabloda tahmin yapar. Alt panel, özellikler ve örnekler arasında nasıl dikkat kurduğunu gösterir. Kaynak: Hollmann ve diğ., “Küçük veride doğru tahminler yapan bir tablolu temel model”, Nature (2025).

Sentetik ön eğitim

Sentetik ön eğitim, modeli gerçekler yerine uydurma tablolarla; bir üretken model gibi çalışan bir veri üreticisi tarafından oluşturulan tablolarla eğitmektir.

Bir pilotun uçuş simülatöründe eğitimini düşünün. Pilot; farklı hava koşulları, havalimanları ve arızalarla binlerce sahte uçuş yapar ki ilk gerçek uçuş yeni gelmesin.

TabPFN benzer şekilde çalışır.

Geliştiricileri, sütunlar arasında rastgele “neden-sonuç” kuralları uyduran (örneğin, A sütunu B’yi etkiler, B hedefi etkiler) ve sonra bu kurallardan satırlar üreten bir üretici yazdı.

Ön eğitim sırasında hedef sütun gizlenir, model onu tahmin etmeye çalışır ve bu; farklı kurallar, gürültü seviyeleri ve tablo boyutlarıyla milyonlarca kez tekrarlanır.

Önemli olan, modelin herhangi bir gerçek konu hakkında bilgi öğrenmemesidir. Hangi sütunların önemli olduğunu fark etme, aykırı değerlere karşı başa çıkma ve ne zaman emin olmamak gerektiğini bilme gibi genel becerileri öğrenir.

Nitekim TabICLv2 makalesi, daha iyi performansının başlıca nedeni olarak yeni sentetik veri üreticisini gösterir.

Bir tabloyu okumanın iki yolu

Mimarilerin her ayrıntısını anlamanız gerekmez; ancak iki ana tasarım olduğunu bilmek faydalıdır:

  1. Her hücreye bakmak (TabPFN). 2025’te Nature’da yayımlanan TabPFN-2, her bir hücreyi ayrı ayrı takip eder ve hücreleri hem satırlar hem sütunlar arasında karşılaştırır. Bu çok ayrıntılıdır ancak tablolar büyüdükçe maliyetlidir; bu yüzden TabPFN-2, 10.000 satır ve 500 özellikle sınırlıydı.
  2. Önce her satırı özetlemek (TabICL). TabICL önce her satırı tek bir kompakt özete sıkıştırır, sonra tek tek hücreler yerine bu özetlerden öğrenir. Karşılaştırılacak şey çok daha az olduğundan çok daha büyük tabloları kaldırabilir.

Her iki ailenin de sentetik verilerle eğitildiğini ve “öncel uyumlu ağ”ın, ayrı bir model türünden ziyade nasıl eğitildiklerini tanımladığını unutmayın.

TabFM mimarisi: eğitim satırları ve bir test satırı olan küçük bir tablo; satır ve sütun dikkati, ardından satır sıkıştırma ve ardından eksik etiketi tahmin için bağlama dayalı öğrenmeden geçer

Şekil 2: TabFM iki tasarımı harmanlar: satırlar ve sütunlar boyunca TabPFN tarzı dikkat, ardından TabICL tarzı satır sıkıştırma ve eksik etiket için bağlama dayalı öğrenme. Kaynak: Google Research, “TabFM’i tanıtıyoruz: Tablolu veriler için sıfır atış temel model” (2026).

Püf noktası: bunun yerine tahmin yavaşlar

Burada çoğu kişiyi ters köşe yapan bir ödünleşim var.

XGBoost bir kez eğitimde zaman harcar, sonra neredeyse anında tahmin eder.

Bir tablolu temel model eğitimi atlar; ancak her tahminde, tüm eğitim satırlarınızı yeniden okumak zorundadır.

Servis öncesi hiçbir ön hazırlık yapmayan ama her siparişte tüm yemek kitabını baştan sona okuyan bir şefi düşünün.

Küçük bir kitap için bu sorun değildir; ancak veri kümeniz büyüdükçe tahminler yavaşlar. Hem TabICL hem TabPFN, tekrar eden tahminleri hızlandırmak için eğitim verilerinin “okunmasını” önbelleğe alabilir; fakat ilk geçiş yine de zaman alır.

2026’daki Başlıca Tablolu Temel Modeller Hangileri?

2026’daki başlıca tablolu temel modeller TabPFN, TabICLv2, Google’ın TabFM’i, Fundamental’ın NEXUS’u ve H2O.ai’ın tabH2O’sudur. İş tarafının ne kadar hızlı hareket ettiğini ilginç buluyorum: Beş ay, bu alanı akademik makalelerden büyük anlaşmalara taşıdı. Kısa bir zaman çizelgesi şöyle:

Şimdi hepsini, işe her şeyi başlatan modelden başlayarak tek tek inceleyelim.

TabPFN (Prior Labs, artık SAP bünyesinde)

Bu kategoriyi oluşturan model TabPFN’dir. TabPFN-2, Ocak 2025’te Nature’da yayımlandı ve 10.000 satıra kadar olan veri setlerinde ayarlı ağaç tabanlı modelleri geçti.

O zamandan beri Prior Labs hızlıca yeni sürümler çıkardı. TabPFN-3 Mayıs 2026’da geldi ve 1 milyon satıra kadar (ve 200 özelliğe kadar) destek veriyor. Ayrıca uyum aşamasında fazladan zaman harcayarak daha iyi tahmin yapan Düşünme modunu (ücretli API’siyle) ekledi.

En son sürüm TabPFN-3.5, Eylül 2026’da çıktı ve teknik raporu, zaman sıralı ve gruplanmış veriler de dahil olmak üzere birkaç büyük kıyaslamada birinciliği iddia ediyor. Bunları, başkaları doğrulayana kadar şirketin kendi rakamları olarak görürdüm.

Bir diğer konu lisans. TabPFN-2, Prior Labs’a atıf yaptığınız sürece ticari olarak kullanılabilir; ancak 2.5 ile 3.5 arası sürümler ticari olmayan lisanslıdır. Bu, ücretsiz deneyebileceğiniz, fakat gerçek bir üründe kullanmak için ücretli lisans gerektirdiği anlamına gelir.

TabICLv2 (Inria)

TabICLv2 şu anda tamamen açık en iyi tablolu temel modeldir. Inria’da geliştirildi, Şubat 2026’da yayımlandı ve ICML 2026’da kabul edildi.

TabICLv2 makalesinin manşet sonucu; herhangi bir ayar yapılmadan, önceki en iyi model olan RealTabPFN-2.5’i, o model gerçek verilerde ayarlanmış, birleştirilmiş ve ince ayar yapılmış olmasına rağmen geçmesidir.

GitHub deposuna göre, TabArena kıyaslamasında veri setlerinin yaklaşık %80’inde, yoğun şekilde ayarlanmış XGBoost, CatBoost ve LightGBM’i de geride bırakıyor.

Ayrıca hızlıdır; 100 özellikli 50.000 satırı bir H100 GPU’da 10 saniyenin altında işler; bu da TabPFN-2.5’ten yaklaşık 10 kat hızlıdır.

En iyi 300 ile 100.000 satır arasında çalışır ve bir miktar doğruluk kaybıyla yaklaşık 500.000 satıra kadar esneyebilir.

Bana göre çoğu okuyucunun başlaması gereken model budur.

pip install tabicl ile kurulur, herhangi bir scikit-learn modeli gibi çalışır ve izin verici lisansı, hiçbir şeye kayıt olmadan ticari kullanım sağlar. Liderlik tablosu hızlı değişiyor; TabPFN-3.5’in raporu artık kendisini TabICLv2’nin önünde sıralıyor.

Google TabFM

TabFM, Google Research’ün tablolu temel modelidir ve 30 Haziran 2026’da yayımlandı. Onu farklı kılan, nerede kullanabildiğinizdir: Google’ın bulut veri ambarı BigQuery’ye yerleşiktir; böylece düz SQL ile tahmin alabilirsiniz.

-- Use past customers (with known churn) to predict churn for new customers
-- AI.PREDICT is in preview, so check the BigQuery docs for the latest syntax
SELECT *
FROM AI.PREDICT(
  TABLE my_dataset.customers_history,
  TABLE my_dataset.customers_new,
  label_col => 'churned'
);

Bu, SQL bilip Python bilmeyenler için harikadır.

Ancak BigQuery dokümantasyonu şu anda 20 özellik sütunu ve 10 sınıfla sınırlar ve Google, 30 Ekim 2026’dan itibaren standart BigQuery ücretlerine ek olarak jeton bazlı fiyatlandırma eklemeyi planlıyor. Hugging Face’teki model ağırlıkları ticari olmayan lisanslıdır; bu nedenle ticari kullanım BigQuery üzerinden olur.

Fundamental NEXUS

NEXUS, eski DeepMind araştırmacıları tarafından kurulan San Francisco merkezli Fundamental şirketinin kapalı, yalnızca işletmelere yönelik modelidir. Şubat 2026’da 255 milyon $ fonla piyasaya sürüldü ve şirket buna Büyük Tablolu Model (LTM) diyor.

İşletmeler NEXUS’u AWS üzerinden satın alıp çalıştırır ve Fundamental, Fortune 100 şirketlerinin bunu talep tahmini, fiyatlandırma ve müşteri kaybı için zaten kullandığını söylüyor. Ancak herkese açık ağırlıklar veya kendiniz kontrol edebileceğiniz kıyas sonuçları yok; bu yüzden bunu kurumsal bir seçenek olarak görürdüm.

H2O.ai tabH2O

tabH2O, H2O.ai’ın modelidir ve tüm fikri basittir: verinizi gönderin, tahminleri alın.

Eksik değerleri ve kategorileri sizin için temizler ve bir şirketin kendi sunucularında çalışabilir; bu da veriyi buluta gönderemeyen banka ve hastaneler için önemlidir.

Beğendiğim şey, tabH2O makalesinin bunu abartmamasıdır. TALENT kıyaslamasında ayarlı CatBoost ve LightGBM’i geçti; ancak yine de TabICLv2’nin gerisinde kaldı.

Başlıca modellerin özeti

Model Geliştirici Açık ağırlık? Azami ölçek Lisans En uygun kullanım
TabPFN-2 Prior Labs Evet 10K satır Atıfla ticari Kendini kanıtlamış eski bir modelin ticari kullanımı
TabPFN-3 / 3.5 Prior Labs (SAP) Evet, bir lisans kabulünden sonra 1M satıra kadar Ticari olmayan, işletme için ücretli API Üst düzey doğruluk ve araştırma
TabICLv2 Inria Evet En iyi 100K satıra kadar İzin verici açık kaynak Varsayılan başlangıç noktanız
TabFM Google Research Evet BigQuery’de 20 özellik Ticari olmayan ağırlıklar BigQuery’deki SQL kullanıcıları
NEXUS Fundamental Hayır Açıklanmadı Mülkiyetli AWS üzerindeki büyük şirketler
tabH2O H2O.ai Hayır Açıklanmadı Ticari API ML kurulumu olmayan ekipler, AI ajanları

Bir Tablolu Temel Modeli Python’da Nasıl Kullanırsınız?

Bir tablolu temel modeli Python’da tıpkı diğer scikit-learn modelleri gibi kullanırsınız.

Ne sunduğunu görmenin en iyi yolu, onu XGBoost ile başa baş yarıştırmaktır; hadi bunu scikit-learn’ün yerleşik meme kanseri veri setinde yapalım.

Önce paketleri kuralım:

pip install tabicl xgboost scikit-learn

Sonra her iki modeli de aynı bölmede çalıştıralım:

from sklearn.datasets import load_breast_cancer
from sklearn.metrics import accuracy_score
from sklearn.model_selection import train_test_split
from tabicl import TabICLClassifier
from xgboost import XGBClassifier

# Load a small tabular dataset as a pandas DataFrame
X, y = load_breast_cancer(return_X_y=True, as_frame=True)
X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, stratify=y, random_state=42
)

# Tabular foundation model: fit() just stores the training rows
tfm = TabICLClassifier()
tfm.fit(X_train, y_train)
tfm_preds = tfm.predict(X_test)

# XGBoost baseline with reasonable, untuned settings
xgb = XGBClassifier(n_estimators=300, learning_rate=0.05, max_depth=4)
xgb.fit(X_train, y_train)
xgb_preds = xgb.predict(X_test)

print(f"TabICL accuracy:  {accuracy_score(y_test, tfm_preds):.3f}")
print(f"XGBoost accuracy: {accuracy_score(y_test, xgb_preds):.3f}")

Bu küçük veri seti normal bir dizüstü bilgisayar CPU’sunda gayet iyi çalışır.

Bu kadar temiz bir veri setinde her iki model de çok yüksek puan alacaktır; o yüzden lütfen tek bir bölmeye göre yargılamayın. Gerçek sınav, kendi dağınık verileriniz olacaktır.

Yerine TabPFN denemek isterseniz, pip install tabpfn çalıştırın ve ardından yalnızca iki satır değişiklik yeterlidir:

from tabpfn import TabPFNClassifier

tfm = TabPFNClassifier()  # The first run asks you to accept the license
tfm.fit(X_train, y_train)
tfm_preds = tfm.predict(X_test)

Gerçek verilerde modelleri karşılaştırmadan önce önemli bir nokta.

Verinizde tarihler varsa, rastgele değil zamana göre bölün. Aksi halde model geleceğe göz atmış olur ve bir sonraki bölümde göreceğiniz gibi, tablolu temel modellerin gerçekte olduklarından daha iyi göründükleri yer tam da burasıdır.

Tablolu Temel Modeller Nerelerde İyi Çalışır, Nerelerde Zorlanır?

Tablolu temel modeller, veri kümeniz küçük-orta ölçekliyse ve test satırları eğitim satırlarına benziyorsa iyi çalışır. Zaman sıralı verilerde, gruplanmış verilerde, çok büyük tablolarda ve sıkı açıklanabilirlik gereksinimlerinde zorlanırlar.

“Test satırları eğitim satırlarına benziyor” fikrinin bir adı vardır: IID (bağımsız ve özdeş dağılımlı) ve veriniz hakkında kontrol etmeniz gereken tek en önemli şey budur.

İyi çalıştıkları yerlerle başlayalım:

  • Küçük-orta veri setleri: birkaç yüz ile yaklaşık 100.000 satır arası tatlı noktadır.
  • Dağınık veri: eksik değerler ve kategori sütunları sizin için ele alınır.
  • Hızlı deneyler: herhangi bir özellik mühendisliği kodu yazmadan saniyeler içinde güçlü bir sonuç alırsınız.
  • ML kurulumu yok: BigQuery’nin AI.PREDICT’i gibi araçlar eğitimi ve devreye almayı tamamen ortadan kaldırır.

Şimdi de sınırlamalara; gerçek bir projede bunların daha çok önem taşıdığını düşünüyorum.

Verinizin IID olduğunu varsayarlar

Haziran 2026’da yayımlanan BeyondArena kıyaslaması, 142 veri setinde 11 modeli test etti; zamanla bölünmüş (geçmişten geleceği tahmin) ve grupla bölünmüş (yeni bir hastane ya da ülke için tahmin) olanlar dahil.

Küçük ve orta IID verilerde tablolu temel modellerin en iyi olduğunu; zaman sıralı, gruplanmış, büyük ve çok geniş verilerde ise ağaç tabanlı ve diğer derin öğrenme modellerinin önde olduğunu buldu. Çoğu iş verisi (satış, sahtekarlık, kayıp) zaman sıralı olduğundan, bu sınırlama gerçek projelerin çoğunda karşınıza çıkar.

BeyondArena’dan sonra yayımlanan TabPFN-3.5, özellikle zaman sıralı ve gruplanmış verilerdeki bu farkı kapattığını iddia ediyor. Bu umut verici; ancak henüz bağımsız olarak test edilmedi.

Açıklaması daha zordur

Hem TabICL’den hem TabPFN’den SHAP değerleri alabilirsiniz; ancak bu, ağaç modelinde SHAP’e göre çok daha uzun sürer ve incelenecek ağaç bölmeleri yoktur. Düzenleyicilerin modeli anlaması gereken kredi skorlama gibi alanlarda bu gerçek bir sorundur.

Tahmin zamanında daha fazla hesaplama isterler

Birkaç bin satırı aşan her şey gerçekten bir GPU ister ve eğitim veriniz büyüdükçe tahminler yavaşlar. CPU’da eğitilmiş bir XGBoost modeli hızda her zaman kazanır.

Lisanslar çok farklıdır

TabPFN-2 atıfla ticari, daha yeni TabPFN sürümleri ticari olmayan, TabFM ağırlıkları ticari olmayan ve TabICLv2 izin vericidir.

BeyondArena grafiği: görev türü, veri seti boyutu, boyutsallık ve özellik türüne göre model ailelerine göre Elo; tablolu temel modeller küçük IID veride önde, zamansal ve büyük veri setlerinde düşüşte

Şekil 3: Model ailelerine göre Elo (yüksek daha iyidir). Tablolu temel modeller küçük IID veride önde, ancak zamansal ve büyük veri setlerinde düşer; ağaçlar ve MLP’ler daha iyi dayanır. Mavi; en yeni TabPFN sürümleri değil, TabICLv2, TabPFN-2.6 ve TabDPT’nin en iyisidir. Kaynak: Purucker ve diğ., “IID Ötesi: Tablolu Temel Modeller Gerçekte Ne Kadar Genel?” (2026), CC BY 4.0.

Umarım bana katılırsınız: tablolu temel modeller, zahmetsiz hızlı bir başlangıç noktasının kalitesini yükseltti; ancak ağaç tabanlı modellerin hâlâ birçok gerçek durumda daha iyi bir seçim olduğu yerler çok.

Ne Zaman Bir Tablolu Temel Model Kullanmalısınız?

Veri kümeniz küçük-orta ve IID olduğunda; tamamen açıklanabilir bir modele veya CPU’da çok hızlı tahminlere ihtiyaç duymadığınızda tablolu bir temel model kullanmalısınız. İşte kullanacağım karar tablosu:

Senaryo Önerilen yaklaşım
10K satır altı, IID, açıklanabilirlik gereksinimi yok TabICLv2 veya TabPFN ile başlayın
10K ile 100K satır arası, IID TabICLv2 ve XGBoost’u test edin, kazananı saklayın
100K ile 1M satır arası XGBoost veya LightGBM ile başlayın, meydan okumacı olarak TabPFN-3’ü deneyin
Zamana veya gruba göre bölünmüş veri Ağaç tabanlı modellerle başlayın
SHAP, özellik önemi veya denetim gerekir SHAP’lı ağaç tabanlı model
GPU olmadan hızlı tahminler Ağaç tabanlı model
Hızlı kavram kanıtı, ML kurulumu yok TabICLv2 veya veriniz zaten oradaysa BigQuery AI.PREDICT
Tablolardan tahmin gerektiren bir AI ajanı tabH2O veya NEXUS gibi bir API

Bir model seçmeden önce şu üç soruyu sormanızı öneririm:

  1. Verim IID mi? Satırlar zamana göre sıralıysa ya da müşteri, mağaza veya hasta bazında gruplanmışsa, rastgele bölmeden gelen sonuçlara dikkat edin.
  2. Modeli açıklamam gerekiyor mu? Bir düzenleyici veya yönetici denetlemek zorundaysa, ağaçlara yönelin.
  3. Tahminler ne kadar hızlı olmalı? Günde milyonlarca tahmini CPU’larda servis ediyorsanız, ağaçlar daha ucuz ve hızlı olacaktır.

Ve söylemek istediğim son nokta şu. Bir tablolu temel modeli önce çalıştırın; çünkü birkaç dakikanızı alır. Verinizde XGBoost’u geçemezse, artık özellik mühendisliği ve XGBoost’u ayarlamaya zaman harcamanın değerli olduğunu biliyorsunuz.

Son Düşünceler

Bu yazının başındaki iki öğrenciyi hatırlıyor musunuz? 2026’da, milyonlarca sınavda pratik yapan ikinci öğrenci, en azından küçük ve orta boy tablolarda, haftalarca çalışanı nihayet geçebiliyor.

Tablolu temel modeller, her veri kümesine özel eğitimi ön eğitimle ve fit() işlemini örneklerden öğrenmeyle değiştirir.

Beni en çok şaşırtan, bu alanın ne kadar hızlı geliştiği. TabPFN-2, 2025’te sinir ağının küçük tablolarda ayarlı ağaçları geçebileceğini ilk gösterdi; TabICLv2 ve TabPFN-3 ise bunu çok daha büyük tablolara taşıdı.

Şu anki açık sorunlar; zaman sıralı veriler, değişen veriler, açıklanabilirlik ve lisanslamadır ki bunlar, bir modelin gerçek bir ürüne girip girmeyeceğini belirleyen şeylerin ta kendisidir.

Bu yüzden tavsiyem; bu modelleri yeni başlangıç noktanız olarak görmek ve nihai aracı verinize, kısıtlarınıza ve modelin nerede çalışacağına göre seçmektir.

Ve pek çok gerçek durumda hâlâ kazanan ağaç tabanlı modellere hâkim olmak istiyorsanız, Python ile Ağaç Tabanlı Modellerle Makine Öğrenimi kursumuza ve Python ile Denetimli Makine Öğrenimi eğitim yoluna göz atın. R ile çalışıyorsanız, R ile Ağaç Tabanlı Modellerle Makine Öğrenimi aynı içeriği kapsar.

Tablolu Temel Modeller SSS

Tablolu temel model nedir?

Milyonlarca sentetik tabloda önceden eğitilmiş bir sinir ağıdır. TabPFN, TabICLv2 ve Google’ın TabFM’i gibi, veri kümeniz üzerinde eğitim yapmadan tahmin eder.

TabPFN, XGBoost’tan nasıl farklıdır?

XGBoost her veri kümesi için yeni bir model eğitir. TabPFN ise bir kez önceden eğitilir ve tahmin sırasında satırlarınızı örnek olarak okur. Yani eğitim adımı yoktur; fakat tahminler daha yavaştır.

Popüler tablolu temel modelleri çalıştırmak için bir GPU’ya ihtiyacım var mı?

Popüler tablolu temel modelleri çalıştırmak için bir GPU’ya ihtiyacım var mı?

Tablolu temel modelleri ticari olarak kullanabilir miyim?

Modele ve sürüme bağlıdır. TabICLv2 izin vericidir. TabPFN-2 atıf gerektirir; daha yeni TabPFN sürümleri ve TabFM ağırlıkları ticari değildir.

Tablolu temel modeller eksik değerleri ve kategorik sütunları işler mi?

Evet. TabPFN ve TabICL her ikisini de ekstra temizlik olmadan ele alır. İlk deneme için atama (imputation) ve one-hot kodlamayı atlayabilirsiniz.


Vaibhav Mehra's photo
Author
Vaibhav Mehra
LinkedIn
Konular
Yapay Zeka
Büyük Dil Modelleri

Öne Çıkan DataCamp Kursları

Program

Büyük Dil Modelleri Geliştirme

16 sa
PyTorch ve Hugging Face ile en yeni derin öğrenme ve NLP tekniklerini kullanarak büyük dil modelleri (LLM'ler) geliştirmeyi öğrenin.
Ayrıntıları GörüntüleRight Arrow
Kursa Başla
Devamını GörRight Arrow
İlgili

blog

Hızlı Sevkiyat İçin Pratik Vibe Kodlama Teknoloji Yığını

Ön uç, arka uç, veritabanları, kimlik doğrulama, depolama, e-posta, test, dağıtım ve izleme için en iyi araçları keşfedin.
Abid Ali Awan's photo

Abid Ali Awan

14 dk.

blog

2026’da En Popüler 40 Yazılım Mühendisi Mülakat Sorusu

Algoritmalar, sistem tasarımı ve davranışsal senaryoları kapsayan bu temel sorularla teknik mülakat sürecine hakim olun. Uzman cevapları, kod örnekleri ve kanıtlanmış hazırlık stratejileri edinin.
Dario Radečić's photo

Dario Radečić

15 dk.

Eğitim

.gitignore Nasıl Kullanılır: Örneklerle Pratik Bir Giriş

Git deponuzu temiz tutmak için .gitignore’u nasıl kullanacağınızı öğrenin. Bu eğitim; temelleri, yaygın kullanım durumlarını ve başlamanıza yardımcı olacak pratik örnekleri kapsar!
Kurtis Pykes 's photo

Kurtis Pykes

8 dk.

Eğitim

Python'da Listeyi String'e Nasıl Dönüştürürsünüz

Bu hızlı eğitimde, Python'da bir listeyi string'e nasıl dönüştüreceğinizi öğrenin.
Adel Nehme's photo

Adel Nehme

Devamını GörDevamını Gör