Program
Sakana, Fugu'yu Fable 5 ile aynı seviyede pazarlıyor ancak Fable 5'i kendi kıyaslama tablosuna dahil etmiyor. Bu yüzden iki modeli, mümkün olduğu ölçüde, yan yana karşılaştıracağız.
Arka plan şöyle. ABD hükümeti, Anthropic'in Claude Fable 5'i piyasaya sürmesinden sadece üç gün sonra, modele kamu erişimini askıya aldı. Üstelik Fable 5, en yetkin model olarak lanse ediliyordu. İki hafta sonra, Tokyo merkezli Sakana AI, iddialı söylemlerle Fugu'yu piyasaya sürdü. Özellikle bir iddia çok konuşuldu: Sakana AI, Fugu Ultra'nın sektörün en zorlu mühendislik, bilim ve muhakeme kıyaslamalarında "Fable 5 ve Mythos Preview gibi önde gelen modellerle omuz omuza" olduğunu ve ihracat kontrolü riski taşımadığını söylüyor. CEO David Ha, X'te, Fugu'nun değiştirilebilir, orkestre edilmiş ajan havuzunun, Fable gibi kısıtlı sınır modellerini yakalayabildiğinin kanıtı olduğunu belirtti.
İddiaları doğrulamak biraz güç, çünkü Fable 5, Fugu'nun kıyaslama tablosunda hiç yer almıyor. Sakana, kamuya açık olmadığı gerekçesiyle onu hariç tutuyor. Biz de elimizden geleni yapıyoruz: Her iki laboratuvarın yayımladığı tablolarda, aynı taban değerlerle yer alan az sayıdaki kıyaslamayı kontrol ediyoruz. Ve sonunda fiyatlandırma ile erişim durumunu konuşacağız
İki sistem hakkında ayrı ayrı arka plan bilgisi istiyorsanız, bununla ilgili bloglarımız var: Claude Fable 5 incelememizi ve Sakana Fugu yazımızı okuyun.
Sakana Fugu Nedir?
Sakana Fugu, klasik anlamda tek bir eğitilmiş model değildir. Bir orkestratördür: talebinizi alır, doğrudan yanıtlayıp yanıtlamayacağına ya da bir havuzdaki uzman modellere delege edip etmeyeceğine karar verir, doğrulama ve sentezi yönetir ve tek bir OpenAI uyumlu API üzerinden bir yanıt döndürür. Dışarıdan bir uç noktayı çağırırsınız; içeride ise koordineli bir sınır model takımı işi yapar.
İki varyantla sunulur. Fugu, kaliteyi düşük gecikmeyle dengeler ve kodlama, gözden geçirme ve etkileşimli hizmetler için günlük varsayılan olarak konumlandırılır. Fugu Ultra ise daha derin bir uzman ajan havuzunu koordine eder ve zor, çok aşamalı sorunlarda — makale reprodüksiyonu, siber güvenlik analizi, Kaggle tarzı veri bilimi, patent araştırmaları — maksimum yanıt kalitesine yönelik ayarlanmıştır.
Fikir aslında iki fikirden oluşuyor.
- Birincisi, öğrenilmiş orkestrasyon: Koordinatör, elle kodlanmış bir hat yerine ne zaman delege edeceğini ve çıktıları nasıl birleştireceğini öğrenerek karar verir.
- İkincisi, değiştirilebilir bir ajan havuzu: Yeni bir sınır model kamuya açıldığında, Sakana onu entegre etmek için yaklaşık iki haftaya ihtiyaç duyacağını öngörüyor. (Makalede ilerisi için önemli nokta: Fable 5, kamuya açık olmadığı için bu havuzda yok.)
Claude Fable 5 Nedir?
Claude Fable 5, Anthropic'in Opus sınıfının üzerinde konumlandırdığı Mythos sınıfına ait bir modeldir ve bir dizi sınıflandırıcı aracılığıyla genel kullanım için güvenli hale getirilmiştir. Claude Mythos 5 ile aynı temel modele dayanır; fark şu ki Fable 5 güvenlik sınıflandırıcıları etkin halde çalışır( çalışırdı), Mythos 5'te ise bunların bir kısmı kaldırılmıştır ve model Project Glasswing ortakları ile seçili biyoloji araştırmacılarıyla sınırlıdır.
Anthropic'in iddiası, Fable 5'in takip ettikleri hemen her kıyaslamada son teknoloji seviyesinde olduğu, farkın ise daha uzun ve daha karmaşık görevlerde açıldığı yönündeydi. Önemli pratik ayrıntı: Bir sorgu siber güvenlik, biyoloji/kimya veya model damıtımına temas ettiğinde, iki aşamalı bir sınıflandırıcı yanıtı Claude Opus 4.8'e yönlendiriyor ve kullanıcıya bunu bildirdiğini söylüyor.
Sakana Fugu ve Claude Fable 5: Kıyaslamalar
Sakana'nın yayımladığı karşılaştırma tablosu, kamuya açık olmadıkları ve bu nedenle Fugu'nun havuzunda bulunamayacakları gerekçesiyle Fable 5 ve Mythos Preview'u dışarıda bırakıyor. Dolayısıyla Fugu'nun resmi rakamları, aşağıdaki tabloda gördüğünüz Opus 4.8, GPT-5.5 ve Gemini 3.1 Pro ile karşılaştırılmış. 11 kıyaslamanın 10'unda Fugu'nun önde olduğunu görebilirsiniz.
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* mini-swe-agent iskeleti. † sağlayıcı tarafından bildirilen taban değerler. Tüm Fugu skorları Sakana tarafından raporlanmıştır ve henüz bağımsız olarak yeniden üretilmemiştir.
Fable 5'i resme dahil etmek için, Anthropic ve Sakana'nın tablolarında yer alan ortak kıyaslamaları çapraz referanslayıp ortak taban değerlerin örtüştüğünü kontrol ettim. SWE-Bench Pro ve Humanity's Last Exam (araçsız) için Opus 4.8, GPT-5.5 ve Gemini 3.1 Pro rakamları her iki kaynakta da aynıdır — dolayısıyla bu iki karşılaştırma net. Yalnızca iki sisteme indirgediğimizde, başa baş görünüm şöyle:
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Lider |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (araçsız) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ İki laboratuvar, TerminalBench için farklı taban değerler bildiriyor ve farklı iskeletler kullanıyor; bu nedenle koşullar birebir aynı değil.
Yayımlanmış sonuçların doğrudan karşılaştırılabildiği bulabildiğimiz tek kıyaslamalar bunlar. Üçünde de lider Fable 5.
Dolayısıyla, yan yana karşılaştırmanın mümkün olduğu her kıyaslamada, Fable 5, Fugu Ultra'nın yaklaşık 6–9 puan önünde yer alıyor. Bu da, tek ve daha güçlü bir modelin biriken hataları daha az yaparak sonuca gittiği, uzun ufuklu ve sonda değerlendirilen görevlerde Fable 5'in neden kazanacak şekilde inşa edildiğiyle örtüşüyor.
Özetle:
- Tüm Fugu rakamları kendi raporlarıdır ve henüz üçüncü taraf lider panolarında yer almamıştır.
- Sakana, Fugu'yu Fable 5 ve Mythos Preview ile "omuz omuza" olarak tanımlıyor. Yukarıdaki farklar göz önüne alındığında, bu savunulabilir ancak cömert bir yorum. "Yakın ama geriden gelen" daha isabetlidir.
- Karşılaştırma kümeleri kısmen örtüşüyor. Fable 5, görselde (ekran görüntülerinden bir web uygulamasının kaynağını yeniden inşa edebiliyor) önde; Fugu ise buna hiç vurgu yapmıyor. Fugu, Anthropic'in tablosunda yer almayan uzun bağlam ve bankacılık kıyaslamaları yayımlıyor. Yani ikisi de kısmen farklı iş şekillerine optimize edilmiş.
Sakana Fugu ve Claude Fable 5: Kullanılabilirlik ve Erişim
Claude Fable 5 şu anda askıya alınmış durumda. Anthropic, 12 Haziran'da ABD hükümetinin ihracat kontrolü direktifinin ardından hem Fable 5 hem Mythos 5'e erişimi kaldırdı ve erişimi en kısa sürede geri getirmek için çalıştığını söylüyor. Opus 4.8 gibi Anthropic'in diğer modelleri ise hâlâ erişilebilir.
Sakana Fugu şu anda kullanılabilir ve console.sakana.ai üzerinden OpenAI uyumlu bir API ile sunuluyor — ancak AB ve AEA'da, Sakana GDPR uyumluluğu üzerinde çalışırken erişimi durdurmuş durumda. Bunun için net bir zaman çizelgesi alamadım.
Şu anda, bir Avrupa ekibi her iki modeli de kullanamayabilir.
Son Düşünceler
Kâğıt üzerinde, bu iki felsefe arasında yakın ve gerçek bir yarış.
Anthropic, ölçek üzerine düşünüyor — o kadar yetkin bir Mythos sınıfı model ki paralel bir sınıflandırıcı sistemine ihtiyaç duyuyor.
Sakana ise koordinasyona oynuyor — değiştirilebilir bir havuzun üzerinde eğitilmiş bir orkestratörün, tek bir sınır modeline karşı erişilebilirlik, maliyet ve sağlayıcıdan bağımsızlık avantajlarıyla yakın mesafede kalabileceği iddiasında.
Kıyaslamalar, olduğu gibi alındığında, Anthropic'in iddiasının karşılaştırılabilir testlerde daha güçlü bir çıktı ürettiğini, Sakana'nın ise daha erişilebilir ve daha ucuz olanı ürettiğini söylüyor.

Bilimsel dergilerde yayımlanan araştırma makalelerine katkıları olan bir veri bilimi yazarı ve editörüyüm. Özellikle lineer cebir, istatistik, R ve benzeri konularla ilgileniyorum. Aynı zamanda epey satranç da oynarım!
Sakana Fugu ve Claude Fable SSS
Sakana Fugu, Claude Fable 5'ten daha iyi mi?
Yan yana karşılaştırmanın mümkün olduğu kıyaslamalarda (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5, Fugu Ultra'nın yaklaşık 6–9 puan önündedir.
Fable 5 neden Fugu'nun kıyaslama tablosunda yok?
Sakana, kamuya açık olmadıkları ve bu nedenle Fugu'nun ajan havuzunun parçası olamayacakları için Fable 5 ve Mythos Preview'u hariç tutuyor. Resmî karşılaştırmasını, Fugu Ultra'nın 11 kıyaslamanın 10'unda geride bıraktığı Opus 4.8, GPT-5.5 ve Gemini 3.1 Pro ile yapıyor.
Hangisi daha ucuz?
Fugu Ultra, $5/M giriş ve $30/M çıkış ücretleriyle, Fable 5'in $10/M giriş ve $50/M çıkış ücretlerinin yaklaşık yarı fiyatındadır. Her ikisi de aylık $20/$100/$200 abonelik katmanları sunar.
Fable 5 geri dönecek mi?
Anthropic, Fable 5 ve Mythos 5'e erişimi mümkün olan en hızlı şekilde geri getirmek için çalıştığını söylüyor, ancak bir zaman çizelgesi yayımlamadı. Bu arada Opus 4.8 dâhil diğer modelleri erişilebilir durumda.
Fugu gerçekten Fable 5'in askıya alınmasını dolanıyor mu?
Doğrudan değil — Fable 5 hiçbir zaman Fugu'nun havuzunda bulunmadı, dolayısıyla Fugu onun belirli yeteneklerini geri kazanamaz.
