Track
Sakana Fugu का मार्केटिंग Fable 5 के बराबर बताता है, लेकिन अपने ही बेंचमार्क टेबल से Fable 5 को बाहर रखता है। इसलिए, हम दोनों मॉडलों की यथासंभव सीधे तुलना करेंगे।
पृष्ठभूमि यह है: Anthropic ने Claude Fable 5 लॉन्च करने के मुश्किल से तीन दिन बाद ही अमेरिकी सरकार ने इसके सार्वजनिक एक्सेस को निलंबित कर दिया। और Fable 5 को इसका सबसे सक्षम मॉडल बताया गया था। अब, दो हफ्ते बाद, टोक्यो की Sakana AI ने Fugu को बड़े दावों के साथ जारी किया है। एक खास दावा काफी चर्चित रहा है: Sakana AI कहता है कि Fugu Ultra उद्योग के सबसे कठिन इंजीनियरिंग, विज्ञान, और रीजनिंग बेंचमार्क पर "Fable 5 और Mythos Preview जैसे अग्रणी मॉडलों के साथ कंधे से कंधा मिलाकर" खड़ा है, और वह भी बिना निर्यात-नियंत्रण जोखिम के। CEO David Ha ने X पर कहा कि Fugu इस बात का प्रमाण है कि संयोजित एजेंटों का अदला-बदली योग्य पूल प्रतिबंधित फ्रंटियर मॉडलों जैसे Fable की बराबरी कर सकता है।
इन दावों की जांच थोड़ी मुश्किल है क्योंकि Fable 5 Fugu के बेंचमार्क टेबल में बिल्कुल नहीं है। Sakana इसे इस आधार पर बाहर रखता है कि वह सार्वजनिक रूप से सुलभ नहीं है। हम जो कर सकते हैं, वह कर रहे हैं: हम उन चंद बेंचमार्क्स की जांच कर रहे हैं जो दोनों लैबों की प्रकाशित तालिकाओं में समान बेसलाइन्स के साथ आते हैं। और अंत में, हम मूल्य निर्धारण और एक्सेस की स्थिति पर बात करेंगे।
यदि आप दोनों प्रणालियों की अलग-अलग पृष्ठभूमि चाहते हैं, तो हमारे पास उस पर ब्लॉग हैं: हमारा Claude Fable 5 कवरेज और Sakana Fugu लेख पढ़ें।
Sakana Fugu क्या है?
Sakana Fugu पारंपरिक अर्थ में एक एकल प्रशिक्षित मॉडल नहीं है। यह एक ऑर्केस्ट्रेटर है: ऐसा मॉडल जो आपका अनुरोध प्राप्त करता है, यह तय करता है कि सीधे उत्तर देना है या पूल में मौजूद विशेषज्ञ मॉडलों को सौंपना है, सत्यापन और संश्लेषण का प्रबंधन करता है, और एक OpenAI-संगत API के जरिए एक ही प्रतिक्रिया लौटाता है। बाहर से आप एक एंडपॉइंट को कॉल करते हैं; अंदर, समन्वित फ्रंटियर मॉडलों का एक समूह काम करता है।
यह दो वेरिएंट्स में आता है। Fugu गुणवत्ता और कम विलंबता के बीच संतुलन बनाता है और कोडिंग, रिव्यू, और इंटरएक्टिव सेवाओं के लिए रोज़मर्रा का डिफ़ॉल्ट बताया गया है। Fugu Ultra विशेषज्ञ एजेंटों के एक बड़े पूल का समन्वय करता है और कठिन, बहु-चरणीय समस्याओं पर अधिकतम उत्तर-गुणवत्ता के लिए ट्यून किया गया है — पेपर रीप्रोडक्शन, साइबरसिक्योरिटी विश्लेषण, Kaggle-शैली डेटा साइंस, पेटेंट जांच।
यह विचार वास्तव में दो विचार हैं।
- पहला, सीखा हुआ ऑर्केस्ट्रेशन: कोऑर्डिनेटर इस बात के लिए प्रशिक्षित होता है कि कब डेलिगेट करना है और आउटपुट्स को कैसे संयोजित करना है, न कि हाथ से कोड किए गए पाइपलाइन पर चलना।
- दूसरा, अदला-बदली योग्य एजेंट पूल: जब कोई नया फ्रंटियर मॉडल सार्वजनिक रूप से उपलब्ध होता है, तो Sakana इसे सम्मिलित करने में लगभग दो सप्ताह लगाने की उम्मीद करता है। (इस लेख के बाकी हिस्से के लिए महत्वपूर्ण: Fable 5 उस पूल में नहीं है क्योंकि वह सार्वजनिक रूप से सुलभ नहीं है।)
Claude Fable 5 क्या है?
Claude Fable 5 एक Mythos-श्रेणी का मॉडल है, जो Anthropic की Opus श्रेणी से ऊपर की परत है, जिसे एक सेट के क्लासिफ़ायरों के माध्यम से सामान्य उपयोग के लिए सुरक्षित बनाया गया है। यह Claude Mythos 5 के समान आधारभूत मॉडल है; अंतर यह है कि Fable 5 सुरक्षा क्लासिफ़ायर सक्रिय रखकर चलता था, जबकि Mythos 5 में कुछ को हटाया गया है और वह Project Glasswing पार्टनर्स और चुनिंदा जीवविज्ञान शोधकर्ताओं तक सीमित है।
Anthropic का दावा था कि Fable 5 लगभग हर बेंचमार्क पर अत्याधुनिक है जिसे Anthropic ट्रैक करता है, और लंबी, अधिक जटिल टास्क्स पर इसका बढ़त और बढ़ती है। प्रमुख व्यावहारिक विवरण: जब कोई क्वेरी साइबरसिक्योरिटी, जीवविज्ञान/रसायनशास्त्र, या मॉडल डिस्टिलेशन को छूती है, तो एक दो-चरणीय क्लासिफ़ायर प्रतिक्रिया को Claude Opus 4.8 की ओर मोड़ देता है और उपयोगकर्ता को इसकी सूचना देता है।
Sakana Fugu बनाम Claude Fable 5: बेंचमार्क
Sakana की प्रकाशित तुलना तालिका में Fable 5 और Mythos Preview को शामिल नहीं किया गया है, क्योंकि वे सार्वजनिक रूप से सुलभ नहीं हैं और इसलिए Fugu के पूल में नहीं हो सकते। इसलिए Fugu के आधिकारिक आंकड़े Opus 4.8, GPT-5.5, और Gemini 3.1 Pro के मुकाबले मापे गए हैं, जिन्हें आप नीचे तालिका में देख सकते हैं। आप देखेंगे कि यह 11 में से 10 बेंचमार्क पर जीतता है।
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* mini-swe-agent स्कैफ़ोल्डिंग। † प्रदाता-द्वारा-रिपोर्टेड बेसलाइन्स। सभी Fugu स्कोर Sakana-द्वारा रिपोर्टेड हैं और अभी स्वतंत्र रूप से पुनरुत्पादित नहीं हुए हैं।
Fable 5 को तस्वीर में लाने के लिए, मैंने उन बेंचमार्क्स का क्रॉस-रेफरेंस किया जो Anthropic और Sakana दोनों की तालिकाओं में आते हैं, और यह भी जांचा कि साझा बेसलाइन्स मेल खाते हैं। SWE-Bench Pro और Humanity's Last Exam (नो टूल्स) पर, Opus 4.8, GPT-5.5, और Gemini 3.1 Pro के आंकड़े दोनों स्रोतों में समान हैं — इसलिए ये दोनों तुलना साफ हैं। सिर्फ दो सिस्टम्स पर सीमित करने पर, आमने-सामने नतीजा कुछ यूं दिखता है:
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Leader |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (नो टूल्स) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ दोनों लैब अलग-अलग बेसलाइन्स रिपोर्ट करते हैं और TerminalBench के लिए अलग स्कैफ़ोल्ड्स का उपयोग करते हैं, इसलिए परिस्थितियां एक जैसी नहीं हैं।
ये वही बेंचमार्क हैं जहां हमें प्रकाशित नतीजे सीधे तौर पर तुलनीय मिले। सभी तीनों पर Fable 5 आगे है।
तो, हर उस बेंचमार्क पर जहां आमने-सामने तुलना संभव है, Fable 5, Fugu Ultra से लगभग 6–9 अंक आगे आता है। यह उसी जगह से मेल खाता है जहां Fable 5 जीतने के लिए बना है — लंबी-अवधि वाली, अंत में ग्रेड होने वाली टास्क्स पर, जहां एक एकल मजबूत मॉडल कम सम्मिलित त्रुटियां जमा करता है।
सारांश:
- सभी Fugu आंकड़े स्व-रिपोर्टेड हैं और अभी तीसरे पक्ष की लीडरबोर्ड्स पर नहीं दिखे हैं।
- Sakana Fugu को "कंधे से कंधा" Fable 5 और Mythos Preview के साथ बताता है। ऊपर दिए अंतरालों को देखते हुए, यह बचाव योग्य लेकिन उदार व्याख्या है। "क़रीब, पर पीछे" अधिक सटीक है।
- तुलना सेट्स आंशिक रूप से ही ओवरलैप करते हैं। Fable 5 विज़न पर आगे है (यह स्क्रीनशॉट्स से वेब ऐप का सोर्स फिर से बना सकता है), जिसे Fugu बिल्कुल प्रमुखता नहीं देता; Fugu लंबे-संदर्भ और बैंकिंग बेंचमार्क प्रकाशित करता है जिन्हें Anthropic की तालिका कवर नहीं करती। यानी वे काम के कुछ अलग-अलग रूपों के लिए अनुकूलित हैं।
Sakana Fugu बनाम Claude Fable 5: उपलब्धता और एक्सेस
Claude Fable 5 फिलहाल निलंबित है। Anthropic ने 12 जून को एक अमेरिकी सरकारी निर्यात नियंत्रण निदेश के बाद Fable 5 और Mythos 5 दोनों की पहुंच हटा दी, और कहता है कि वह यथाशीघ्र एक्सेस बहाल करने पर काम कर रहा है। Anthropic के अन्य मॉडल, जैसे Opus 4.8, अभी भी उपलब्ध हैं।
Sakana Fugu अभी उपलब्ध है console.sakana.ai के माध्यम से OpenAI-संगत API के साथ — सिवाय EU और EEA में, जहां Sakana ने GDPR अनुपालन पर काम करते हुए उपलब्धता रोक रखी है। मुझे इस पर सटीक समय-सीमा नहीं मिल सकी।
अभी, एक यूरोपीय टीम इन दोनों मॉडलों में से किसी का भी उपयोग नहीं कर सकती।
अंतिम विचार
कागज पर, यह दो दर्शनियों के बीच करीबी, वास्तविक मुकाबला है।
Anthropic पैमाने के बारे में सोच रहा है — एक इतना सक्षम Mythos-श्रेणी का मॉडल कि उसे समानांतर क्लासिफ़ायर सिस्टम की ज़रूरत पड़ती है।
Sakana समन्वय पर दांव लगा रहा है — कि अदला-बदली योग्य पूल पर एक प्रशिक्षित ऑर्केस्ट्रेटर किसी भी एकल फ्रंटियर मॉडल की पहुंच में रह सकता है, जबकि वह सस्ता, ज़्यादा लचीला और प्रदाता-अज्ञेयवादी हो।
बेंचमार्क्स, सतही रूप से देखें, तो कहते हैं कि तुलनीय परीक्षणों पर Anthropic की बाज़ी अधिक मजबूत आर्टिफैक्ट देती है, जबकि Sakana का दांव अधिक उपलब्ध और सस्ता परिणाम देता है।
Sakana Fugu बनाम Claude Fable FAQs
क्या Sakana Fugu, Claude Fable 5 से बेहतर है?
जिन बेंचमार्क्स पर आमने-सामने तुलना संभव है (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), वहां Fable 5, Fugu Ultra से लगभग 6–9 अंकों से आगे है।
Fugu की बेंचमार्क तालिका में Fable 5 क्यों नहीं है?
Sakana, Fable 5 और Mythos Preview को इसलिए बाहर रखता है क्योंकि वे सार्वजनिक रूप से सुलभ नहीं हैं और इसलिए Fugu के एजेंट पूल का हिस्सा नहीं हो सकते। इसकी आधिकारिक तुलना Opus 4.8, GPT-5.5, और Gemini 3.1 Pro के खिलाफ है, जिनमें से 11 में से 10 बेंचमार्क पर Fugu Ultra आगे है।
कौन सस्ता है?
Fugu Ultra, $5/M इनपुट और $30/M आउटपुट पर, Fable 5 के $10/M इनपुट और $50/M आउटपुट की लगभग आधी कीमत है। दोनों $20/$100/$200 के मासिक सब्सक्रिप्शन टियर्स देते हैं।
क्या Fable 5 वापस आएगा?
Anthropic कहता है कि वह Fable 5 और Mythos 5 की पहुंच यथाशीघ्र बहाल करने पर काम कर रहा है, लेकिन कोई समय-सीमा प्रकाशित नहीं की है। इस बीच इसके अन्य मॉडल, जिनमें Opus 4.8 शामिल है, उपलब्ध हैं।
क्या Fugu वास्तव में Fable 5 के निलंबन को रूट-अराउंड कर लेता है?
सीधे तौर पर नहीं — Fable 5 कभी Fugu के पूल में था ही नहीं, इसलिए Fugu उसकी विशिष्ट क्षमताओं की रिकवरी नहीं कर सकता।