Tracks
Sakana 将 Fugu 宣传为可与 Fable 5 比肩,但其自家基准表却未包含 Fable 5。因此,我们将尽可能把这两个模型并排对比。
背景如下。Anthropic 发布 Claude Fable 5 不到三天,美国政府就暂停了其公众访问。而 Fable 5 被称为其最强大的模型。如今两周过去,东京的 Sakana AI 上线了 Fugu,并带来了不少重磅宣称。其中一条广为流传:Sakana AI 表示 Fugu Ultra 在业内最艰难的工程、科学与推理基准上“与 Fable 5 和 Mythos Preview 等领先模型并肩”,且不存在出口管制风险。CEO David Ha 在 X 上称,Fugu 证明了可替换的协同代理池能够媲美像 Fable 这样的受限前沿模型。
这些说法不太容易核实,因为 Fable 5 根本不在 Fugu 的基准表里。Sakana 的理由是它并不对公众开放。我们尽力而为:我们正在核对两家实验室公布的表格里,那些基线一致且同时出现的少数基准。最后,我们也会谈谈定价和可访问性情况。
如果您想分别了解两套系统的背景,我们有相关文章:请阅读我们的Claude Fable 5 报道和Sakana Fugu 解析。
Sakana Fugu 是什么?
Sakana Fugu 并非传统意义上的单一训练模型。它是一个编排器:一个接收您的请求、决定是直接回答还是委派给池中的专业模型、管理验证与汇总,并通过单一的兼容 OpenAI 的 API 返回响应的模型。从外部看,您只调用一个端点;在内部,是一组协调的前沿模型在协同完成工作。
它有两个变体。Fugu 在质量与低延迟之间取得平衡,被定位为编码、评审与交互式服务的日常默认选择。Fugu Ultra 协调更深的专家代理池,面向困难的多步问题以追求最大答案质量——论文复现、网络安全分析、Kaggle 风格数据科学、专利检索等。
其理念其实包含两点。
- 其一,学习式编排:协调器通过训练来决定何时委派、如何整合输出,而不是运行手工编码的流水线。
- 其二,可替换的代理池:当新的前沿模型公开可用时,Sakana 预计大约两周即可将其纳入。(与下文相关的重要点:Fable 5 不在该池中,因为它并不对公众开放。)
Claude Fable 5 是什么?
Claude Fable 5 是一款 Mythos 级模型,这是 Anthropic 将其定位在 Opus 级之上的一个层级,并通过一组分类器使其可安全用于通用场景。它与 Claude Mythos 5 共享同一底模;区别在于,Fable 5 运行(曾运行)时启用了安全分类器,而 Mythos 5 解除了一部分限制,仅向 Project Glasswing 合作伙伴和部分生物学研究人员开放。
Anthropic 声称,Fable 5 在其追踪的几乎所有基准上都处于业界领先,且在更长、更复杂的任务上优势更大。一个关键的实用细节是:当查询涉及网络安全、生物/化学或模型蒸馏时,双阶段分类器会将响应改由 Claude Opus 4.8 生成,并告知用户该改写。
Sakana Fugu vs. Claude Fable 5:基准测试
Sakana 发布的对比表未包含 Fable 5 和 Mythos Preview,理由是它们并不对公众开放,因而无法纳入 Fugu 的代理池。于是 Fugu 的官方对比对象是Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro,如下表所示。您可以看到它在 11 个基准中的 10 个上获胜。
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* 使用 mini-swe-agent 脚手架。† 供应商报告的基线。所有 Fugu 分数均由 Sakana 报告,尚未被独立复现。
为将 Fable 5 纳入视野,我交叉比对了 Anthropic 与 Sakana 表格中同时出现的基准,并检查了共享基线是否一致。在 SWE-Bench Pro 和 Humanity's Last Exam(无工具)上,Opus 4.8、GPT-5.5 与 Gemini 3.1 Pro 的数据在两方来源中完全一致——因此这两项对比是干净的。只看这两套系统,正面对比如下:
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Leader |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5(+6.6) |
| Humanity's Last Exam(无工具) | 47.2 | 50.0 | 59.0 | Fable 5(+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5(+5.9) |
‡ 两家在 TerminalBench 上报告的基线不同,且使用的脚手架也不同,测试条件并不完全一致。
这是我们找到的唯一一组可直接比较的已公布结果。Fable 5 全部领先。
因此,在所有可并排对比的基准上,Fable 5 均以约 6–9 分的优势领先 Fugu Ultra。这与 Fable 5 的设计取向一致:在按最终结果评分的长周期任务上,更强的单模型能减少累积误差。
总结如下:
- 所有 Fugu 数据均为自报,尚未出现在第三方榜单。
- Sakana 将 Fugu 描述为与 Fable 5 和 Mythos Preview“并肩”。鉴于上述差距,这种说法可辩但偏宽泛。“接近但落后”更准确。
- 对比集仅部分重叠。Fable 5 在视觉上领先(可从截图重建 Web 应用源码),而 Fugu 并未强调此项;Fugu 发布了 Anthropic 表中未覆盖的长上下文与银行业基准。二者各自针对的工作形态略有不同。
Sakana Fugu vs. Claude Fable 5:可用性与访问
Claude Fable 5 目前处于暂停状态。6 月 12 日,Anthropic 遵循美国政府的出口管制指令,暂停了 Fable 5 与 Mythos 5 的访问,并表示正努力尽快恢复。其余模型(如 Opus 4.8)仍可使用。
Sakana Fugu 现已可用,可通过 console.sakana.ai 以兼容 OpenAI 的 API 访问——但在欧盟与欧洲经济区,Sakana 因处理 GDPR 合规而暂停售卖。我未能获得确切时间表。
目前,欧洲团队可能两款模型都用不了。
结语
从纸面上看,这是两种理念之间旗鼓相当、实打实的较量。
Anthropic 思考的是规模——一个强到需要并行分类器体系的 Mythos 级模型。
Sakana 押注于协同——相信在可替换模型池之上训练出的编排器,能在保持更低成本、更强韧性与供应商无关性的同时,始终咬住任何单一前沿模型的表现。
若按字面理解这些基准,Anthropic 的赌注在可比测试上产出了更强的成果,而 Sakana 的赌注则带来了更可用、且更便宜的选择。
Sakana Fugu vs. Claude Fable 常见问题
Sakana Fugu 比 Claude Fable 5 更好吗?
在可并排对比的基准上(SWE-Bench Pro、Humanity's Last Exam、Terminal-Bench),Fable 5 以约 6–9 分的优势领先 Fugu Ultra。
为什么 Fable 5 不在 Fugu 的基准表里?
Sakana 将 Fable 5 和 Mythos Preview 排除在外,因为它们并不对公众开放,因而无法成为 Fugu 代理池的一部分。其官方对比对象是 Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro,而在 11 项基准中 Fugu Ultra 在其中 10 项领先。
哪个更便宜?
Fugu Ultra 的价格为输入每百万 $5、输出每百万 $30,约为 Fable 5(输入每百万 $10、输出每百万 $50)的一半。两者都提供 $20/$100/$200 的月度订阅档位。
Fable 5 会回归吗?
Anthropic 表示正尽快恢复对 Fable 5 与 Mythos 5 的访问,但尚未公布时间表。其余模型(包括 Opus 4.8)在此期间仍可使用。
Fugu 是否真的绕过了 Fable 5 的暂停?
并不会直接如此——Fable 5 从未在 Fugu 的代理池中,因此 Fugu 无法恢复其特定能力。