跳至内容

Sakana Fugu 与 Claude Fable 5:基准测试、定价与更多

Claude Fable 5 在基准上取胜,但目前已被暂停。Sakana Fugu 现已可用,且价格减半。
更新 2026年8月31日  · 6分钟

用 AI 探索

ChatGPTClaudePerplexity

Sakana 将 Fugu 宣传为可与 Fable 5 比肩,但其自家基准表却未包含 Fable 5。因此,我们将尽可能把这两个模型并排对比。

背景如下。Anthropic 发布 Claude Fable 5 不到三天,美国政府就暂停了其公众访问。而 Fable 5 被称为其最强大的模型。如今两周过去,东京的 Sakana AI 上线了 Fugu,并带来了不少重磅宣称。其中一条广为流传:Sakana AI 表示 Fugu Ultra 在业内最艰难的工程、科学与推理基准上“与 Fable 5 和 Mythos Preview 等领先模型并肩”,且不存在出口管制风险。CEO David Ha 在 X 上称,Fugu 证明了可替换的协同代理池能够媲美像 Fable 这样的受限前沿模型。

这些说法不太容易核实,因为 Fable 5 根本不在 Fugu 的基准表里。Sakana 的理由是它并不对公众开放。我们尽力而为:我们正在核对两家实验室公布的表格里,那些基线一致且同时出现的少数基准。最后,我们也会谈谈定价和可访问性情况。

如果您想分别了解两套系统的背景,我们有相关文章:请阅读我们的Claude Fable 5 报道Sakana Fugu 解析

Sakana Fugu 是什么?

Sakana Fugu 并非传统意义上的单一训练模型。它是一个编排器:一个接收您的请求、决定是直接回答还是委派给池中的专业模型、管理验证与汇总,并通过单一的兼容 OpenAI 的 API 返回响应的模型。从外部看,您只调用一个端点;在内部,是一组协调的前沿模型在协同完成工作。

它有两个变体。Fugu 在质量与低延迟之间取得平衡,被定位为编码、评审与交互式服务的日常默认选择。Fugu Ultra 协调更深的专家代理池,面向困难的多步问题以追求最大答案质量——论文复现、网络安全分析、Kaggle 风格数据科学、专利检索等。

其理念其实包含两点。

  • 其一,学习式编排:协调器通过训练来决定何时委派、如何整合输出,而不是运行手工编码的流水线。
  • 其二,可替换的代理池:当新的前沿模型公开可用时,Sakana 预计大约两周即可将其纳入。(与下文相关的重要点:Fable 5 不在该池中,因为它并不对公众开放。)

Claude Fable 5 是什么?

Claude Fable 5 是一款 Mythos 级模型,这是 Anthropic 将其定位在 Opus 级之上的一个层级,并通过一组分类器使其可安全用于通用场景。它与 Claude Mythos 5 共享同一底模;区别在于,Fable 5 运行(曾运行)时启用了安全分类器,而 Mythos 5 解除了一部分限制,仅向 Project Glasswing 合作伙伴和部分生物学研究人员开放。

Anthropic 声称,Fable 5 在其追踪的几乎所有基准上都处于业界领先,且在更长、更复杂的任务上优势更大。一个关键的实用细节是:当查询涉及网络安全、生物/化学或模型蒸馏时,双阶段分类器会将响应改由 Claude Opus 4.8 生成,并告知用户该改写。

Sakana Fugu vs. Claude Fable 5:基准测试

Sakana 发布的对比表未包含 Fable 5 和 Mythos Preview,理由是它们并不对公众开放,因而无法纳入 Fugu 的代理池。于是 Fugu 的官方对比对象是Opus 4.8GPT-5.5Gemini 3.1 Pro,如下表所示。您可以看到它在 11 个基准中的 10 个上获胜。

Benchmark Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* 使用 mini-swe-agent 脚手架。† 供应商报告的基线。所有 Fugu 分数均由 Sakana 报告,尚未被独立复现。

为将 Fable 5 纳入视野,我交叉比对了 Anthropic 与 Sakana 表格中同时出现的基准,并检查了共享基线是否一致。在 SWE-Bench Pro 和 Humanity's Last Exam(无工具)上,Opus 4.8、GPT-5.5 与 Gemini 3.1 Pro 的数据在两方来源中完全一致——因此这两项对比是干净的。只看这两套系统,正面对比如下:

Benchmark Sakana Fugu Sakana Fugu Ultra Claude Fable 5 Leader
SWE-Bench Pro 59.0 73.7 80.3 Fable 5(+6.6)
Humanity's Last Exam(无工具) 47.2 50.0 59.0 Fable 5(+9.0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5(+5.9)

‡ 两家在 TerminalBench 上报告的基线不同,且使用的脚手架也不同,测试条件并不完全一致。

这是我们找到的唯一一组可直接比较的已公布结果。Fable 5 全部领先。

因此,在所有可并排对比的基准上,Fable 5 均以约 6–9 分的优势领先 Fugu Ultra。这与 Fable 5 的设计取向一致:在按最终结果评分的长周期任务上,更强的单模型能减少累积误差。

总结如下:

  1. 所有 Fugu 数据均为自报,尚未出现在第三方榜单。
  2. Sakana 将 Fugu 描述为与 Fable 5 和 Mythos Preview“并肩”。鉴于上述差距,这种说法可辩但偏宽泛。“接近但落后”更准确。
  3. 对比集仅部分重叠。Fable 5 在视觉上领先(可从截图重建 Web 应用源码),而 Fugu 并未强调此项;Fugu 发布了 Anthropic 表中未覆盖的长上下文与银行业基准。二者各自针对的工作形态略有不同。

Sakana Fugu vs. Claude Fable 5:可用性与访问

Claude Fable 5 目前处于暂停状态。6 月 12 日,Anthropic 遵循美国政府的出口管制指令,暂停了 Fable 5 与 Mythos 5 的访问,并表示正努力尽快恢复。其余模型(如 Opus 4.8)仍可使用。

Sakana Fugu 现已可用,可通过 console.sakana.ai 以兼容 OpenAI 的 API 访问——在欧盟与欧洲经济区,Sakana 因处理 GDPR 合规而暂停售卖。我未能获得确切时间表。

目前,欧洲团队可能两款模型都用不了。

结语

从纸面上看,这是两种理念之间旗鼓相当、实打实的较量。

Anthropic 思考的是规模——一个强到需要并行分类器体系的 Mythos 级模型。

Sakana 押注于协同——相信在可替换模型池之上训练出的编排器,能在保持更低成本、更强韧性与供应商无关性的同时,始终咬住任何单一前沿模型的表现。

若按字面理解这些基准,Anthropic 的赌注在可比测试上产出了更强的成果,而 Sakana 的赌注则带来了更可用、且更便宜的选择。

Sakana Fugu vs. Claude Fable 常见问题

Sakana Fugu 比 Claude Fable 5 更好吗?

在可并排对比的基准上(SWE-Bench Pro、Humanity's Last Exam、Terminal-Bench),Fable 5 以约 6–9 分的优势领先 Fugu Ultra。

为什么 Fable 5 不在 Fugu 的基准表里?

Sakana 将 Fable 5 和 Mythos Preview 排除在外,因为它们并不对公众开放,因而无法成为 Fugu 代理池的一部分。其官方对比对象是 Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro,而在 11 项基准中 Fugu Ultra 在其中 10 项领先。

哪个更便宜?

Fugu Ultra 的价格为输入每百万 $5、输出每百万 $30,约为 Fable 5(输入每百万 $10、输出每百万 $50)的一半。两者都提供 $20/$100/$200 的月度订阅档位。

Fable 5 会回归吗?

Anthropic 表示正尽快恢复对 Fable 5 与 Mythos 5 的访问,但尚未公布时间表。其余模型(包括 Opus 4.8)在此期间仍可使用。

Fugu 是否真的绕过了 Fable 5 的暂停?

并不会直接如此——Fable 5 从未在 Fugu 的代理池中,因此 Fugu 无法恢复其特定能力。

主题
人工智能

与 DataCamp 一起学习 AI

Tracks

软件工程中的 AI

7小时
使用最新的 AI 开发工具,包括 GitHub Copilot、Windsurf 和 Replit,更快地编写代码并构建软件应用程序。
查看详情Right Arrow
开始课程
查看更多Right Arrow