Tracks
Sakana は Fugu を Fable 5 に匹敵すると謳っていますが、自社のベンチマーク表からは Fable 5 を外しています。そこで、可能な限り両モデルを横並びで比較します。
背景を説明します。Anthropic が Claude Fable 5 を発表してからわずか 3 日で、米国政府が一般公開アクセスを停止しました。Fable 5 は同社で最も高性能なモデルと位置づけられていました。その 2 週間後、東京の Sakana AI が大きな主張とともに Fugu を出荷しました。なかでも話題になったのが、Fugu Ultra は、業界で最も難しいエンジニアリング、科学、推論系のベンチマークで「Fable 5 や Mythos Preview と肩を並べる」とし、しかも輸出管理リスクがない、というものです。CEO の David Ha 氏は X で、Fugu は交換可能なエージェント群をオーケストレーションすることで、Fable のような制限のあるフロンティアモデルに匹敵できることの証左だと述べました。
ただし、Fable 5 は Fugu のベンチマーク表にまったく載っていないため、主張の検証はやや難しい状況です。Sakana は公開アクセスできないモデルは対象外としています。可能な範囲で進めます。両ラボが公開している表に共通して載っている、ベースラインが一致するベンチマークを照合します。最後に、価格とアクセス状況についても触れます。
各システム個別の背景を知りたい場合は、こちらのブログをご覧ください:Claude Fable 5 の解説とSakana Fugu のレビュー。
Sakana Fugu とは?
Sakana Fugu は、一般的な意味での単一学習モデルではありません。オーケストレーター、すなわち、リクエストを受け取り、直接応答するか専門モデルに委譲するかを判断し、検証と統合を管理し、OpenAI 互換の単一 API 経由で 1 つの応答を返すモデルです。外側からは 1 つのエンドポイントを呼ぶだけで、内側では連携するフロンティアモデル群が仕事をします。
提供は 2 種です。Fugu は品質と低レイテンシのバランスを取り、日常のコーディング、レビュー、対話型サービスのデフォルトとして位置づけられています。Fugu Ultra はより深い専門エージェント群を調整し、難易度の高い多段階課題 — 論文再現、サイバーセキュリティ分析、Kaggle 風データサイエンス、特許調査 — において最大の回答品質を目指してチューニングされています。
狙いは大きく 2 つあります。
- 第一に、学習されたオーケストレーション:手書きのパイプラインではなく、いつ委譲し、どう出力を結合するかを判断するコーディネーター自体を訓練します。
- 第二に、交換可能なエージェントプール:新しいフロンティアモデルが公開されれば、Sakana は約 2 週間で統合できると見ています。(この記事の要点として重要:Fable 5 は公開アクセスできないため、このプールには含まれていません。)
Claude Fable 5 とは?
Claude Fable 5 は Mythos クラスのモデルで、これは Anthropic が Opus クラスの上位に位置づける階層であり、分類器群によって一般利用向けに安全性を確保しています。Claude Mythos 5 と同一の基盤モデルですが、Fable 5 は安全性分類器を有効にして動作(していました)のに対し、Mythos 5 は一部が解除され、Project Glasswing のパートナーや一部の生物学研究者に限定されています。
Anthropic の主張では、Fable 5 は同社が追跡するほぼすべてのベンチマークで最先端であり、そのリードは長く複雑なタスクになるほど拡大します。実務上の要点としては、問い合わせがサイバーセキュリティ、生物学/化学、モデル蒸留に関わる場合、2 段階の分類器が応答を Claude Opus 4.8 に経路変更し、その旨をユーザーに通知します。
Sakana Fugu vs. Claude Fable 5:ベンチマーク
Sakana が公開した比較表には、Fable 5 と Mythos Preview は含まれていません。公開アクセスできず Fugu のプールに入れないため、という理由です。したがって公式の比較相手は、Opus 4.8、GPT-5.5、Gemini 3.1 Pro で、以下の表に掲載されています。Fugu が 11 のうち 10 のベンチマークで勝っています。
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* mini-swe-agent のスキャフォールディング。† プロバイダ提示のベースライン。Fugu のスコアはすべて Sakana 発表で、第三者による再現はまだありません。
Fable 5 を比較に加えるため、Anthropic と Sakana の両方の表に掲載され、かつ共有ベースラインが一致しているベンチマークを突き合わせました。SWE-Bench Pro とHumanity's Last Exam(ツールなし)では、Opus 4.8、GPT-5.5、Gemini 3.1 Pro の数値が両者で同一でした。つまり、この 2 つの比較はクリーンです。2 システムに絞ると、直接対決は次のようになります。
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Leader |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (no tools) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ 両ラボは TerminalBench で異なるベースラインとスキャフォールドを用いており、条件は同一ではありません。
公開結果を直接比較できると確認できたのはこの 3 つだけです。いずれも Fable 5 がリードしています。
つまり、横並び比較が可能なすべてのベンチマークで、Fable 5 は Fugu Ultra をおおむね 6–9 ポイント上回ります。これは、Fable 5 が長期的なタスクで最終採点されるタイプ、すなわち単一の強力なモデルが誤差の累積を抑えやすい領域で勝つ設計と整合します。
要約:
- Fugu の数値はすべて自己申告であり、まだ第三者のリーダーボードには登場していません。
- Sakana は Fugu を「Fable 5 や Mythos Preview と肩を並べる」と表現しています。上述の差を見ると、その評価は擁護可能ではあるものの寛大です。「近いが後塵を拝する」がより正確です。
- 比較対象の集合は部分的にしか重なりません。Fable 5 はビジョンで優位(スクリーンショットから Web アプリのソースを再構築可能)で、Fugu はそこを重視していません。一方、Fugu は長文コンテキストやバンキングのベンチマークを公開していますが、Anthropic の表では扱われていません。両者はやや異なる仕事の形に最適化されています。
Sakana Fugu vs. Claude Fable 5:提供状況とアクセス
Claude Fable 5 は現在停止中です。Anthropic は、米国政府の輸出管理指令を受けて 6 月 12 日に Fable 5 と Mythos 5 へのアクセスを停止し、可能な限り早期の復旧に取り組むとしています。Opus 4.8 などその他のモデルは引き続き利用可能です。
Sakana Fugu は現在利用可能で、console.sakana.ai から OpenAI 互換 API でアクセスできます。ただし、EU および EEA では GDPR 準拠の対応中につき提供を一時停止しています。具体的な再開時期は不明でした。
現時点では、欧州のチームはいずれのモデルも使えない可能性があります。
総括
紙の上では、これは 2 つの思想による拮抗した真っ向勝負です。
Anthropic はスケールを志向しています。すなわち、並行する分類器システムを要するほど強力な 1 つの Mythos クラスモデルです。
Sakana は協調に賭けています。交換可能なプール上で訓練されたオーケストレーターにより、どの単一のフロンティアモデルにも肉薄しつつ、より安価で、堅牢で、プロバイダ非依存でいられるという発想です。
額面どおりに受け取れば、比較可能なテストでは Anthropic の賭けがより強力な成果物を生み、Sakana の賭けはより入手しやすく、低コストな成果物を生む、という結果です。
Sakana Fugu vs. Claude Fable FAQs
Sakana Fugu は Claude Fable 5 より優れていますか?
横並び比較が可能なベンチマーク(SWE-Bench Pro、Humanity's Last Exam、Terminal-Bench)では、Fable 5 が Fugu Ultra をおおむね 6–9 ポイント上回ります。
なぜ Fugu のベンチマーク表に Fable 5 がないのですか?
Fable 5 と Mythos Preview は公開アクセスできず、Fugu のエージェントプールに含められないため、Sakana は除外しています。公式の比較対象は Opus 4.8、GPT-5.5、Gemini 3.1 Pro で、Fugu Ultra は 11 中 10 のベンチマークでこれらを上回ります。
どちらが安いですか?
Fugu Ultra は入力 $5/M、出力 $30/M と、Fable 5 の入力 $10/M、出力 $50/M のおよそ半額です。どちらも月額 $20/$100/$200 のサブスクリプション階層を提供しています。
Fable 5 は復活しますか?
Anthropic は、Fable 5 と Mythos 5 のアクセス復旧に迅速に取り組むとしていますが、時期は公表していません。なお、それ以外のモデル(Opus 4.8 を含む)は引き続き利用可能です。
Fugu は実際に Fable 5 の停止を回避していますか?
直接的にはできません。Fable 5 はもともと Fugu のプールに含まれていなかったため、Fugu がその固有の能力を取り戻すことはできません。