Cursus
Sakana présente Fugu comme l’égal de Fable 5, mais exclut Fable 5 de son propre tableau de benchmarks. Nous allons donc comparer les deux modèles autant que possible, en face à face.
Voici le contexte. Le gouvernement américain a suspendu l’accès public à Claude Fable 5 à peine trois jours après son lancement par Anthropic. Et Fable 5 était annoncé comme son modèle le plus performant. Deux semaines plus tard, Sakana AI, basée à Tokyo, lance Fugu avec de grandes ambitions. L’une d’elles a particulièrement circulé : Sakana AI affirme que Fugu Ultra « rivalise avec des modèles de pointe comme Fable 5 et Mythos Preview » sur les benchmarks les plus exigeants de l’industrie en ingénierie, science et raisonnement, sans aucun risque lié aux contrôles à l’export. Sur X, le CEO David Ha a déclaré que Fugu prouve qu’un pool interchangeable d’agents orchestrés peut atteindre le niveau de modèles de pointe restreints comme Fable.
Ces affirmations sont difficiles à vérifier, car Fable 5 n’apparaît pas du tout dans le tableau de benchmarks de Fugu. Sakana l’exclut au motif qu’il n’est pas accessible publiquement. Nous faisons donc avec ce qui est disponible : nous vérifions la poignée de benchmarks présents dans les tableaux publiés par les deux laboratoires avec des références communes. Et pour conclure, nous parlerons des tarifs et des conditions d’accès.
Si vous souhaitez des présentations individuelles des deux systèmes, consultez nos articles dédiés : lisez notre analyse de Claude Fable 5 et notre décryptage de Sakana Fugu.
Qu’est-ce que Sakana Fugu ?
Sakana Fugu n’est pas un modèle unique entraîné au sens classique. C’est un orchestrateur : un modèle qui reçoit votre requête, décide de répondre directement ou de déléguer à des modèles spécialistes dans un pool, gère la vérification et la synthèse, puis renvoie une réponse via une API compatible OpenAI. Vu de l’extérieur, vous appelez un seul endpoint ; en coulisse, un ensemble coordonné de modèles de pointe exécute le travail.
Deux variantes sont proposées. Fugu concilie qualité et faible latence et se positionne comme le choix par défaut au quotidien pour le code, la relecture et les services interactifs. Fugu Ultra coordonne un pool plus profond d’agents experts et est optimisé pour la qualité maximale de réponse sur des problèmes difficiles et multi-étapes — reproduction d’articles, analyses cybersécurité, data science façon Kaggle, investigations de brevets.
L’approche repose en réalité sur deux idées.
- Premièrement, une orchestration apprise : le coordinateur est entraîné à décider quand déléguer et comment combiner les sorties, plutôt que de suivre un pipeline codé à la main.
- Deuxièmement, un pool d’agents interchangeables : lorsqu’un nouveau modèle de pointe devient publiquement accessible, Sakana prévoit environ deux semaines pour l’intégrer. (Point important pour la suite : Fable 5 ne fait pas partie de ce pool car il n’est pas accessible publiquement.)
Qu’est-ce que Claude Fable 5 ?
Claude Fable 5 est un modèle de classe Mythos, un niveau qu’Anthropic positionne au-dessus de sa classe Opus, rendu sûr pour un usage général via un ensemble de classifieurs. C’est le même modèle sous-jacent que Claude Mythos 5 ; la différence, c’est que Fable 5 fonctionne (fonctionnait) avec des classifieurs de sécurité actifs, tandis que Mythos 5 en désactive certains et est réservé aux partenaires Project Glasswing et à quelques chercheurs en biologie.
Anthropic affirmait que Fable 5 était à l’état de l’art sur presque tous les benchmarks suivis par l’entreprise, avec un avantage croissant sur les tâches longues et complexes. Détail clé côté pratique : lorsqu’une requête touche à la cybersécurité, à la biologie/chimie ou à la distillation de modèles, un classifieur en deux étapes redirige la réponse vers Claude Opus 4.8 et en informe l’utilisateur.
Sakana Fugu vs Claude Fable 5 : benchmarks
Le tableau comparatif publié par Sakana exclut Fable 5 et Mythos Preview, au motif qu’ils ne sont pas accessibles publiquement et ne peuvent donc pas intégrer le pool de Fugu. Les chiffres officiels de Fugu sont donc comparés à Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, visibles dans le tableau ci-dessous. Fugu arrive en tête sur 10 benchmarks sur 11.
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* mini-swe-agent scaffolding. † références communiquées par les fournisseurs. Tous les scores Fugu sont rapportés par Sakana et n’ont pas encore été reproduits de façon indépendante.
Pour intégrer Fable 5 à la comparaison, j’ai recoupé les benchmarks figurant à la fois dans les tableaux d’Anthropic et de Sakana, et vérifié la cohérence des références communes. Sur SWE-Bench Pro et Humanity’s Last Exam (sans outils), les chiffres d’Opus 4.8, GPT-5.5 et Gemini 3.1 Pro sont identiques dans les deux sources — ces deux comparaisons sont donc nettes. Réduite aux deux systèmes, la confrontation directe donne ceci :
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Leader |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6,6) |
| Humanity's Last Exam (sans outils) | 47.2 | 50.0 | 59.0 | Fable 5 (+9,0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5,9) |
‡ Les deux laboratoires rapportent des références différentes et utilisent des « scaffolds » différents pour TerminalBench, donc les conditions ne sont pas strictement identiques.
Ce sont les seuls benchmarks pour lesquels nous avons trouvé des résultats publiés directement comparables. Fable 5 mène sur les trois.
Ainsi, sur chaque benchmark où une comparaison côte à côte est possible, Fable 5 devance Fugu Ultra d’environ 6 à 9 points. Cela colle avec le terrain de jeu de Fable 5 : des tâches longues évaluées a posteriori, où un modèle unique plus fort accumule moins d’erreurs composées.
En résumé :
- Tous les chiffres de Fugu sont auto‑rapportés et n’apparaissent pas encore sur des classements tiers.
- Sakana présente Fugu comme « au coude à coude » avec Fable 5 et Mythos Preview. Vu les écarts ci‑dessus, c’est défendable mais généreux. « Proche, mais derrière » serait plus juste.
- Les ensembles de comparaison se recoupent partiellement. Fable 5 mène sur la vision (il peut reconstituer le code source d’une application web à partir de captures d’écran), un point que Fugu ne met pas en avant ; Fugu publie des benchmarks de long contexte et bancaires qu’Anthropic ne couvre pas dans son tableau. Ils sont donc optimisés pour des types de tâches un peu différents.
Sakana Fugu vs Claude Fable 5 : disponibilité et accès
Claude Fable 5 est actuellement suspendu. Anthropic a retiré l’accès à Fable 5 et Mythos 5 le 12 juin suite à une directive américaine sur les contrôles à l’export, et indique travailler à un rétablissement rapide de l’accès. Les autres modèles d’Anthropic, comme Opus 4.8, restent disponibles.
Sakana Fugu est disponible dès maintenant via console.sakana.ai avec une API compatible OpenAI — sauf dans l’UE et l’EEE, où Sakana a mis l’accès en pause le temps d’assurer la conformité RGPD. Aucun calendrier précis n’a pu être communiqué.
À l’instant, une équipe européenne pourrait ne pouvoir utiliser ni l’un ni l’autre.
Dernières réflexions
Sur le papier, c’est un vrai duel serré entre deux philosophies.
Anthropic parie sur l’échelle — un modèle de classe Mythos si performant qu’il nécessite un système de classifieurs parallèle.
Sakana parie sur la coordination — qu’un orchestrateur entraîné, au‑dessus d’un pool interchangeable, puisse rester au contact de n’importe quel modèle de pointe tout en étant moins cher, plus résilient et indépendant des fournisseurs.
Pris au pied de la lettre, les benchmarks indiquent que le pari d’Anthropic produit l’artefact le plus fort sur les tests comparables, tandis que celui de Sakana produit l’option la plus disponible et la moins chère.

Je suis rédacteur et éditeur dans le domaine de la science des données. Je suis particulièrement intéressé par l'algèbre linéaire, les statistiques, R, etc. Je joue également beaucoup aux échecs !
FAQ sur Sakana Fugu vs Claude Fable
Sakana Fugu est-il meilleur que Claude Fable 5 ?
Sur les benchmarks où une comparaison directe est possible (SWE-Bench Pro, Humanity’s Last Exam, Terminal-Bench), Fable 5 devance Fugu Ultra d’environ 6 à 9 points.
Pourquoi Fable 5 n’apparaît-il pas dans le tableau de benchmarks de Fugu ?
Sakana exclut Fable 5 et Mythos Preview car ils ne sont pas accessibles publiquement et ne peuvent donc pas faire partie du pool d’agents de Fugu. Sa comparaison officielle porte sur Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, que Fugu Ultra bat sur 10 benchmarks sur 11.
Lequel est le moins cher ?
Fugu Ultra, à 5 $/M en entrée et 30 $/M en sortie, coûte environ deux fois moins que Fable 5 à 10 $/M en entrée et 50 $/M en sortie. Les deux proposent des abonnements mensuels à 20/100/200 $.
Fable 5 va‑t‑il revenir ?
Anthropic indique travailler à rétablir l’accès à Fable 5 et Mythos 5 au plus vite, sans calendrier publié. Ses autres modèles, dont Opus 4.8, restent disponibles entre‑temps.
Fugu contourne‑t‑il réellement la suspension de Fable 5 ?
Pas directement — Fable 5 n’a jamais fait partie du pool de Fugu, donc Fugu ne peut pas reproduire ses capacités spécifiques.

