Accéder au contenu principal

Sakana Fugu : fonctionnalités, benchmarks et fonctionnement

Fugu de Sakana AI orchestre un pool de LLM de pointe derrière une API unique. Nous présentons ses fonctionnalités, ses scores de benchmark, ses tarifs et des cas d’usage concrets.
Actualisé 23 sept. 2026  · 12 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

À la mi-2026, le paysage de l’IA est saturé de modèles frontaliers monolithiques qui s’affrontent à coups de scores bruts aux benchmarks. Sakana AI fait un autre pari : plutôt que d’entraîner un modèle de base plus grand, l’entreprise propose Fugu, un système qui orchestre un pool de modèles de pointe existants derrière une API unique compatible OpenAI.

La promesse phare : Sakana Fugu Ultra égalerait Fable 5 d’Anthropic et Mythos Preview sur des benchmarks d’ingénierie, scientifiques et de raisonnement, sans nécessiter l’accès à ces modèles soumis à des contrôles à l’exportation.

Sakana Fugu a été lancé le 22 juin 2026 en deux variantes : Fugu pour les usages quotidiens sensibles à la latence, et Fugu Ultra pour les tâches complexes et multi-étapes. Sur SWE-Bench Pro, Fugu Ultra atteint 73,7 %, devant Claude Opus 4.8 (69,2 %), GPT-5.5 (58,6 %) et Gemini 3.1 Pro (54,2 %).

Tous les résultats de benchmarks sont déclarés par Sakana et n’ont pas encore été reproduits indépendamment par des laboratoires tiers ; à garder en tête à la lecture.

Dans cet article, je présente ce qu’est vraiment Fugu, ses fonctionnalités clés, l’intégralité du tableau de benchmarks, ainsi que quelques cas d’usage. Vous pouvez également consulter notre comparaison GPT-5.5 vs Gemini 3.1 Pro pour situer les modèles auxquels Fugu se mesure.

Qu’est-ce que Sakana Fugu ?

Sakana Fugu est un modèle de langage entraîné pour jouer le rôle d’orchestrateur : il reçoit une requête, décide de la traiter directement ou de la déléguer à des modèles spécialistes de son pool d’agents, gère la vérification et la synthèse, puis renvoie une réponse unique. Vu de l’extérieur, vous n’appelez qu’un seul endpoint. En interne, un ensemble coordonné de modèles fait le travail.

Sakana AI travaille vers cette architecture depuis sa création. Le laboratoire, fondé par Llion Jones (co-auteur de l’article fondateur « Attention Is All You Need ») et David Ha, soutient de longue date que des écosystèmes de modèles coordonnés surpassent des monolithes isolés sur des tâches difficiles et longues.

Fugu est la concrétisation de cette thèse, adossée à deux articles ICLR 2026 : TRINITY (un coordinateur de LLM évolué) et Conductor (apprentissage de l’orchestration d’agents en langage naturel).

À l’heure où j’écris, Fable 5 et Mythos Preview d’Anthropic ne sont pas accessibles publiquement en raison de contrôles à l’export, ce qui empêche leur inclusion dans le pool d’agents de Fugu.

L’argument de Sakana est que le routage au sein d’un pool de modèles interchangeables constitue une parade pratique face à ce type de rupture d’accès. Faut-il y voir une véritable « souveraineté de l’IA » ? Le débat reste ouvert, mais la logique opérationnelle est solide : si un fournisseur restreint l’accès, Fugu contourne l’obstacle.

\"Sakana

Source

Qu’y a-t-il de nouveau avec Sakana Fugu ?

Fugu introduit plusieurs idées qui le distinguent à la fois des modèles frontaliers classiques et des frameworks multi-agents traditionnels. Voici les principales.

Une orchestration apprenante, pas des pipelines figés

La plupart des systèmes multi-agents exigent des développeurs de définir quel modèle gère quelle tâche. Fugu l’apprend. Le modèle orchestrateur est entraîné à décider quand déléguer, comment les agents doivent communiquer et comment combiner leurs sorties en une réponse unique. C’est l’apport central des travaux TRINITY et Conductor cités plus haut.

Concrètement, la complexité d’un système multi-agents ne remonte jamais jusqu’à votre code. Vous envoyez une requête vers un seul endpoint, et Fugu gère en interne la sélection des modèles, la délégation, la vérification et la synthèse. Pour les équipes qui ont tenté de bâtir leur propre couche d’orchestration, l’intérêt est évident : vous profitez des gains de coordination sans entretenir le harnais.

Un bémol important : les décisions de routage sont propriétaires et non exposées aux utilisateurs. Vous ne pouvez pas voir quel modèle sous-jacent a traité une requête donnée. Pour les travaux sensibles en conformité, où l’audit de la chaîne de raisonnement est requis, cette opacité est une vraie limite.

Un pool d’agents interchangeable

Les modèles du pool de Fugu ne sont pas figés. Lorsqu’un nouveau modèle de pointe devient publiquement disponible, Sakana prévoit environ deux semaines pour entraîner et évaluer des versions mises à jour de Fugu avant de les déployer. Ainsi, les performances de Fugu devraient progresser au rythme de l’écosystème sous-jacent, sans que les utilisateurs n’aient à modifier leur intégration.

Pour le modèle Fugu standard, les utilisateurs peuvent également exclure certains agents du pool depuis la console, ce qui compte pour les équipes ayant des exigences de confidentialité ou de conformité. Le pool de Fugu Ultra est fixe, car il s’appuie sur l’ensemble complet des agents pour atteindre ses performances de benchmark.

Une conception à deux niveaux

Fugu et Fugu Ultra servent des charges différentes. Fugu allie qualité et faible latence, ce qui en fait un bon choix par défaut pour le code, la relecture de code et les services interactifs. Fugu Ultra coordonne un pool plus profond d’agents experts et est optimisé pour la qualité de réponse maximale sur des problèmes difficiles et multi-étapes.

Les premiers utilisateurs ont sollicité Fugu Ultra pour des tâches comme la reproduction d’articles, l’analyse cybersécurité, la data science de type Kaggle et les recherches de brevets.

Un ingénieur logiciel en bêta a signalé que Fugu Ultra avait remonté plus de vingt problèmes en revue de code, là où d’autres outils en relevaient environ trois.

Un ingénieur cybersécurité a indiqué qu’une instruction bien délimitée avait déclenché une évaluation sécurité de bout en bout, avec rapport propre, évidences et étapes de retest.

Précisons que le compromis sur la latence est réel. Le routage et la synthèse multi-agents ajoutent une surcharge. Pour des requêtes simples ou des contraintes de latence strictes, un appel direct à un modèle de pointe unique sera probablement plus rapide et moins coûteux.

API compatible OpenAI

Fugu et Fugu Ultra sont accessibles via une API unique compatible OpenAI. Aucune migration de SDK n’est requise.

Vous redirigez votre client existant vers l’endpoint Fugu avec votre clé d’API et commencez à envoyer des requêtes. Le but est clair : réduire les coûts de bascule pour les équipes qui utilisent déjà GPT-5.5 ou Claude Opus 4.8 via la bibliothèque cliente OpenAI.

Benchmarks de Sakana Fugu

D’après le tableau comparatif de Sakana, Fugu Ultra arrive en tête sur 10 benchmarks sur 11, GPT-5.5 ne l’emportant que sur MRCRv2. Tous les scores, à l’exception de ceux de Fugu, sont reportés par les fournisseurs. Fable 5 et Mythos Preview sont exclus de la comparaison car ils ne sont pas accessibles publiquement et ne peuvent donc pas intégrer le pool d’agents de Fugu.

Des reproductions indépendantes de ces chiffres n’étaient pas encore publiées sur des classements tiers au moment d’écrire ces lignes.

Benchmark Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT 5.5 †
SWE Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ3 Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

SWE-Bench Pro

Fugu Ultra obtient 73,7 % sur SWE-Bench Pro, devant Claude Opus 4.8 à 69,2 %, GPT-5.5 à 58,6 % et Gemini 3.1 Pro à 54,2 %. Dans notre couverture de GPT-5.5, nous notions un score de 58,6 % sur ce benchmark, que Fugu Ultra dépasse de 15 points.

SWE-Bench Pro évalue la capacité d’un modèle à résoudre de véritables issues GitHub dans des dépôts logiciels, ce qui en fait l’un des benchmarks de code les plus ancrés dans la pratique. L’écart entre Fugu Ultra et le meilleur modèle publiquement accessible suivant est suffisamment important pour compter pour les équipes qui font de la revue de code ou de la correction de bugs sérieuses.

LiveCodeBench et LiveCodeBench Pro

Fugu Ultra atteint 93,2 % sur LiveCodeBench et 90,8 % sur LiveCodeBench Pro. Les meilleurs scores suivants sont ceux de Gemini 3.1 Pro à 88,5 % et de Claude Opus 4.8 à 87,8 % sur la version standard.

LiveCodeBench évalue des problèmes de programmation compétitive issus de concours récents, ce qui réduit le risque de contamination par les données d’entraînement par rapport à d’anciens benchmarks de code. La variante Pro propose des problèmes plus difficiles. L’avance de Fugu ici est cohérente avec les retours de bêta sur sa forte performance en revue de code.

Humanity's Last Exam

Fugu Ultra obtient 50,0 % sur Humanity's Last Exam, contre 49,8 % pour Claude Opus 4.8, 44,4 % pour Gemini 3.1 Pro et 41,4 % pour GPT-5.5.

Ce benchmark évalue des connaissances de niveau expert dans des domaines scientifiques et académiques, avec des questions délibérément difficiles, même pour des spécialistes. Un score de 50 % est notable sachant que GPT-5.5 est à 41,4 %. L’écart entre Fugu Ultra et GPT-5.5 y est le plus grand de tout le tableau.

GPQA Diamond

Fugu et Fugu Ultra affichent 95,5 % sur GPQA Diamond, devant Gemini 3.1 Pro à 94,3 %, GPT-5.5 à 93,6 % et Claude Opus 4.8 à 92,0 %.

GPQA Diamond évalue des questions scientifiques de niveau doctorat en biologie, chimie et physique, rédigées par des experts et reconnues difficiles pour des non-spécialistes. Le fait que Fugu standard égale Fugu Ultra suggère que la surcharge d’orchestration n’apporte pas grand-chose ici, ce qui se comprend pour une tâche de questions-réponses ne nécessitant pas une planification multi-étapes.

TerminalBench 2.1

Fugu Ultra obtient 82,1 % sur TerminalBench 2.1, devant GPT-5.5 à 78,2 %, Claude Opus 4.8 à 74,6 % et Gemini 3.1 Pro à 70,3 %. TerminalBench évalue des tâches de codage agentique qui exigent d’interagir avec un environnement terminal : manipulation de fichiers, commandes shell et exécutions multi-étapes.

C’est l’un des benchmarks les plus proches des flux de travail réels des développeurs, et l’avance de Fugu Ultra sur GPT-5.5 est conforme au cas d’usage d’évaluation cybersécurité rapporté en bêta.

MRCRv2

GPT-5.5 l’emporte sur MRCRv2 avec 94,8 %, contre 93,6 % pour Fugu Ultra et 87,9 % pour Claude Opus 4.8. MRCRv2 évalue la mémoire de long contexte, en particulier la capacité d’un modèle à retrouver des informations précises dans de très longs documents.

C’est le seul benchmark où Fugu Ultra n’est pas en tête, à noter pour les équipes centrées sur l’extraction de faits précis dans de gros documents plutôt que sur le raisonnement multi-étapes ou la génération de code.

\"Saka

Source

Tarifs et disponibilité de Sakana Fugu

Fugu est désormais disponible via la console de Sakana sur console.sakana.ai, avec une API compatible OpenAI. Fugu et Fugu Ultra sont inclus dans chaque offre. Les abonnements sont les suivants :

  • Standard : 20 $ / mois, usage de base, adapté aux appels API occasionnels et aux expérimentations personnelles
  • Pro : 100 $ / mois, 10× l’usage Standard, adapté aux sessions régulières de codage et de recherche
  • Max : 200 $ / mois, 30× l’usage Standard, adapté aux charges lourdes et longues

L’offre à l’usage facture aux jetons consommés plutôt qu’au forfait mensuel. Pour Fugu Ultra (ID modèle : fugu-ultra-20260615), les tarifs sont de 5 $ par million de jetons en entrée et 30 $ par million de jetons en sortie pour des contextes standards.

Au-delà de 272 k jetons de contexte, les tarifs passent à 10 $ en entrée et 45 $ en sortie. L’entrée mise en cache est facturée 0,50 $ par million de jetons, ou 1,00 $ au-dessus de 272 k. Les tarifs standards de Fugu s’alignent sur ceux du modèle sous-jacent actif, et Sakana n’empile pas de frais lorsque plusieurs agents tournent en parallèle.

Une limite régionale importante : Fugu n’est pas disponible actuellement dans les États membres de l’UE ou de l’EEE, le temps que Sakana finalise sa conformité RGPD. Pour les équipes européennes, c’est bloquant pour l’instant. Sakana n’a pas publié de calendrier pour une disponibilité dans l’UE.

Conclusion

Fugu tranche réellement avec l’approche d’OpenAI, Anthropic et Google. Plutôt que de jouer la course à l’échelle du modèle de base, Sakana défend l’idée qu’une orchestration apprenante à travers un pool de modèles de pointe interchangeables peut égaler, voire dépasser, n’importe quel système pris isolément sur les tâches qui prennent vraiment du temps : longues revues de code, recherches multi-étapes, évaluations de sécurité et reproduction d’articles.

Si les chiffres de benchmark se confirment de manière indépendante, ils appuient cet argument sur la plupart des indicateurs qui comptent pour les développeurs. Bien sûr, tant que nous n’aurons pas retrouvé l’accès à Fable 5 et Mythos, la comparaison directe restera impossible.

Cela dit, il faut noter quelques bémols.

Tous les scores sont déclarés par Sakana. La couche de routage est opaque, ce qui complique les travaux sensibles en conformité. L’exclusion UE/EEE limite l’adoption pour une part importante de la communauté mondiale de développeurs. Et le compromis de latence sur les tâches simples est réel : pour des appels API rapides et unitaires, la surcharge d’orchestration de Fugu Ultra est un coût net sans bénéfice.

Là où Fugu a, selon moi, un vrai atout, c’est pour les équipes qui font tourner des workflows agentiques de long terme et gèrent déjà la complexité des configurations multi-modèles. Si vous maintenez votre propre harnais d’orchestration au-dessus de Claude et GPT, Fugu Ultra mérite une évaluation sérieuse.

Le cadrage en termes de souveraineté est sans doute exagéré, mais la valeur pratique d’un endpoint unique qui contourne les interruptions des fournisseurs, elle, ne l’est pas.

Pour vous mettre à niveau sur le paysage de l’IA agentique dans lequel opère Fugu, je vous recommande de commencer par le parcours de compétences AI Agent Fundamentals sur DataCamp, qui couvre les fondations des grands modèles de langage, des agents et des systèmes multi-modèles.

FAQ sur Sakana Fugu

Quelle est la fenêtre de contexte maximale pour Fugu Ultra ?

Fugu Ultra prend en charge une fenêtre de contexte maximale colossale d’un million de jetons. Notez que si la tarification standard de l’API s’applique aux 272 000 premiers jetons, les tarifs augmentent pour les contextes au-delà de ce seuil.

Fugu prend-il en charge la navigation web ou l’utilisation d’outils externes ?

Oui. Comme Fugu utilise une API standard compatible OpenAI, vous pouvez rediriger sans friction vos assistants de codage IA ou clients API existants vers l’endpoint de Sakana. En complément, Sakana fournit une commande d’installation en une ligne pour intégrer nativement le modèle dans Codex, permettant aux développeurs de bénéficier de l’orchestration multi-agents directement dans leur éditeur de code.

Quel est le lien entre Fugu et l’agent « Marlin » de Sakana AI ?

Bien que tous deux soient des systèmes d’IA multi-agents conçus par Sakana, ils adressent des flux de travail totalement différents. Marlin (lancé une semaine avant Fugu) est un agent autonome d’« ultra deep research » conçu pour tourner de façon asynchrone jusqu’à huit heures afin de produire des rapports stratégiques de 100 pages. Fugu, à l’inverse, est une API d’orchestration pensée pour l’interaction immédiate, qui synthétise des réponses à partir de modèles frontaliers pour des tâches de codage et de raisonnement à plus faible latence.

L’API Fugu hébergée peut-elle interagir directement avec mon système de fichiers local ou mon éditeur de code ?

Non. Fugu étant une couche d’orchestration hébergée et accessible via un endpoint distant, il ne peut pas accéder nativement à votre système de fichiers local, exécuter des commandes shell directement sur votre machine ou valider du code dans vos dépôts locaux. Même s’il obtient d’excellents scores sur des benchmarks basés terminal, vous aurez toujours besoin d’agents d’exécution locaux ou d’intégrations IDE (comme Cursor ou Claude Code) de votre côté de l’API pour effectuer ces modifications de fichiers physiques.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Rédacteur et éditeur de contenu dans le domaine des technologies de l'information et de la communication. Vous êtes déterminé à explorer les tendances en matière de données et enthousiaste à l'idée d'apprendre la science des données.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Meilleurs cours DataCamp

Cours

Google: Agent Fundamentals

1 h
750
Learn AI agent fundamentals — how they differ from LLMs, when to use them, and explore agent architecture, orchestration, and tools.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow