programa
Sakana presenta Fugu como un rival directo de Fable 5, pero deja fuera a Fable 5 de su propia tabla de benchmarks. Así que vamos a comparar ambos modelos en paralelo todo lo que sea realmente posible.
\nContexto rápido. El gobierno de EE. UU. suspendió el acceso público a Claude Fable 5 apenas tres días después de su lanzamiento por parte de Anthropic. Y Fable 5 se presentó como su modelo más capaz. Dos semanas después, la japonesa Sakana AI ha publicado Fugu con grandes promesas. Una en particular ha corrido como la pólvora: Sakana AI asegura que Fugu Ultra \"está a la altura de modelos líderes como Fable 5 y Mythos Preview\" en los benchmarks más exigentes de ingeniería, ciencia y razonamiento del sector, y sin riesgos de control de exportaciones. El CEO David Ha dijo en X que Fugu demuestra que un conjunto intercambiable de agentes orquestados puede igualar a modelos punteros restringidos como Fable.
\nNo es fácil verificar estas afirmaciones porque Fable 5 ni siquiera aparece en la tabla de benchmarks de Fugu. Sakana lo excluye alegando que no es accesible públicamente. Hacemos lo que podemos: estamos comprobando el puñado de benchmarks que aparecen en las tablas publicadas por ambos laboratorios con líneas base coincidentes. Y para cerrar, hablaremos de precios y disponibilidad.
\nSi quieres repasar cada sistema por separado, tenemos artículos dedicados: lee nuestra cobertura de Claude Fable 5 y el análisis de Sakana Fugu.
\n¿Qué es Sakana Fugu?
\nSakana Fugu no es un único modelo entrenado en el sentido convencional. Es un orquestador: un modelo que recibe tu solicitud, decide si responder directamente o delegar en modelos especialistas de un pool, gestiona la verificación y la síntesis, y devuelve una única respuesta a través de una API compatible con OpenAI. Por fuera llamas a un endpoint; por dentro, un conjunto coordinado de modelos punteros hace el trabajo.
\nSe ofrece en dos variantes. Fugu equilibra calidad y baja latencia y se posiciona como el modelo por defecto para el día a día en tareas de codificación, revisión y servicios interactivos. Fugu Ultra coordina un pool más amplio de agentes expertos y está afinado para maximizar la calidad de respuesta en problemas difíciles y de varios pasos: reproducción de artículos, análisis de ciberseguridad, data science al estilo Kaggle, investigaciones de patentes.
\nLa propuesta combina dos ideas.
\n- \n
- Primero, una orquestación aprendida: el coordinador está entrenado para decidir cuándo delegar y cómo combinar salidas, en lugar de ejecutar un pipeline programado a mano. \n
- Segundo, un pool de agentes intercambiable: cuando un nuevo modelo puntero pasa a estar disponible públicamente, Sakana espera tardar unas dos semanas en integrarlo. (Importante para el resto del artículo: Fable 5 no está en ese pool porque no es accesible públicamente). \n
¿Qué es Claude Fable 5?
\nClaude Fable 5 es un modelo de clase Mythos, una categoría que Anthropic sitúa por encima de su clase Opus, hecho seguro para uso general mediante un conjunto de clasificadores. Es el mismo modelo subyacente que Claude Mythos 5; la diferencia es que Fable 5 funciona (funcionaba) con clasificadores de seguridad activos, mientras que a Mythos 5 se le levantan algunos y se restringe a socios de Project Glasswing y a investigadores selectos en biología.
\nAnthropic afirmaba que Fable 5 marcaba el estado del arte en casi todos los benchmarks que sigue, con una ventaja creciente en tareas más largas y complejas. El dato clave práctico: cuando una consulta roza ciberseguridad, biología/química o destilación de modelos, un clasificador en dos etapas redirige la respuesta a Claude Opus 4.8 e informa al usuario.
\nSakana Fugu vs. Claude Fable 5: benchmarks
\nLa tabla comparativa publicada por Sakana excluye a Fable 5 y Mythos Preview, alegando que no son accesibles públicamente y por tanto no pueden estar en el pool de Fugu. Así, las cifras oficiales de Fugu se comparan con Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, que puedes ver en la tabla de abajo. Fugu gana en 10 de 11 benchmarks.
\n| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* andamiaje mini-swe-agent. † líneas base reportadas por los proveedores. Todas las puntuaciones de Fugu son reportadas por Sakana y aún no han sido reproducidas de forma independiente.
\nPara incluir a Fable 5 en la foto, crucé los benchmarks que aparecen tanto en la tabla de Anthropic como en la de Sakana y verifiqué que las líneas base compartidas coinciden. En SWE-Bench Pro y Humanity's Last Exam (sin herramientas), las cifras de Opus 4.8, GPT-5.5 y Gemini 3.1 Pro son idénticas en ambas fuentes, así que esas dos comparativas son limpias. Reducido solo a los dos sistemas, el cara a cara queda así:
\n| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Líder |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (sin herramientas) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ Los laboratorios reportan líneas base distintas y usan andamiajes diferentes en TerminalBench, así que las condiciones no son idénticas.
\nEstos son los únicos benchmarks que hemos encontrado con resultados publicados directamente comparables. Fable 5 lidera los tres.
\nAsí que, en todos los benchmarks donde es posible un cara a cara, Fable 5 supera a Fugu Ultra por unos 6–9 puntos. Encaja con el terreno donde Fable 5 está diseñado para ganar: tareas de largo recorrido evaluadas al final, donde un único modelo más fuerte acumula menos errores compuestos.
\nEn resumen:
\n- \n
- Todas las cifras de Fugu son auto-reportadas y aún no han aparecido en rankings de terceros. \n
- Sakana describe a Fugu como \"codo con codo\" con Fable 5 y Mythos Preview. Dados los márgenes anteriores, es una lectura defendible pero generosa. \"Cerca, pero por detrás\" es más preciso. \n
- Los conjuntos de comparación solo se solapan parcialmente. Fable 5 lidera en visión (puede reconstruir el código fuente de una web a partir de capturas), algo que Fugu no enfatiza; Fugu publica benchmarks de contexto largo y banca que la tabla de Anthropic no cubre. Están optimizados para trabajos de forma algo distinta. \n
Sakana Fugu vs. Claude Fable 5: disponibilidad y acceso
\nClaude Fable 5 está suspendido por el momento. Anthropic retiró el acceso a Fable 5 y Mythos 5 el 12 de junio tras una directiva de control de exportaciones de EE. UU., y afirma estar trabajando para restaurarlo lo antes posible. Sus otros modelos, como Opus 4.8, siguen disponibles.
\nSakana Fugu está disponible ya a través de console.sakana.ai con una API compatible con OpenAI, excepto en la UE y el EEE, donde Sakana ha pausado la disponibilidad mientras resuelve el cumplimiento de GDPR. No he podido obtener un plazo exacto.
Ahora mismo, un equipo europeo podría no poder usar ninguno de los dos modelos.
\nReflexión final
\nSobre el papel, es un duelo real y ajustado entre dos filosofías.
\nAnthropic apuesta por la escala: un modelo de clase Mythos tan capaz que necesita un sistema de clasificadores paralelo.
\nSakana apuesta por la coordinación: que un orquestador entrenado sobre un pool intercambiable puede mantenerse cerca de cualquier modelo puntero individual siendo más barato, más resiliente y agnóstico al proveedor.
\nLos benchmarks, tomados al pie de la letra, dicen que la apuesta de Anthropic produce el artefacto más fuerte en las pruebas comparables, mientras que la de Sakana produce el más disponible y económico.

Preguntas frecuentes sobre Sakana Fugu vs. Claude Fable
¿Sakana Fugu es mejor que Claude Fable 5?
En los benchmarks donde es posible la comparación directa (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 supera a Fugu Ultra por unos 6–9 puntos.
¿Por qué Fable 5 no aparece en la tabla de benchmarks de Fugu?
Sakana excluye a Fable 5 y Mythos Preview porque no son accesibles públicamente y, por tanto, no pueden formar parte del pool de agentes de Fugu. Su comparativa oficial es contra Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, a los que Fugu Ultra supera en 10 de 11 benchmarks.
¿Cuál es más barato?
Fugu Ultra, a 5 $/M de entrada y 30 $/M de salida, cuesta aproximadamente la mitad que Fable 5 (10 $/M de entrada y 50 $/M de salida). Ambos ofrecen planes mensuales de 20/100/200 $.
¿Volverá Fable 5?
Anthropic afirma que trabaja para restablecer el acceso a Fable 5 y Mythos 5 lo antes posible, pero no ha publicado un calendario. El resto de sus modelos, incluido Opus 4.8, siguen disponibles mientras tanto.
¿Fugu realmente esquiva la suspensión de Fable 5?
No directamente: Fable 5 nunca estuvo en el pool de Fugu, así que Fugu no puede recuperar sus capacidades específicas.
