Ir al contenido principal

Sakana Fugu vs. Claude Fable 5: benchmarks, precios y más

Claude Fable 5 gana en benchmarks pero está suspendido por ahora. Sakana Fugu ya está disponible y cuesta la mitad.
Actualizado 31 ago 2026  · 6 min leer

Explorar con IA

ChatGPTClaudePerplexity

Sakana presenta Fugu como un rival directo de Fable 5, pero deja fuera a Fable 5 de su propia tabla de benchmarks. Así que vamos a comparar ambos modelos en paralelo todo lo que sea realmente posible.

\n

Contexto rápido. El gobierno de EE. UU. suspendió el acceso público a Claude Fable 5 apenas tres días después de su lanzamiento por parte de Anthropic. Y Fable 5 se presentó como su modelo más capaz. Dos semanas después, la japonesa Sakana AI ha publicado Fugu con grandes promesas. Una en particular ha corrido como la pólvora: Sakana AI asegura que Fugu Ultra \"está a la altura de modelos líderes como Fable 5 y Mythos Preview\" en los benchmarks más exigentes de ingeniería, ciencia y razonamiento del sector, y sin riesgos de control de exportaciones. El CEO David Ha dijo en X que Fugu demuestra que un conjunto intercambiable de agentes orquestados puede igualar a modelos punteros restringidos como Fable.

\n

No es fácil verificar estas afirmaciones porque Fable 5 ni siquiera aparece en la tabla de benchmarks de Fugu. Sakana lo excluye alegando que no es accesible públicamente. Hacemos lo que podemos: estamos comprobando el puñado de benchmarks que aparecen en las tablas publicadas por ambos laboratorios con líneas base coincidentes. Y para cerrar, hablaremos de precios y disponibilidad.

\n

Si quieres repasar cada sistema por separado, tenemos artículos dedicados: lee nuestra cobertura de Claude Fable 5 y el análisis de Sakana Fugu.

\n

¿Qué es Sakana Fugu?

\n

Sakana Fugu no es un único modelo entrenado en el sentido convencional. Es un orquestador: un modelo que recibe tu solicitud, decide si responder directamente o delegar en modelos especialistas de un pool, gestiona la verificación y la síntesis, y devuelve una única respuesta a través de una API compatible con OpenAI. Por fuera llamas a un endpoint; por dentro, un conjunto coordinado de modelos punteros hace el trabajo.

\n

Se ofrece en dos variantes. Fugu equilibra calidad y baja latencia y se posiciona como el modelo por defecto para el día a día en tareas de codificación, revisión y servicios interactivos. Fugu Ultra coordina un pool más amplio de agentes expertos y está afinado para maximizar la calidad de respuesta en problemas difíciles y de varios pasos: reproducción de artículos, análisis de ciberseguridad, data science al estilo Kaggle, investigaciones de patentes.

\n

La propuesta combina dos ideas.

\n
    \n
  • Primero, una orquestación aprendida: el coordinador está entrenado para decidir cuándo delegar y cómo combinar salidas, en lugar de ejecutar un pipeline programado a mano.
  • \n
  • Segundo, un pool de agentes intercambiable: cuando un nuevo modelo puntero pasa a estar disponible públicamente, Sakana espera tardar unas dos semanas en integrarlo. (Importante para el resto del artículo: Fable 5 no está en ese pool porque no es accesible públicamente).
  • \n
\n

¿Qué es Claude Fable 5?

\n

Claude Fable 5 es un modelo de clase Mythos, una categoría que Anthropic sitúa por encima de su clase Opus, hecho seguro para uso general mediante un conjunto de clasificadores. Es el mismo modelo subyacente que Claude Mythos 5; la diferencia es que Fable 5 funciona (funcionaba) con clasificadores de seguridad activos, mientras que a Mythos 5 se le levantan algunos y se restringe a socios de Project Glasswing y a investigadores selectos en biología.

\n

Anthropic afirmaba que Fable 5 marcaba el estado del arte en casi todos los benchmarks que sigue, con una ventaja creciente en tareas más largas y complejas. El dato clave práctico: cuando una consulta roza ciberseguridad, biología/química o destilación de modelos, un clasificador en dos etapas redirige la respuesta a Claude Opus 4.8 e informa al usuario.

\n

Sakana Fugu vs. Claude Fable 5: benchmarks

\n

La tabla comparativa publicada por Sakana excluye a Fable 5 y Mythos Preview, alegando que no son accesibles públicamente y por tanto no pueden estar en el pool de Fugu. Así, las cifras oficiales de Fugu se comparan con Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, que puedes ver en la tabla de abajo. Fugu gana en 10 de 11 benchmarks.

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
BenchmarkFuguFugu UltraOpus 4.8 †Gemini 3.1 Pro †GPT-5.5 †
SWE-Bench Pro *59.073.769.254.258.6
TerminalBench 2.180.282.174.670.378.2
LiveCodeBench92.993.287.888.585.3
LiveCodeBench Pro87.890.884.882.988.4
Humanity's Last Exam47.250.049.844.441.4
CharXiv Reasoning85.186.684.283.384.1
GPQA-D95.595.592.094.393.6
SciCode60.158.753.558.956.1
τ³ Banking21.720.620.68.420.6
Long Context Reasoning74.773.367.772.774.3
MRCRv286.693.687.984.994.8
\n

* andamiaje mini-swe-agent. † líneas base reportadas por los proveedores. Todas las puntuaciones de Fugu son reportadas por Sakana y aún no han sido reproducidas de forma independiente.

\n
\n

Para incluir a Fable 5 en la foto, crucé los benchmarks que aparecen tanto en la tabla de Anthropic como en la de Sakana y verifiqué que las líneas base compartidas coinciden. En SWE-Bench Pro y Humanity's Last Exam (sin herramientas), las cifras de Opus 4.8, GPT-5.5 y Gemini 3.1 Pro son idénticas en ambas fuentes, así que esas dos comparativas son limpias. Reducido solo a los dos sistemas, el cara a cara queda así:

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
BenchmarkSakana FuguSakana Fugu UltraClaude Fable 5Líder
SWE-Bench Pro59.073.780.3Fable 5 (+6.6)
Humanity's Last Exam (sin herramientas)47.250.059.0Fable 5 (+9.0)
Terminal-Bench 2.1 ‡80.282.188.0Fable 5 (+5.9)
\n
\n

‡ Los laboratorios reportan líneas base distintas y usan andamiajes diferentes en TerminalBench, así que las condiciones no son idénticas.

\n

Estos son los únicos benchmarks que hemos encontrado con resultados publicados directamente comparables. Fable 5 lidera los tres.

\n

Así que, en todos los benchmarks donde es posible un cara a cara, Fable 5 supera a Fugu Ultra por unos 6–9 puntos. Encaja con el terreno donde Fable 5 está diseñado para ganar: tareas de largo recorrido evaluadas al final, donde un único modelo más fuerte acumula menos errores compuestos.

\n

En resumen:

\n
    \n
  1. Todas las cifras de Fugu son auto-reportadas y aún no han aparecido en rankings de terceros.
  2. \n
  3. Sakana describe a Fugu como \"codo con codo\" con Fable 5 y Mythos Preview. Dados los márgenes anteriores, es una lectura defendible pero generosa. \"Cerca, pero por detrás\" es más preciso.
  4. \n
  5. Los conjuntos de comparación solo se solapan parcialmente. Fable 5 lidera en visión (puede reconstruir el código fuente de una web a partir de capturas), algo que Fugu no enfatiza; Fugu publica benchmarks de contexto largo y banca que la tabla de Anthropic no cubre. Están optimizados para trabajos de forma algo distinta.
  6. \n
\n

Sakana Fugu vs. Claude Fable 5: disponibilidad y acceso

\n

Claude Fable 5 está suspendido por el momento. Anthropic retiró el acceso a Fable 5 y Mythos 5 el 12 de junio tras una directiva de control de exportaciones de EE. UU., y afirma estar trabajando para restaurarlo lo antes posible. Sus otros modelos, como Opus 4.8, siguen disponibles.

\n

Sakana Fugu está disponible ya a través de console.sakana.ai con una API compatible con OpenAI, excepto en la UE y el EEE, donde Sakana ha pausado la disponibilidad mientras resuelve el cumplimiento de GDPR. No he podido obtener un plazo exacto.

\n

Ahora mismo, un equipo europeo podría no poder usar ninguno de los dos modelos.

\n

Reflexión final

\n

Sobre el papel, es un duelo real y ajustado entre dos filosofías.

\n

Anthropic apuesta por la escala: un modelo de clase Mythos tan capaz que necesita un sistema de clasificadores paralelo.

\n

Sakana apuesta por la coordinación: que un orquestador entrenado sobre un pool intercambiable puede mantenerse cerca de cualquier modelo puntero individual siendo más barato, más resiliente y agnóstico al proveedor.

\n

Los benchmarks, tomados al pie de la letra, dicen que la apuesta de Anthropic produce el artefacto más fuerte en las pruebas comparables, mientras que la de Sakana produce el más disponible y económico.


Josef Waples's photo
Author
Josef Waples

Preguntas frecuentes sobre Sakana Fugu vs. Claude Fable

¿Sakana Fugu es mejor que Claude Fable 5?

En los benchmarks donde es posible la comparación directa (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 supera a Fugu Ultra por unos 6–9 puntos.

¿Por qué Fable 5 no aparece en la tabla de benchmarks de Fugu?

Sakana excluye a Fable 5 y Mythos Preview porque no son accesibles públicamente y, por tanto, no pueden formar parte del pool de agentes de Fugu. Su comparativa oficial es contra Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, a los que Fugu Ultra supera en 10 de 11 benchmarks.

¿Cuál es más barato?

Fugu Ultra, a 5 $/M de entrada y 30 $/M de salida, cuesta aproximadamente la mitad que Fable 5 (10 $/M de entrada y 50 $/M de salida). Ambos ofrecen planes mensuales de 20/100/200 $.

¿Volverá Fable 5?

Anthropic afirma que trabaja para restablecer el acceso a Fable 5 y Mythos 5 lo antes posible, pero no ha publicado un calendario. El resto de sus modelos, incluido Opus 4.8, siguen disponibles mientras tanto.

¿Fugu realmente esquiva la suspensión de Fable 5?

No directamente: Fable 5 nunca estuvo en el pool de Fugu, así que Fugu no puede recuperar sus capacidades específicas.

Temas
Inteligencia Artificial

Aprende IA con DataCamp

programa

IA para ingeniería de software

7 h
Escribe código y crea aplicaciones de software más rápido que nunca con las últimas herramientas de programadores de IA, como GitHub Copilot, Windsurf y Replit.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Los 7 mejores generadores de vídeo con IA para 2026 con vídeos de ejemplo

Descubre los mejores generadores de vídeo con IA disponibles en la actualidad, entre los que se incluyen RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo y los muy esperados Sora y Veo de DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

Tutorial

Tutorial FLAN-T5: Guía y puesta a punto

Una guía completa para afinar un modelo FLAN-T5 para una tarea de respuesta a preguntas utilizando la biblioteca de transformadores, y ejecutando la inferencia optmizada en un escenario del mundo real.
Zoumana Keita 's photo

Zoumana Keita

15 min

Tutorial

Primeros pasos con Claude 3 y la API de Claude 3

Conozca los modelos Claude 3, las pruebas de rendimiento detalladas y cómo acceder a ellas. Además, descubra la nueva API Python de Claude 3 para generar texto, acceder a funciones de visión y streaming.
Abid Ali Awan's photo

Abid Ali Awan

Tutorial

Tutorial de DeepSeek-Coder-V2: Ejemplos, instalación, puntos de referencia

DeepSeek-Coder-V2 es un modelo de lenguaje de código de código abierto que rivaliza con el rendimiento de GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B o Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Tutorial

RAG Con Llama 3.1 8B, Ollama y Langchain: Tutorial

Aprende a crear una aplicación RAG con Llama 3.1 8B utilizando Ollama y Langchain, configurando el entorno, procesando documentos, creando incrustaciones e integrando un recuperador.
Ryan Ong's photo

Ryan Ong

12 min

Tutorial

Ajuste fino de SAM 2 en un conjunto de datos personalizado: Tutorial

Aprende a afinar SAM 2 de Meta AI utilizando el conjunto de datos de segmentación de TC torácica para mejorar el rendimiento de segmentación de imágenes del modelo en el análisis de imágenes médicas.
Aashi Dutt's photo

Aashi Dutt

14 min

Ver MásVer Más