Pular para o conteúdo principal

Sakana Fugu vs. Claude Fable 5: benchmarks, preços e mais

O Claude Fable 5 vence nos benchmarks, mas está suspenso no momento. O Sakana Fugu já está disponível e custa metade.
Atualizado 31 de ago. de 2026  · 6 min lido

Explorar com IA

ChatGPTClaudePerplexity

A Sakana promove o Fugu como equivalente ao Fable 5, mas deixa o Fable 5 fora da sua própria tabela de benchmarks. Então, vamos comparar os dois modelos lado a lado, na medida do possível.

Aqui vai o contexto. O governo dos EUA suspendeu o acesso público ao Claude Fable 5 apenas três dias após o lançamento pela Anthropic. E o Fable 5 foi anunciado como seu modelo mais capaz. Duas semanas depois, a Sakana AI, de Tóquio, lançou o Fugu com várias promessas. Uma em especial ganhou destaque: a Sakana AI diz que o Fugu Ultra "fica ombro a ombro com modelos líderes como Fable 5 e Mythos Preview" nos benchmarks mais difíceis de engenharia, ciência e raciocínio do setor — e sem risco de controle de exportação. O CEO David Ha disse no X que o Fugu prova que um pool intercambiável de agentes orquestrados pode equiparar modelos de fronteira restritos como o Fable.

As afirmações são um pouco difíceis de checar porque o Fable 5 não aparece na tabela de benchmarks do Fugu. A Sakana o exclui pelo fato de não estar publicamente acessível. Vamos fazer o que dá: estamos conferindo os poucos benchmarks que aparecem nas tabelas publicadas por ambos os labs, com as mesmas linhas de base. Para fechar, vamos falar de preços e da situação de acesso.

Se você quer conhecer melhor cada sistema, temos posts sobre isso: leia nossa cobertura do Claude Fable 5 e o artigo sobre o Sakana Fugu.

O que é o Sakana Fugu?

O Sakana Fugu não é um único modelo treinado no sentido tradicional. Ele é um orquestrador: um modelo que recebe seu pedido, decide se responde diretamente ou delega a modelos especialistas em um pool, gerencia verificação e síntese e devolve uma resposta por meio de uma única API compatível com a OpenAI. Por fora, você chama um endpoint; por dentro, um conjunto coordenado de modelos de ponta faz o trabalho.

Ele chega em duas variantes. Fugu equilibra qualidade com baixa latência e é posicionado como padrão do dia a dia para código, revisão e serviços interativos. Fugu Ultra coordena um pool mais profundo de agentes especialistas e é ajustado para máxima qualidade de resposta em problemas difíceis e de múltiplas etapas — reprodução de artigos, análise de cibersegurança, data science no estilo Kaggle, investigações de patentes.

A proposta, na prática, são duas ideias.

  • Primeiro, orquestração aprendida: o coordenador é treinado para decidir quando delegar e como combinar saídas, em vez de rodar um pipeline codificado à mão.
  • Segundo, um pool de agentes intercambiável: quando um novo modelo de fronteira se torna publicamente disponível, a Sakana espera levar cerca de duas semanas para integrá-lo. (Importante para o restante do artigo: o Fable 5 não está nesse pool porque não é publicamente acessível.)

O que é o Claude Fable 5?

O Claude Fable 5 é um modelo da classe Mythos, um nível que a Anthropic posiciona acima da classe Opus, tornado seguro para uso geral por meio de um conjunto de classificadores. É o mesmo modelo subjacente do Claude Mythos 5; a diferença é que o Fable 5 roda (rodava) com classificadores de segurança ativos, enquanto o Mythos 5 tem alguns deles desativados e é restrito a parceiros do Project Glasswing e a alguns pesquisadores de biologia.

A Anthropic afirmava que o Fable 5 era o estado da arte em quase todos os benchmarks que acompanha, com a vantagem crescendo em tarefas mais longas e complexas. O ponto prático principal: quando uma consulta envolve cibersegurança, biologia/química ou destilação de modelos, um classificador em duas etapas redireciona a resposta para o Claude Opus 4.8 e avisa o usuário sobre isso. 

Sakana Fugu vs. Claude Fable 5: benchmarks

A tabela de comparação publicada pela Sakana exclui o Fable 5 e o Mythos Preview, alegando que não são publicamente acessíveis e, portanto, não podem estar no pool do Fugu. Assim, os números oficiais do Fugu são medidos contra o Opus 4.8, o GPT-5.5 e o Gemini 3.1 Pro, todos listados na tabela abaixo. Dá para ver o Fugu vencer em 10 de 11 benchmarks. 

Benchmark Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* scaffolding mini-swe-agent. † linhas de base reportadas pelos provedores. Todas as pontuações do Fugu são informadas pela Sakana e ainda não foram reproduzidas de forma independente.

Para incluir o Fable 5 na análise, fiz um cruzamento dos benchmarks que aparecem tanto na tabela da Anthropic quanto na da Sakana e verifiquei se as linhas de base em comum batiam. No SWE-Bench Pro e no Humanity's Last Exam (sem ferramentas), os números de Opus 4.8, GPT-5.5 e Gemini 3.1 Pro são idênticos nas duas fontes — então essas duas comparações são limpas. Reduzindo só aos dois sistemas, o confronto direto fica assim:

Benchmark Sakana Fugu Sakana Fugu Ultra Claude Fable 5 Líder
SWE-Bench Pro 59.0 73.7 80.3 Fable 5 (+6,6)
Humanity's Last Exam (sem ferramentas) 47.2 50.0 59.0 Fable 5 (+9,0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5 (+5,9)

‡ Os dois labs reportam linhas de base diferentes e usam scaffolds distintos no TerminalBench, então as condições não são idênticas.

Estes foram os únicos benchmarks em que encontramos resultados publicados diretamente comparáveis. O Fable 5 lidera os três.

Portanto, em todo benchmark onde uma comparação lado a lado é possível, o Fable 5 fica à frente do Fugu Ultra por cerca de 6–9 pontos. Isso condiz com onde o Fable 5 foi projetado para vencer: tarefas de longo horizonte, avaliadas no fim, em que um único modelo mais forte acumula menos erros compostos.

Em resumo:

  1. Todos os números do Fugu são autorreportados e ainda não apareceram em leaderboards de terceiros.
  2. A Sakana caracteriza o Fugu como "ombro a ombro" com o Fable 5 e o Mythos Preview. Diante das diferenças acima, é uma leitura defensável, mas generosa. "Perto, porém atrás" é mais preciso.
  3. Os conjuntos de comparação só se sobrepõem parcialmente. O Fable 5 lidera em visão (ele consegue reconstruir o código-fonte de um app web a partir de screenshots), algo que o Fugu não enfatiza; o Fugu publica benchmarks de contexto longo e de banking que a tabela da Anthropic não cobre. Ou seja, estão otimizados para formatos de trabalho um pouco diferentes.

Sakana Fugu vs. Claude Fable 5: disponibilidade e acesso

O Claude Fable 5 está suspenso no momento. A Anthropic retirou o acesso ao Fable 5 e ao Mythos 5 em 12 de junho após uma diretriz de controle de exportação do governo dos EUA e diz estar trabalhando para restaurar o acesso o quanto antes. Outros modelos da Anthropic, como o Opus 4.8, continuam disponíveis.

O Sakana Fugu está disponível agora em console.sakana.ai com uma API compatível com a OpenAI — exceto na UE e no EEE, onde a Sakana pausou a disponibilidade enquanto trabalha a conformidade com o GDPR. Não consegui um prazo exato.

No momento, uma equipe europeia pode não conseguir usar nenhum dos dois modelos.

Considerações finais

No papel, é um confronto real e equilibrado entre duas filosofias.

A Anthropic aposta em escala — um modelo da classe Mythos tão capaz que precisa de um sistema de classificadores paralelo.

A Sakana aposta em coordenação — que um orquestrador treinado sobre um pool intercambiável consegue se manter perto de qualquer modelo de fronteira individual, sendo mais barato, mais resiliente e agnóstico ao provedor.

Os benchmarks, tomados ao pé da letra, dizem que a aposta da Anthropic produz o artefato mais forte nos testes comparáveis, enquanto a da Sakana produz o mais disponível e barato.


Josef Waples's photo
Author
Josef Waples

Sakana Fugu vs. Claude Fable: perguntas frequentes

O Sakana Fugu é melhor que o Claude Fable 5?

Nos benchmarks em que é possível comparar lado a lado (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), o Fable 5 lidera o Fugu Ultra por cerca de 6–9 pontos. 

Por que o Fable 5 não está na tabela de benchmarks do Fugu?

A Sakana exclui o Fable 5 e o Mythos Preview porque não são publicamente acessíveis e, portanto, não podem fazer parte do pool de agentes do Fugu. A comparação oficial é contra Opus 4.8, GPT-5.5 e Gemini 3.1 Pro, que o Fugu Ultra supera em 10 de 11 benchmarks.

Qual é mais barato?

O Fugu Ultra, a US$ 5/M de entrada e US$ 30/M de saída, custa aproximadamente metade do Fable 5, que sai a US$ 10/M de entrada e US$ 50/M de saída. Ambos oferecem planos mensais de US$ 20/US$ 100/US$ 200.

O Fable 5 vai voltar?

A Anthropic diz que está trabalhando para restaurar o acesso ao Fable 5 e ao Mythos 5 o mais rápido possível, mas não publicou um cronograma. Seus outros modelos, incluindo o Opus 4.8, permanecem disponíveis nesse meio-tempo.

O Fugu realmente contorna a suspensão do Fable 5?

Não diretamente — o Fable 5 nunca esteve no pool do Fugu, então o Fugu não consegue recuperar suas capacidades específicas.

Tópicos
Inteligência Artificial

Aprenda IA com a DataCamp

Programa

IA para Engenharia de Software

7 h
Escreva código e crie aplicativos de software mais rápido do que nunca com as mais recentes ferramentas de desenvolvimento de IA, incluindo GitHub Copilot, Windsurf e Replit.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

Anthropic vs. OpenAI: Os Dois Gigantes da IA Comparados

Saiba como OpenAI e Anthropic lideram o desenvolvimento de IA com abordagens únicas. Explore produtos como o ChatGPT e os modelos inovadores que elas oferecem.
Khalid Abdelaty's photo

Khalid Abdelaty

15 min

blog

ChatGPT vs Google Bard: Um guia comparativo para chatbots de IA

Uma introdução amigável para iniciantes aos dois chatbots com tecnologia de IA sobre os quais todos estão falando.
Javier Canales Luna's photo

Javier Canales Luna

14 min

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

blog

Stability AI anuncia a difusão estável 3: Tudo o que sabemos até agora

Saiba mais sobre as novas atualizações do Stable Diffusion e descubra os recursos do modelo de texto para imagem da versão 3.
Richie Cotton's photo

Richie Cotton

blog

Metas para 2025: 60% dos brasileiros querem aprender sobre inteligência artificial neste ano

Buscas por cursos na área saltaram mais de 230% ao longo de 2024.
DataCamp Team's photo

DataCamp Team

6 min

Tutorial

Primeiros passos com o Claude 3 e a API do Claude 3

Saiba mais sobre os modelos Claude 3, benchmarks de desempenho detalhados e como acessá-los. Além disso, descubra a nova API Python do Claude 3 para geração de texto, acesso a recursos de visão e streaming.
Abid Ali Awan's photo

Abid Ali Awan

Ver MaisVer Mais