Перейти к основному контенту

Sakana Fugu и Claude Fable 5: бенчмарки, цены и другое

Claude Fable 5 выигрывает в бенчмарках, но сейчас недоступен. Sakana Fugu уже доступен и стоит вдвое дешевле.
Обновлено 31 авг. 2026 г.  · 6 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

Sakana позиционирует Fugu как сопоставимый с Fable 5, но исключает Fable 5 из своей собственной таблицы бенчмарков. Поэтому мы сравним эти две модели бок о бок настолько, насколько это реально возможно.

\n

Немного предыстории. Правительство США приостановило публичный доступ к Claude Fable 5 спустя едва ли три дня после запуска Anthropic. А Fable 5 подавался как самая способная модель компании. Спустя две недели токийская Sakana AI выпустила Fugu с громкими заявлениями. Одно из них особенно разошлось: Sakana AI утверждает, что Fugu Ultra «стоит плечом к плечу с ведущими моделями вроде Fable 5 и Mythos Preview» на самых сложных отраслевых бенчмарках по инженерии, науке и рассуждениям — и без рисков, связанных с экспортным контролем. Гендиректор Дэвид Ха написал в X, что Fugu доказывает: взаимозаменяемый пул скоординированных агентов может соперничать с ограниченными передовыми моделями вроде Fable.

\n

Проверить эти заявления непросто, потому что Fable 5 вовсе не фигурирует в таблице бенчмарков Fugu. Sakana исключает его на том основании, что он недоступен публично. Мы делаем всё, что можем: проверяем те немногие бенчмарки, которые присутствуют в опубликованных таблицах обеих лабораторий и имеют совпадающие базовые значения. И в завершение поговорим о ценах и ситуации с доступом

\n

Если вам нужна справка по каждой системе отдельно, у нас есть соответствующие материалы: ознакомьтесь с нашей публикацией о Claude Fable 5 и разбором Sakana Fugu.

\n

Что такое Sakana Fugu?

\n

Sakana Fugu — это не одна обученная модель в обычном смысле. Это оркестратор: модель, которая получает ваш запрос, решает, отвечать ли напрямую или делегировать специалистам из пула моделей, управляет проверкой и синтезом и возвращает единый ответ через совместимый с OpenAI API. Снаружи вы обращаетесь к одной конечной точке; внутри работу выполняет скоординирированный набор передовых моделей.

\n

Есть две версии. Fugu балансирует качество и низкую задержку и позиционируется как повседневный выбор для кодинга, ревью и интерактивных сервисов. Fugu Ultra координирует более глубокий пул экспертов-агентов и настроен на максимальное качество ответов в сложных многошаговых задачах — воспроизведение научных работ, анализ кибербезопасности, дата-сайенс в стиле Kaggle, патентные исследования.

\n

Идея на самом деле состоит из двух идей.

\n
    \n
  • Во-первых, обучаемая оркестрация: координатор обучается решать, когда делегировать и как комбинировать выходы, а не запускает жёстко прописанный конвейер.
  • \n
  • Во-вторых, заменяемый пул агентов: когда новая передовая модель становится публично доступной, Sakana рассчитывает примерно за две недели интегрировать её. (Важно для остальной статьи: Fable 5 не входит в этот пул, потому что он недоступен публично.)
  • \n
\n

Что такое Claude Fable 5?

\n

Claude Fable 5 — это модель класса Mythos, то есть уровня, который Anthropic позиционирует выше класса Opus, сделанная безопасной для общего использования с помощью набора классификаторов. Это та же базовая модель, что и Claude Mythos 5; разница в том, что Fable 5 работает (работал) с активными классификаторами безопасности, тогда как в Mythos 5 часть из них снята, и он доступен только партнёрам Project Glasswing и отдельным исследователям в области биологии.

\n

Anthropic утверждала, что Fable 5 показывает передовой уровень почти на каждом бенчмарке, который компания отслеживает, причём отрыв растёт на более длинных и сложных задачах. Ключевая практическая деталь: когда запрос касается кибербезопасности, биологии/химии или дистилляции моделей, двухступенчатый классификатор перенаправляет ответ на Claude Opus 4.8 и сообщает об этом пользователю. 

\n

Sakana Fugu vs. Claude Fable 5: бенчмарки

\n

Опубликованная сравнилельная таблица Sakana исключает Fable 5 и Mythos Preview, поскольку они недоступны публично и не могут входить в пул Fugu. Поэтому официальные цифры Fugu сравниваются с Opus 4.8, GPT-5.5 и Gemini 3.1 Pro — всё это вы видите в таблице ниже. По ним он выигрывает в 10 из 11 бенчмарков. 

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
БенчмаркFuguFugu UltraOpus 4.8 †Gemini 3.1 Pro †GPT-5.5 †
SWE-Bench Pro *59.073.769.254.258.6
TerminalBench 2.180.282.174.670.378.2
LiveCodeBench92.993.287.888.585.3
LiveCodeBench Pro87.890.884.882.988.4
Humanity's Last Exam47.250.049.844.441.4
CharXiv Reasoning85.186.684.283.384.1
GPQA-D95.595.592.094.393.6
SciCode60.158.753.558.956.1
τ³ Banking21.720.620.68.420.6
Long Context Reasoning74.773.367.772.774.3
MRCRv286.693.687.984.994.8
\n

* мини-scaffolding mini-swe-agent. † базовые значения по данным провайдеров. Все оценки Fugu предоставлены Sakana и ещё не воспроизведены независимо.

\n
\n

Чтобы включить Fable 5 в картину, мы сопоставили бенчмарки, которые есть и в таблице Anthropic, и в таблице Sakana, и проверили совпадение общих базовых значений. В SWE-Bench Pro и Humanity's Last Exam (без инструментов) значения для Opus 4.8, GPT-5.5 и Gemini 3.1 Pro идентичны в обоих источниках — так что эти два сравнения корректны. Если свести лишь к двум системам, очная встреча выглядит так:

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
БенчмаркSakana FuguSakana Fugu UltraClaude Fable 5Лидер
SWE-Bench Pro59.073.780.3Fable 5 (+6.6)
Humanity's Last Exam (без инструментов)47.250.059.0Fable 5 (+9.0)
Terminal-Bench 2.1 ‡80.282.188.0Fable 5 (+5.9)
\n
\n

‡ Лаборатории приводят разные базовые значения и используют разные каркасы для TerminalBench, поэтому условия не идентичны.

\n

Это единственные бенчмарки, по которым опубликованные результаты можно сравнить напрямую. Fable 5 лидирует во всех трёх.

\n

Итак, на каждом бенчмарке, где возможно очное сравнение, Fable 5 опережает Fugu Ultra примерно на 6–9 пунктов. Это согласуется с тем, где Fable 5 задуман побеждать: в длительных задачах с оценкой по итоговому результату, где одна более сильная модель накапливает меньше суммарных ошибок.

\n

В итоге:

\n
    \n
  1. Все показатели Fugu — саморепорт и пока не появились на сторонних таблицах лидеров.
  2. \n
  3. Sakana описывает Fugu как «плечом к плечу» с Fable 5 и Mythos Preview. С учётом приведённых разрывов это трактовка допустимая, но щедрая. Точнее будет сказать: «близко, но позади».
  4. \n
  5. Наборы для сравнения пересекаются лишь частично. Fable 5 лидирует в задачах зрения (он может восстановить исходники веб‑приложения по скриншотам), на чём Fugu вовсе не делает акцента; Fugu публикует бенчмарки по длинному контексту и банкингу, которых нет в таблице Anthropic. То есть они оптимизированы под несколько разные типы работы.
  6. \n
\n

Sakana Fugu vs. Claude Fable 5: доступность и доступ

\n

Доступ к Claude Fable 5 сейчас приостановлен. Anthropic отключила доступ к Fable 5 и Mythos 5 12 июня вслед за директивой правительства США об экспортном контроле и заявляет, что работает над как можно более скорым восстановлением доступа. Другие модели Anthropic, такие как Opus 4.8, по-прежнему доступны.

\n

Sakana Fugu доступен уже сейчас через console.sakana.ai с API, совместимым с OpenAI, — кроме ЕС и ЕЭЗ, где Sakana приостановила доступность, пока дорабатывает соответствие GDPR. Точных сроков получить не удалось.

\n

Сейчас европейской команде может быть недоступна ни одна из моделей.

\n

Итоги

\n

На бумаге это честное и близкое состязание двух философий.

\n

Anthropic делает ставку на масштаб — одна модель класса Mythos настолько мощна, что ей требуется параллельная система классификаторов.

\n

Sakana ставит на координацию — что обученный оркестратор поверх заменяемого пула сможет держаться на расстоянии удара от любой отдельной передовой модели, оставаясь при этом дешевле, устойчивее и независимее от провайдеров.

\n

Если принять бенчмарки за данность, ставка Anthropic даёт более сильный артефакт на сопоставимых тестах, тогда как ставка Sakana — более доступный и дешёвый.

Sakana Fugu и Claude Fable: часто задаваемые вопросы

Sakana Fugu лучше, чем Claude Fable 5?

На бенчмарках, где возможно прямое сравнение (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 опережает Fugu Ultra примерно на 6–9 пунктов. 

Почему Fable 5 нет в таблице бенчмарков Fugu?

Sakana исключает Fable 5 и Mythos Preview, поскольку они недоступны публично и не могут быть частью пула агентов Fugu. Официальное сравнение проводится с Opus 4.8, GPT-5.5 и Gemini 3.1 Pro, и по 10 из 11 бенчмарков Fugu Ultra опережает их.

Какая из них дешевле?

Fugu Ultra при цене $5 за 1M входных токенов и $30 за 1M выходных примерно вдвое дешевле Fable 5 с $10 за 1M входных и $50 за 1M выходных. Обе системы предлагают месячные тарифы $20/$100/$200.

Вернётся ли Fable 5?

Anthropic заявляет, что работает над скорейшим восстановлением доступа к Fable 5 и Mythos 5, но сроки не публиковала. Между тем другие модели, включая Opus 4.8, остаются доступными.

Действительно ли Fugu обходит приостановку Fable 5?

Напрямую — нет: Fable 5 никогда не входил в пул Fugu, так что Fugu не может воспроизвести его конкретные возможности.

Темы
Искусственный интеллект

Изучайте ИИ с DataCamp

Track

ИИ для разработки программного обеспечения

7 ч
Пишите код и создавайте программные приложения быстрее, чем когда-либо, с помощью новейших ИИ-инструментов для разработчиков, включая GitHub Copilot, Windsurf и Replit.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow