Track
Sakana позиционирует Fugu как сопоставимый с Fable 5, но исключает Fable 5 из своей собственной таблицы бенчмарков. Поэтому мы сравним эти две модели бок о бок настолько, насколько это реально возможно.
\nНемного предыстории. Правительство США приостановило публичный доступ к Claude Fable 5 спустя едва ли три дня после запуска Anthropic. А Fable 5 подавался как самая способная модель компании. Спустя две недели токийская Sakana AI выпустила Fugu с громкими заявлениями. Одно из них особенно разошлось: Sakana AI утверждает, что Fugu Ultra «стоит плечом к плечу с ведущими моделями вроде Fable 5 и Mythos Preview» на самых сложных отраслевых бенчмарках по инженерии, науке и рассуждениям — и без рисков, связанных с экспортным контролем. Гендиректор Дэвид Ха написал в X, что Fugu доказывает: взаимозаменяемый пул скоординированных агентов может соперничать с ограниченными передовыми моделями вроде Fable.
\nПроверить эти заявления непросто, потому что Fable 5 вовсе не фигурирует в таблице бенчмарков Fugu. Sakana исключает его на том основании, что он недоступен публично. Мы делаем всё, что можем: проверяем те немногие бенчмарки, которые присутствуют в опубликованных таблицах обеих лабораторий и имеют совпадающие базовые значения. И в завершение поговорим о ценах и ситуации с доступом
\nЕсли вам нужна справка по каждой системе отдельно, у нас есть соответствующие материалы: ознакомьтесь с нашей публикацией о Claude Fable 5 и разбором Sakana Fugu.
\nЧто такое Sakana Fugu?
\nSakana Fugu — это не одна обученная модель в обычном смысле. Это оркестратор: модель, которая получает ваш запрос, решает, отвечать ли напрямую или делегировать специалистам из пула моделей, управляет проверкой и синтезом и возвращает единый ответ через совместимый с OpenAI API. Снаружи вы обращаетесь к одной конечной точке; внутри работу выполняет скоординирированный набор передовых моделей.
\nЕсть две версии. Fugu балансирует качество и низкую задержку и позиционируется как повседневный выбор для кодинга, ревью и интерактивных сервисов. Fugu Ultra координирует более глубокий пул экспертов-агентов и настроен на максимальное качество ответов в сложных многошаговых задачах — воспроизведение научных работ, анализ кибербезопасности, дата-сайенс в стиле Kaggle, патентные исследования.
\nИдея на самом деле состоит из двух идей.
\n- \n
- Во-первых, обучаемая оркестрация: координатор обучается решать, когда делегировать и как комбинировать выходы, а не запускает жёстко прописанный конвейер. \n
- Во-вторых, заменяемый пул агентов: когда новая передовая модель становится публично доступной, Sakana рассчитывает примерно за две недели интегрировать её. (Важно для остальной статьи: Fable 5 не входит в этот пул, потому что он недоступен публично.) \n
Что такое Claude Fable 5?
\nClaude Fable 5 — это модель класса Mythos, то есть уровня, который Anthropic позиционирует выше класса Opus, сделанная безопасной для общего использования с помощью набора классификаторов. Это та же базовая модель, что и Claude Mythos 5; разница в том, что Fable 5 работает (работал) с активными классификаторами безопасности, тогда как в Mythos 5 часть из них снята, и он доступен только партнёрам Project Glasswing и отдельным исследователям в области биологии.
\nAnthropic утверждала, что Fable 5 показывает передовой уровень почти на каждом бенчмарке, который компания отслеживает, причём отрыв растёт на более длинных и сложных задачах. Ключевая практическая деталь: когда запрос касается кибербезопасности, биологии/химии или дистилляции моделей, двухступенчатый классификатор перенаправляет ответ на Claude Opus 4.8 и сообщает об этом пользователю.
\nSakana Fugu vs. Claude Fable 5: бенчмарки
\nОпубликованная сравнилельная таблица Sakana исключает Fable 5 и Mythos Preview, поскольку они недоступны публично и не могут входить в пул Fugu. Поэтому официальные цифры Fugu сравниваются с Opus 4.8, GPT-5.5 и Gemini 3.1 Pro — всё это вы видите в таблице ниже. По ним он выигрывает в 10 из 11 бенчмарков.
\n| Бенчмарк | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* мини-scaffolding mini-swe-agent. † базовые значения по данным провайдеров. Все оценки Fugu предоставлены Sakana и ещё не воспроизведены независимо.
\nЧтобы включить Fable 5 в картину, мы сопоставили бенчмарки, которые есть и в таблице Anthropic, и в таблице Sakana, и проверили совпадение общих базовых значений. В SWE-Bench Pro и Humanity's Last Exam (без инструментов) значения для Opus 4.8, GPT-5.5 и Gemini 3.1 Pro идентичны в обоих источниках — так что эти два сравнения корректны. Если свести лишь к двум системам, очная встреча выглядит так:
\n| Бенчмарк | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Лидер |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (без инструментов) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ Лаборатории приводят разные базовые значения и используют разные каркасы для TerminalBench, поэтому условия не идентичны.
\nЭто единственные бенчмарки, по которым опубликованные результаты можно сравнить напрямую. Fable 5 лидирует во всех трёх.
\nИтак, на каждом бенчмарке, где возможно очное сравнение, Fable 5 опережает Fugu Ultra примерно на 6–9 пунктов. Это согласуется с тем, где Fable 5 задуман побеждать: в длительных задачах с оценкой по итоговому результату, где одна более сильная модель накапливает меньше суммарных ошибок.
\nВ итоге:
\n- \n
- Все показатели Fugu — саморепорт и пока не появились на сторонних таблицах лидеров. \n
- Sakana описывает Fugu как «плечом к плечу» с Fable 5 и Mythos Preview. С учётом приведённых разрывов это трактовка допустимая, но щедрая. Точнее будет сказать: «близко, но позади». \n
- Наборы для сравнения пересекаются лишь частично. Fable 5 лидирует в задачах зрения (он может восстановить исходники веб‑приложения по скриншотам), на чём Fugu вовсе не делает акцента; Fugu публикует бенчмарки по длинному контексту и банкингу, которых нет в таблице Anthropic. То есть они оптимизированы под несколько разные типы работы. \n
Sakana Fugu vs. Claude Fable 5: доступность и доступ
\nДоступ к Claude Fable 5 сейчас приостановлен. Anthropic отключила доступ к Fable 5 и Mythos 5 12 июня вслед за директивой правительства США об экспортном контроле и заявляет, что работает над как можно более скорым восстановлением доступа. Другие модели Anthropic, такие как Opus 4.8, по-прежнему доступны.
\nSakana Fugu доступен уже сейчас через console.sakana.ai с API, совместимым с OpenAI, — кроме ЕС и ЕЭЗ, где Sakana приостановила доступность, пока дорабатывает соответствие GDPR. Точных сроков получить не удалось.
Сейчас европейской команде может быть недоступна ни одна из моделей.
\nИтоги
\nНа бумаге это честное и близкое состязание двух философий.
\nAnthropic делает ставку на масштаб — одна модель класса Mythos настолько мощна, что ей требуется параллельная система классификаторов.
\nSakana ставит на координацию — что обученный оркестратор поверх заменяемого пула сможет держаться на расстоянии удара от любой отдельной передовой модели, оставаясь при этом дешевле, устойчивее и независимее от провайдеров.
\nЕсли принять бенчмарки за данность, ставка Anthropic даёт более сильный артефакт на сопоставимых тестах, тогда как ставка Sakana — более доступный и дешёвый.
Sakana Fugu и Claude Fable: часто задаваемые вопросы
Sakana Fugu лучше, чем Claude Fable 5?
На бенчмарках, где возможно прямое сравнение (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 опережает Fugu Ultra примерно на 6–9 пунктов.
Почему Fable 5 нет в таблице бенчмарков Fugu?
Sakana исключает Fable 5 и Mythos Preview, поскольку они недоступны публично и не могут быть частью пула агентов Fugu. Официальное сравнение проводится с Opus 4.8, GPT-5.5 и Gemini 3.1 Pro, и по 10 из 11 бенчмарков Fugu Ultra опережает их.
Какая из них дешевле?
Fugu Ultra при цене $5 за 1M входных токенов и $30 за 1M выходных примерно вдвое дешевле Fable 5 с $10 за 1M входных и $50 за 1M выходных. Обе системы предлагают месячные тарифы $20/$100/$200.
Вернётся ли Fable 5?
Anthropic заявляет, что работает над скорейшим восстановлением доступа к Fable 5 и Mythos 5, но сроки не публиковала. Между тем другие модели, включая Opus 4.8, остаются доступными.
Действительно ли Fugu обходит приостановку Fable 5?
Напрямую — нет: Fable 5 никогда не входил в пул Fugu, так что Fugu не может воспроизвести его конкретные возможности.