본문으로 바로가기

Sakana Fugu vs. Claude Fable 5: 벤치마크, 가격, 그 밖의 모든 것

벤치마크에서는 Claude Fable 5가 앞서지만 현재 중단 상태입니다. Sakana Fugu는 지금 이용 가능하며 가격은 절반 수준입니다.
업데이트됨 2026년 8월 31일  · 6분 읽다

AI로 탐색하기

ChatGPTClaudePerplexity

Sakana는 Fugu가 Fable 5에 필적한다고 홍보하지만, 자체 벤치마크 표에서는 Fable 5를 제외합니다. 그래서 가능한 한 실제에 가깝게 두 모델을 나란히 비교해 보겠습니다.

\n

배경은 이렇습니다. 미국 정부가 Anthropic이 Claude Fable 5를 출시한 지 사흘도 안 되어 대중 접근을 중단시켰습니다. Fable 5는 가장 강력한 모델로 소개되었죠. 그리고 2주 뒤, 도쿄의 Sakana AI가 큰 주장을 내세우며 Fugu를 출시했습니다. 특히 주목받은 한 가지 주장은 이렇습니다. Sakana AI는 Fugu Ultra가 업계에서 가장 까다로운 엔지니어링, 과학, 추론 벤치마크에서 “Fable 5와 Mythos Preview 같은 선도 모델과 어깨를 나란히 한다”고 말하며, 수출 통제 리스크도 없다고 했습니다. CEO David Ha는 X에서, Fugu가 교체 가능한 오케스트레이션 에이전트 풀로 제한된 최전선 모델(Fable 같은)을 대등하게 상쇄할 수 있음을 증명한다고 밝혔습니다.

\n

다만 Fable 5가 Fugu의 벤치마크 표에 전혀 없기 때문에 주장을 검증하기가 다소 어렵습니다. 공개 접근이 불가하다는 이유로 Sakana가 이를 제외했기 때문입니다. 그래서 우리가 할 수 있는 선에서 진행합니다. 두 연구실이 공개한 표에 공통으로 등장하고 기준선이 일치하는 소수 벤치마크를 대조했습니다. 마지막으로 가격과 접근성 문제를 정리하겠습니다

\n

두 시스템 각각의 배경이 더 궁금하시다면, 관련 블로그를 참고하세요: Claude Fable 5 커버리지Sakana Fugu 분석을 읽어보세요.

\n

Sakana Fugu란?

\n

Sakana Fugu는 통상적인 의미의 단일 학습 모델이 아닙니다. 이것은 오케스트레이터입니다. 요청을 받아 직접 답할지, 아니면 풀에 있는 전문 모델에 위임할지 결정하고, 검증과 통합을 관리한 뒤, OpenAI 호환 단일 API를 통해 하나의 응답을 반환하는 모델입니다. 겉으로는 하나의 엔드포인트를 호출하지만, 내부에서는 조율된 최전선 모델들의 집합이 일을 수행합니다.

\n

두 가지 버전으로 제공됩니다. Fugu는 낮은 지연시간과 품질을 균형 있게 맞추어 코딩, 리뷰, 인터랙티브 서비스에 일상적 기본값으로 자리매김합니다. Fugu Ultra는 더 깊은 전문가 에이전트 풀을 조율하여, 논문 재현, 사이버보안 분석, Kaggle 스타일 데이터 사이언스, 특허 조사 같은 어렵고 다단계인 문제에서 최대한의 답변 품질을 목표로 튜닝되었습니다.

\n

핵심은 사실 두 가지 아이디어입니다.

\n
    \n
  • 첫째, 학습된 오케스트레이션: 수작업 파이프라인 대신, 언제 위임하고 어떻게 출력을 결합할지 결정하도록 코디네이터를 학습합니다.
  • \n
  • 둘째, 교체 가능한 에이전트 풀: 새로운 최전선 모델이 공개되면, Sakana는 이를 통합하는 데 대략 2주가 걸린다고 예상합니다. (이 글의 나머지 부분에서 중요한 점: Fable 5는 공개 접근이 불가하므로 그 풀에 포함되어 있지 않습니다.)
  • \n
\n

Claude Fable 5란?

\n

Claude Fable 5는 Mythos급 모델로, Anthropic이 Opus급 위에 두는 등급이며, 일련의 분류기를 통해 일반 사용에 안전하도록 구성되었습니다. Claude Mythos 5와 동일한 기반 모델이며, 차이는 Fable 5는 안전 분류기가 활성화된 상태로 동작(했습니다)하고, Mythos 5는 일부가 해제되어 Project Glasswing 파트너와 선택된 생물학 연구자에게 제한 제공된다는 점입니다.

\n

Anthropic은 Fable 5가 자사가 추적하는 거의 모든 벤치마크에서 최첨단이며, 과제가 길고 복잡할수록 격차가 커진다고 주장했습니다. 실무적으로 중요한 포인트: 쿼리가 사이버보안, 생물/화학, 모델 증류에 닿으면, 2단계 분류기가 응답을 Claude Opus 4.8로 우회시키고 사용자에게 그렇게 했다고 알립니다. 

\n

Sakana Fugu vs. Claude Fable 5: 벤치마크

\n

Sakana가 공개한 비교 표에는 Fable 5와 Mythos Preview가 제외되어 있습니다. 공개 접근이 불가하여 Fugu의 풀에 넣을 수 없다는 이유에서입니다. 따라서 Fugu의 공식 수치는 Opus 4.8, GPT-5.5, Gemini 3.1 Pro와 비교되며, 아래 표에서 확인하실 수 있습니다. 11개 중 10개 벤치마크에서 앞서는 모습을 볼 수 있습니다. 

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
벤치마크FuguFugu UltraOpus 4.8 †Gemini 3.1 Pro †GPT-5.5 †
SWE-Bench Pro *59.073.769.254.258.6
TerminalBench 2.180.282.174.670.378.2
LiveCodeBench92.993.287.888.585.3
LiveCodeBench Pro87.890.884.882.988.4
Humanity's Last Exam47.250.049.844.441.4
CharXiv Reasoning85.186.684.283.384.1
GPQA-D95.595.592.094.393.6
SciCode60.158.753.558.956.1
τ³ Banking21.720.620.68.420.6
Long Context Reasoning74.773.367.772.774.3
MRCRv286.693.687.984.994.8
\n

* mini-swe-agent 스캐폴딩. † 제공자 보고 기준선. 모든 Fugu 점수는 Sakana가 보고했으며 아직 독립적으로 재현되지 않았습니다.

\n
\n

Fable 5를 비교 범위에 넣기 위해, Anthropic과 Sakana의 표에 모두 등장하는 벤치마크를 교차 확인하고, 공통 기준선이 일치하는지 점검했습니다. SWE-Bench Pro와 Humanity's Last Exam(툴 미사용)에서는 Opus 4.8, GPT-5.5, Gemini 3.1 Pro 수치가 양쪽 출처에서 동일합니다. 즉, 이 두 비교는 조건이 깔끔합니다. 두 시스템만 놓고 보면, 맞대결은 다음과 같습니다.

\n
\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n\n
벤치마크Sakana FuguSakana Fugu UltraClaude Fable 5선도
SWE-Bench Pro59.073.780.3Fable 5 (+6.6)
Humanity's Last Exam (no tools)47.250.059.0Fable 5 (+9.0)
Terminal-Bench 2.1 ‡80.282.188.0Fable 5 (+5.9)
\n
\n

‡ 두 연구실은 TerminalBench에서 서로 다른 기준선과 스캐폴드를 사용하므로 조건이 동일하지 않습니다.

\n

공개 결과를 직접 비교할 수 있었던 벤치마크는 이것뿐입니다. 세 항목 모두 Fable 5가 앞섰습니다.

\n

즉, 나란히 비교가 가능한 모든 벤치마크에서 Fable 5는 Fugu Ultra를 대략 6–9점 앞섭니다. 이는 Fable 5가 장기 과제에서 종단 평가를 받을 때, 더 강한 단일 모델이 누적 오류를 덜 쌓도록 설계되었다는 점과도 부합합니다.

\n

요약하면:

\n
    \n
  1. 모든 Fugu 수치는 자가 보고치이며, 아직 서드파티 리더보드에 등장하지 않았습니다.
  2. \n
  3. Sakana는 Fugu가 Fable 5와 Mythos Preview에 “어깨를 나란히 한다”고 표현합니다. 위 격차를 보면 방어 가능하나 다소 후한 해석입니다. “가깝지만 뒤따른다”가 더 정확합니다.
  4. \n
  5. 비교 집합이 부분적으로만 겹칩니다. Fable 5는 비전에서 앞섭니다(스크린샷만으로 웹 앱 소스를 재구성). Fugu는 이를 강조하지 않으며, 대신 Anthropic 표에는 없는 장문 맥락 및 뱅킹 벤치마크를 게시합니다. 즉, 약간 다른 형태의 작업에 최적화되어 있습니다.
  6. \n
\n

Sakana Fugu vs. Claude Fable 5: 제공 여부와 접근성

\n

Claude Fable 5는 현재 중단되었습니다. Anthropic은 미국 정부의 수출 통제 지침에 따라 6월 12일 Fable 5와 Mythos 5에 대한 접근을 중단했으며, 가능한 한 빨리 복구하기 위해 노력 중이라고 밝혔습니다. Opus 4.8 같은 다른 모델은 여전히 이용 가능합니다.

\n

Sakana Fugu는 지금 이용 가능하며, console.sakana.ai에서 OpenAI 호환 API로 제공합니다. 다만 EU와 EEA에서는 GDPR 준수 문제를 해결하는 동안 제공을 일시 중단했습니다. 정확한 일정은 확인하지 못했습니다.

\n

현재로서는 유럽 팀은 두 모델 모두를 사용하지 못할 수 있습니다.

\n

마무리 생각

\n

겉으로 보기에, 이는 두 철학 간의 치열하면서도 근소한 승부입니다.

\n

Anthropic은 스케일에 집중합니다. 분류기 시스템을 병행해야 할 정도로 강력한 단일 Mythos급 모델.

\n

Sakana는 조율에 베팅합니다. 교체 가능한 풀 위에 학습된 오케스트레이터가 어떤 단일 최전선 모델에도 근접한 성능을 유지하면서 더 저렴하고, 더 탄력적이며, 제공자에 중립적일 수 있다는 가설입니다.

\n

표면적으로 벤치마크만 보면, Anthropic의 베팅은 비교 가능한 테스트에서 더 강한 산출물을 내고, Sakana의 베팅은 더 가용하고 저렴한 산출물을 만듭니다.

Sakana Fugu vs. Claude Fable FAQs

Sakana Fugu가 Claude Fable 5보다 낫나요?

나란히 비교가 가능한 벤치마크(SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench)에서는 Fable 5가 Fugu Ultra를 대략 6–9점 정도 앞섭니다. 

왜 Fugu의 벤치마크 표에 Fable 5가 없나요?

Sakana는 공개 접근이 불가하여 Fugu의 에이전트 풀에 포함될 수 없다는 이유로 Fable 5와 Mythos Preview를 제외합니다. 공식 비교 대상은 Opus 4.8, GPT-5.5, Gemini 3.1 Pro이며, 이들 중 11개 벤치마크 중 10개에서 Fugu Ultra가 앞섭니다.

어느 쪽이 더 저렴한가요?

Fugu Ultra는 입력 $5/M, 출력 $30/M으로, Fable 5의 입력 $10/M, 출력 $50/M 대비 대략 절반 가격입니다. 둘 다 월 $20/$100/$200 구독 티어를 제공합니다.

Fable 5는 다시 제공되나요?

Anthropic은 Fable 5와 Mythos 5의 접근을 최대한 빨리 복구하겠다고 밝혔지만, 일정은 공개하지 않았습니다. 그동안 Opus 4.8을 포함한 다른 모델은 계속 이용 가능합니다.

Fugu가 실제로 Fable 5 중단을 우회하나요?

직접적으로는 아닙니다 — Fable 5는 Fugu의 풀에 포함된 적이 없으므로, Fugu가 그 고유 역량을 그대로 대체할 수는 없습니다.

주제
인공지능

DataCamp으로 AI 배우기

tracks

소프트웨어 엔지니어링을 위한 AI

7
최신 AI 개발자 도구인 GitHub Copilot, Windsurf, Replit을 포함해 그 어느 때보다 빠르게 코드를 작성하고 소프트웨어 애플리케이션을 구축하세요.
자세히 보기Right Arrow
강좌 시작
더 보기Right Arrow