Przejdź do głównej treści

Sakana Fugu vs Claude Fable 5: benchmarki, ceny i więcej

Claude Fable 5 wygrywa w benchmarkach, ale jest obecnie zawieszony. Sakana Fugu jest dostępny już teraz i kosztuje o połowę mniej.
Zaktualizowano 31 sie 2026  · 6 min Czytać

Eksploruj z AI

ChatGPTClaudePerplexity

Sakana przedstawia Fugu jako model dorównujący Fable 5, ale wyklucza Fable 5 z własnej tabeli benchmarków. Dlatego porównamy oba modele ramię w ramię, na tyle, na ile to faktycznie możliwe.

Oto tło. Rząd USA zawiesił publiczny dostęp do Claude Fable 5 zaledwie trzy dni po jego premierze przez Anthropic. A Fable 5 był przedstawiany jako jego najbardziej zaawansowany model. Teraz, dwa tygodnie później, tokijskie Sakana AI wprowadziło Fugu z dużymi deklaracjami. Jedna z nich szczególnie się rozeszła: Sakana AI twierdzi, że Fugu Ultra „stoi ramię w ramię z wiodącymi modelami, takimi jak Fable 5 i Mythos Preview” na najtrudniejszych w branży benchmarkach inżynierskich, naukowych i wnioskowania, i to bez ryzyka związanego z kontrolą eksportu. CEO David Ha napisał na X, że Fugu dowodzi, iż wymienialna pula orkiestronych agentów może dorównać ograniczonym modelom czołowym, takim jak Fable.

Te twierdzenia trudno zweryfikować, bo Fable 5 w ogóle nie ma w tabeli benchmarków Fugu. Sakana wyklucza go, argumentując, że nie jest publicznie dostępny. Robimy więc, co możemy: sprawdzamy kilka benchmarków, które pojawiają się w tabelach obu laboratoriów i mają te same wartości bazowe. Na koniec omówimy ceny i kwestię dostępu

Jeśli chcesz tła dla każdego z systemów osobno, mamy o tym wpisy: przeczytaj nasze omówienie Claude Fable 5 oraz opis Sakana Fugu.

Czym jest Sakana Fugu?

Sakana Fugu nie jest pojedynczym wytrenowanym modelem w zwykłym rozumieniu. To orkiestrator: model, który przyjmuje twoje żądanie, decyduje, czy odpowiedzieć bezpośrednio, czy zlecić je modelom specjalistycznym z puli, zarządza weryfikacją i syntezą, a następnie zwraca jedną odpowiedź przez pojedyncze API zgodne z OpenAI. Z zewnątrz wywołujesz jeden endpoint; w środku skoordynowany zestaw modeli czołowych wykonuje pracę.

Są dostępne dwie wersje. Fugu równoważy jakość z niskimi opóźnieniami i jest pozycjonowany jako codzienny domyślny wybór do kodowania, review i usług interaktywnych. Fugu Ultra koordynuje głębszą pulę agentów‑ekspertów i jest dostrojony pod maksymalną jakość odpowiedzi w trudnych, wieloetapowych zadaniach — od odtwarzania prac naukowych, przez analizy cybersecurity, po data science w stylu Kaggle i badania patentowe.

Pomysł jest tak naprawdę dwojaki.

  • Po pierwsze, wyuczona orkiestracja: koordynator jest trenowany, aby decydować, kiedy delegować i jak łączyć wyniki, zamiast uruchamiać ręcznie zakodowany pipeline.
  • Po drugie, wymienialna pula agentów: gdy nowy model czołowy staje się publicznie dostępny, Sakana zakłada około dwa tygodnie na jego włączenie. (Ważne dla reszty artykułu: Fable 5 nie jest w tej puli, ponieważ nie jest publicznie dostępny.)

Czym jest Claude Fable 5?

Claude Fable 5 to model klasy Mythos, co jest poziomem, który Anthropic pozycjonuje powyżej klasy Opus, uczyniony bezpiecznym do powszechnego użytku dzięki zestawowi klasyfikatorów. To ten sam bazowy model co Claude Mythos 5; różnica polega na tym, że Fable 5 działał z aktywnymi klasyfikatorami bezpieczeństwa, podczas gdy w Mythos 5 część z nich jest wyłączona i model jest ograniczony do partnerów Project Glasswing i wybranych badaczy biologii.

Anthropic twierdził, że Fable 5 jest najnowocześniejszy na niemal każdym benchmarku, który śledzi, a przewaga rośnie przy dłuższych, bardziej złożonych zadaniach. Kluczowy szczegół praktyczny: gdy zapytanie dotyczy cybersecurity, biologii/chemii lub destylacji modeli, dwustopniowy klasyfikator przekierowuje odpowiedź do Claude Opus 4.8 i informuje o tym użytkownika. 

Sakana Fugu vs Claude Fable 5: benchmarki

Opublikowana przez Sakanę tabela porównań wyklucza Fable 5 i Mythos Preview, ponieważ nie są publicznie dostępne i nie mogą być częścią puli Fugu. Oficjalne wyniki Fugu są więc mierzone względem Opus 4.8, GPT-5.5 i Gemini 3.1 Pro, które widać w tabeli poniżej. Widać, że wygrywa w 10 z 11 benchmarków. 

Benchmark Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* scaffolding mini-swe-agent. † wartości bazowe raportowane przez dostawców. Wszystkie wyniki Fugu pochodzą od Sakany i nie zostały jeszcze niezależnie odtworzone.

Aby włączyć Fable 5 do porównania, skrzyżowałem benchmarki, które pojawiają się zarówno w tabelach Anthropic, jak i Sakany, i sprawdziłem, czy wspólne wartości bazowe się pokrywają. W SWE-Bench Pro i Humanity's Last Exam (bez narzędzi) liczby dla Opus 4.8, GPT-5.5 i Gemini 3.1 Pro są identyczne w obu źródłach — więc te dwa porównania są czyste. Zredukowane do samych dwóch systemów, bezpośrednie starcie wygląda tak:

Benchmark Sakana Fugu Sakana Fugu Ultra Claude Fable 5 Lider
SWE-Bench Pro 59.0 73.7 80.3 Fable 5 (+6,6)
Humanity's Last Exam (bez narzędzi) 47.2 50.0 59.0 Fable 5 (+9,0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5 (+5,9)

‡ Oba laboratoria raportują różne wartości bazowe i używają różnych scaffoldingów dla TerminalBench, więc warunki nie są identyczne.

To jedyne benchmarki, które znaleźliśmy, gdzie opublikowane wyniki są bezpośrednio porównywalne. Fable 5 prowadzi we wszystkich trzech.

Zatem w każdym benchmarku, gdzie porównanie ramię w ramię jest w ogóle możliwe, Fable 5 wyprzedza Fugu Ultra mniej więcej o 6–9 punktów. To spójne z tym, gdzie Fable 5 ma wygrywać: w zadaniach długoterminowych ocenianych na końcu, gdzie pojedynczy silniejszy model popełnia mniej narastających błędów.

Podsumowując:

  1. Wszystkie liczby dla Fugu są własnymi raportami i nie pojawiły się jeszcze na zewnętrznych listach liderów.
  2. Sakana przedstawia Fugu jako „ramię w ramię” z Fable 5 i Mythos Preview. Biorąc pod uwagę powyższe różnice, to obronna, ale hojna interpretacja. „Blisko, ale z tyłu” jest trafniejsze.
  3. Zestawy porównań tylko częściowo się pokrywają. Fable 5 prowadzi w obszarze wizji (potrafi odtworzyć źródła aplikacji webowej ze zrzutów ekranu), czego Fugu w ogóle nie akcentuje; Fugu publikuje benchmarki długiego kontekstu i bankowe, których tabela Anthropic nie obejmuje. Są więc zoptymalizowane pod nieco inne typy pracy.

Sakana Fugu vs Claude Fable 5: dostępność i dostęp

Claude Fable 5 jest obecnie zawieszony. Anthropic wycofał dostęp do Fable 5 i Mythos 5 12 czerwca po dyrektywie amerykańskich władz dotyczącej kontroli eksportu i informuje, że pracuje nad jak najszybszym przywróceniem dostępu. Inne modele Anthropic, jak Opus 4.8, są nadal dostępne.

Sakana Fugu jest dostępny już teraz przez console.sakana.ai z API zgodnym z OpenAI — z wyjątkiem UE i EOG, gdzie Sakana wstrzymała dostępność, pracując nad zgodnością z RODO. Nie udało mi się uzyskać dokładnego terminu.

W tej chwili europejski zespół może nie być w stanie korzystać z żadnego z tych modeli.

Końcowe uwagi

Na papierze to wyrównany, realny pojedynek dwóch filozofii.

Anthropic myśli o skali — jeden model klasy Mythos, tak zdolny, że wymaga równoległego systemu klasyfikatorów.

Sakana stawia na koordynację — że wytrenowany orkiestrator nad wymienialną pulą może pozostawać w zasięgu każdego pojedynczego modelu czołowego, będąc tańszym, bardziej odpornym i niezależnym od dostawców.

Benchmarki, traktowane dosłownie, mówią, że zakład Anthropic daje silniejszy artefakt w porównywalnych testach, podczas gdy zakład Sakany daje bardziej dostępny i tańszy.

Sakana Fugu vs Claude Fable: FAQ

Czy Sakana Fugu jest lepszy niż Claude Fable 5?

Na benchmarkach, gdzie możliwe jest porównanie ramię w ramię (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 wyprzedza Fugu Ultra o około 6–9 punktów. 

Dlaczego Fable 5 nie ma w tabeli benchmarków Fugu?

Sakana wyklucza Fable 5 i Mythos Preview, ponieważ nie są publicznie dostępne i tym samym nie mogą być częścią puli agentów Fugu. Jego oficjalne porównanie obejmuje Opus 4.8, GPT-5.5 i Gemini 3.1 Pro, które Fugu Ultra pokonuje w 10 z 11 benchmarków.

Który jest tańszy?

Fugu Ultra, w cenie 5 USD/M wejścia i 30 USD/M wyjścia, kosztuje mniej więcej połowę ceny Fable 5 (10 USD/M wejścia i 50 USD/M wyjścia). Oba oferują miesięczne plany po 20/100/200 USD.

Czy Fable 5 wróci?

Anthropic informuje, że pracuje nad jak najszybszym przywróceniem dostępu do Fable 5 i Mythos 5, ale nie podał harmonogramu. Tymczasem inne jego modele, w tym Opus 4.8, pozostają dostępne.

Czy Fugu faktycznie omija zawieszenie Fable 5?

Nie bezpośrednio — Fable 5 nigdy nie był w puli Fugu, więc Fugu nie może odtworzyć jego konkretnych możliwości.

Tematy
Sztuczna inteligencja

Ucz się AI z DataCamp

Track

AI dla inżynierii oprogramowania

7 godz.
Pisz kod i twórz aplikacje szybciej niż kiedykolwiek dzięki najnowszym narzędziom AI dla deweloperów, w tym GitHub Copilot, Windsurf i Replit.
Zobacz szczegółyRight Arrow
Rozpocznij Kurs
Zobacz więcejRight Arrow