Track
Sakana przedstawia Fugu jako model dorównujący Fable 5, ale wyklucza Fable 5 z własnej tabeli benchmarków. Dlatego porównamy oba modele ramię w ramię, na tyle, na ile to faktycznie możliwe.
Oto tło. Rząd USA zawiesił publiczny dostęp do Claude Fable 5 zaledwie trzy dni po jego premierze przez Anthropic. A Fable 5 był przedstawiany jako jego najbardziej zaawansowany model. Teraz, dwa tygodnie później, tokijskie Sakana AI wprowadziło Fugu z dużymi deklaracjami. Jedna z nich szczególnie się rozeszła: Sakana AI twierdzi, że Fugu Ultra „stoi ramię w ramię z wiodącymi modelami, takimi jak Fable 5 i Mythos Preview” na najtrudniejszych w branży benchmarkach inżynierskich, naukowych i wnioskowania, i to bez ryzyka związanego z kontrolą eksportu. CEO David Ha napisał na X, że Fugu dowodzi, iż wymienialna pula orkiestronych agentów może dorównać ograniczonym modelom czołowym, takim jak Fable.
Te twierdzenia trudno zweryfikować, bo Fable 5 w ogóle nie ma w tabeli benchmarków Fugu. Sakana wyklucza go, argumentując, że nie jest publicznie dostępny. Robimy więc, co możemy: sprawdzamy kilka benchmarków, które pojawiają się w tabelach obu laboratoriów i mają te same wartości bazowe. Na koniec omówimy ceny i kwestię dostępu
Jeśli chcesz tła dla każdego z systemów osobno, mamy o tym wpisy: przeczytaj nasze omówienie Claude Fable 5 oraz opis Sakana Fugu.
Czym jest Sakana Fugu?
Sakana Fugu nie jest pojedynczym wytrenowanym modelem w zwykłym rozumieniu. To orkiestrator: model, który przyjmuje twoje żądanie, decyduje, czy odpowiedzieć bezpośrednio, czy zlecić je modelom specjalistycznym z puli, zarządza weryfikacją i syntezą, a następnie zwraca jedną odpowiedź przez pojedyncze API zgodne z OpenAI. Z zewnątrz wywołujesz jeden endpoint; w środku skoordynowany zestaw modeli czołowych wykonuje pracę.
Są dostępne dwie wersje. Fugu równoważy jakość z niskimi opóźnieniami i jest pozycjonowany jako codzienny domyślny wybór do kodowania, review i usług interaktywnych. Fugu Ultra koordynuje głębszą pulę agentów‑ekspertów i jest dostrojony pod maksymalną jakość odpowiedzi w trudnych, wieloetapowych zadaniach — od odtwarzania prac naukowych, przez analizy cybersecurity, po data science w stylu Kaggle i badania patentowe.
Pomysł jest tak naprawdę dwojaki.
- Po pierwsze, wyuczona orkiestracja: koordynator jest trenowany, aby decydować, kiedy delegować i jak łączyć wyniki, zamiast uruchamiać ręcznie zakodowany pipeline.
- Po drugie, wymienialna pula agentów: gdy nowy model czołowy staje się publicznie dostępny, Sakana zakłada około dwa tygodnie na jego włączenie. (Ważne dla reszty artykułu: Fable 5 nie jest w tej puli, ponieważ nie jest publicznie dostępny.)
Czym jest Claude Fable 5?
Claude Fable 5 to model klasy Mythos, co jest poziomem, który Anthropic pozycjonuje powyżej klasy Opus, uczyniony bezpiecznym do powszechnego użytku dzięki zestawowi klasyfikatorów. To ten sam bazowy model co Claude Mythos 5; różnica polega na tym, że Fable 5 działał z aktywnymi klasyfikatorami bezpieczeństwa, podczas gdy w Mythos 5 część z nich jest wyłączona i model jest ograniczony do partnerów Project Glasswing i wybranych badaczy biologii.
Anthropic twierdził, że Fable 5 jest najnowocześniejszy na niemal każdym benchmarku, który śledzi, a przewaga rośnie przy dłuższych, bardziej złożonych zadaniach. Kluczowy szczegół praktyczny: gdy zapytanie dotyczy cybersecurity, biologii/chemii lub destylacji modeli, dwustopniowy klasyfikator przekierowuje odpowiedź do Claude Opus 4.8 i informuje o tym użytkownika.
Sakana Fugu vs Claude Fable 5: benchmarki
Opublikowana przez Sakanę tabela porównań wyklucza Fable 5 i Mythos Preview, ponieważ nie są publicznie dostępne i nie mogą być częścią puli Fugu. Oficjalne wyniki Fugu są więc mierzone względem Opus 4.8, GPT-5.5 i Gemini 3.1 Pro, które widać w tabeli poniżej. Widać, że wygrywa w 10 z 11 benchmarków.
| Benchmark | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* scaffolding mini-swe-agent. † wartości bazowe raportowane przez dostawców. Wszystkie wyniki Fugu pochodzą od Sakany i nie zostały jeszcze niezależnie odtworzone.
Aby włączyć Fable 5 do porównania, skrzyżowałem benchmarki, które pojawiają się zarówno w tabelach Anthropic, jak i Sakany, i sprawdziłem, czy wspólne wartości bazowe się pokrywają. W SWE-Bench Pro i Humanity's Last Exam (bez narzędzi) liczby dla Opus 4.8, GPT-5.5 i Gemini 3.1 Pro są identyczne w obu źródłach — więc te dwa porównania są czyste. Zredukowane do samych dwóch systemów, bezpośrednie starcie wygląda tak:
| Benchmark | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Lider |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6,6) |
| Humanity's Last Exam (bez narzędzi) | 47.2 | 50.0 | 59.0 | Fable 5 (+9,0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5,9) |
‡ Oba laboratoria raportują różne wartości bazowe i używają różnych scaffoldingów dla TerminalBench, więc warunki nie są identyczne.
To jedyne benchmarki, które znaleźliśmy, gdzie opublikowane wyniki są bezpośrednio porównywalne. Fable 5 prowadzi we wszystkich trzech.
Zatem w każdym benchmarku, gdzie porównanie ramię w ramię jest w ogóle możliwe, Fable 5 wyprzedza Fugu Ultra mniej więcej o 6–9 punktów. To spójne z tym, gdzie Fable 5 ma wygrywać: w zadaniach długoterminowych ocenianych na końcu, gdzie pojedynczy silniejszy model popełnia mniej narastających błędów.
Podsumowując:
- Wszystkie liczby dla Fugu są własnymi raportami i nie pojawiły się jeszcze na zewnętrznych listach liderów.
- Sakana przedstawia Fugu jako „ramię w ramię” z Fable 5 i Mythos Preview. Biorąc pod uwagę powyższe różnice, to obronna, ale hojna interpretacja. „Blisko, ale z tyłu” jest trafniejsze.
- Zestawy porównań tylko częściowo się pokrywają. Fable 5 prowadzi w obszarze wizji (potrafi odtworzyć źródła aplikacji webowej ze zrzutów ekranu), czego Fugu w ogóle nie akcentuje; Fugu publikuje benchmarki długiego kontekstu i bankowe, których tabela Anthropic nie obejmuje. Są więc zoptymalizowane pod nieco inne typy pracy.
Sakana Fugu vs Claude Fable 5: dostępność i dostęp
Claude Fable 5 jest obecnie zawieszony. Anthropic wycofał dostęp do Fable 5 i Mythos 5 12 czerwca po dyrektywie amerykańskich władz dotyczącej kontroli eksportu i informuje, że pracuje nad jak najszybszym przywróceniem dostępu. Inne modele Anthropic, jak Opus 4.8, są nadal dostępne.
Sakana Fugu jest dostępny już teraz przez console.sakana.ai z API zgodnym z OpenAI — z wyjątkiem UE i EOG, gdzie Sakana wstrzymała dostępność, pracując nad zgodnością z RODO. Nie udało mi się uzyskać dokładnego terminu.
W tej chwili europejski zespół może nie być w stanie korzystać z żadnego z tych modeli.
Końcowe uwagi
Na papierze to wyrównany, realny pojedynek dwóch filozofii.
Anthropic myśli o skali — jeden model klasy Mythos, tak zdolny, że wymaga równoległego systemu klasyfikatorów.
Sakana stawia na koordynację — że wytrenowany orkiestrator nad wymienialną pulą może pozostawać w zasięgu każdego pojedynczego modelu czołowego, będąc tańszym, bardziej odpornym i niezależnym od dostawców.
Benchmarki, traktowane dosłownie, mówią, że zakład Anthropic daje silniejszy artefakt w porównywalnych testach, podczas gdy zakład Sakany daje bardziej dostępny i tańszy.
Sakana Fugu vs Claude Fable: FAQ
Czy Sakana Fugu jest lepszy niż Claude Fable 5?
Na benchmarkach, gdzie możliwe jest porównanie ramię w ramię (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 wyprzedza Fugu Ultra o około 6–9 punktów.
Dlaczego Fable 5 nie ma w tabeli benchmarków Fugu?
Sakana wyklucza Fable 5 i Mythos Preview, ponieważ nie są publicznie dostępne i tym samym nie mogą być częścią puli agentów Fugu. Jego oficjalne porównanie obejmuje Opus 4.8, GPT-5.5 i Gemini 3.1 Pro, które Fugu Ultra pokonuje w 10 z 11 benchmarków.
Który jest tańszy?
Fugu Ultra, w cenie 5 USD/M wejścia i 30 USD/M wyjścia, kosztuje mniej więcej połowę ceny Fable 5 (10 USD/M wejścia i 50 USD/M wyjścia). Oba oferują miesięczne plany po 20/100/200 USD.
Czy Fable 5 wróci?
Anthropic informuje, że pracuje nad jak najszybszym przywróceniem dostępu do Fable 5 i Mythos 5, ale nie podał harmonogramu. Tymczasem inne jego modele, w tym Opus 4.8, pozostają dostępne.
Czy Fugu faktycznie omija zawieszenie Fable 5?
Nie bezpośrednio — Fable 5 nigdy nie był w puli Fugu, więc Fugu nie może odtworzyć jego konkretnych możliwości.