Weiter zum Inhalt

Sakana Fugu vs. Claude Fable 5: Benchmarks, Preise & mehr

Claude Fable 5 gewinnt bei Benchmarks, ist aber derzeit ausgesetzt. Sakana Fugu ist sofort verfügbar und kostet nur die Hälfte.
Aktualisiert 31. Aug. 2026  · 6 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Sakana positioniert Fugu als ebenbürtig zu Fable 5, lässt Fable 5 in der eigenen Benchmark-Tabelle aber außen vor. Also vergleichen wir beide Modelle so direkt, wie es aktuell möglich ist.

Zur Vorgeschichte: Die US-Regierung hat den öffentlichen Zugriff auf Claude Fable 5 nur drei Tage nach dem Launch durch Anthropic ausgesetzt. Fable 5 wurde als das leistungsfähigste Modell von Anthropic angekündigt. Zwei Wochen später bringt Sakana AI aus Tokio nun Fugu mit großen Versprechen. Vor allem eines macht die Runde: Sakana AI sagt, Fugu Ultra stehe „Schulter an Schulter mit führenden Modellen wie Fable 5 und Mythos Preview“ auf den härtesten Engineering-, Wissenschafts- und Reasoning-Benchmarks der Branche – ganz ohne Exportkontrollrisiko. CEO David Ha sagte auf X, Fugu belege, dass ein austauschbarer Pool orchestrierter Agenten gesperrte Spitzenmodelle wie Fable erreichen kann.

Diese Aussagen sind schwer zu prüfen, weil Fable 5 in Fugus Benchmark-Tabelle gar nicht auftaucht. Sakana begründet das damit, dass es nicht öffentlich zugänglich ist. Wir tun, was geht: Wir prüfen die wenigen Benchmarks, die in beiden veröffentlichten Tabellen mit identischen Baselines erscheinen. Zum Abschluss sprechen wir über Preise und die Zugriffslage.

Wenn du Hintergrund zu den beiden Systemen einzeln willst, haben wir dazu Blogbeiträge: Lies unsere Claude Fable 5 Analyse und das Sakana Fugu Porträt.

Was ist Sakana Fugu?

Sakana Fugu ist kein einzelnes trainiertes Modell im klassischen Sinn. Es ist ein Orchestrator: ein Modell, das deine Anfrage entgegennimmt, entscheidet, ob es direkt antwortet oder an Spezialmodelle in einem Pool delegiert, Verifizierung und Synthese steuert und über eine OpenAI-kompatible API eine einzige Antwort zurückgibt. Von außen rufst du einen Endpoint auf; innen erledigt ein koordiniertes Set aus Spitzenmodellen die Arbeit.

Es gibt zwei Varianten. Fugu balanciert Qualität und niedrige Latenz und ist als Alltagsstandard für Coding, Reviews und interaktive Services gedacht. Fugu Ultra koordiniert einen größeren Pool an Expertenagenten und ist auf maximale Antwortqualität bei harten, mehrstufigen Aufgaben getrimmt – Paper-Reproduktion, Cybersecurity-Analysen, Data Science im Kaggle-Stil, Patentrecherchen.

Die Idee besteht eigentlich aus zwei Ideen.

  • Erstens: gelerntes Orchestrieren: Der Koordinator wird darauf trainiert, wann delegiert und wie Ausgaben kombiniert werden – statt eine handcodierte Pipeline abzufahren.
  • Zweitens: ein austauschbarer Agentenpool: Wenn ein neues Spitzenmodell öffentlich verfügbar wird, rechnet Sakana mit rund zwei Wochen, um es zu integrieren. (Wichtig für den Rest des Artikels: Fable 5 ist nicht in diesem Pool, weil es nicht öffentlich zugänglich ist.)

Was ist Claude Fable 5?

Claude Fable 5 ist ein Mythos-Klassenmodell – eine Stufe, die Anthropic über der Opus-Klasse ansiedelt – und wird durch eine Reihe von Klassifizierern für den allgemeinen Einsatz abgesichert. Es ist dasselbe zugrunde liegende Modell wie Claude Mythos 5; der Unterschied: Fable 5 läuft (lief) mit aktiven Safety-Klassifizierern, während bei Mythos 5 einige davon aufgehoben sind und es nur für Project Glasswing Partner und ausgewählte Biologieforschende verfügbar ist.

Anthropic behauptete, Fable 5 sei bei fast allen von Anthropic verfolgten Benchmarks führend – mit wachsendem Vorsprung bei längeren, komplexeren Aufgaben. Der wichtigste Praxishinweis: Sobald eine Anfrage Cybersicherheit, Biologie/Chemie oder Modelldistillation berührt, leitet ein zweistufiger Klassifizierer die Antwort an Claude Opus 4.8 um und informiert die Nutzenden darüber.

Sakana Fugu vs. Claude Fable 5: Benchmarks

Sakanas veröffentlichte Vergleichstabelle schließt Fable 5 und Mythos Preview aus, weil sie nicht öffentlich zugänglich sind und daher nicht in Fugus Pool sein können. Offiziell misst Sakana Fugu gegen Opus 4.8, GPT-5.5 und Gemini 3.1 Pro – alle unten in der Tabelle. Dort gewinnt Fugu bei 10 von 11 Benchmarks.

Benchmark Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* mini-swe-agent scaffolding. † Von den Anbietern gemeldete Baselines. Alle Fugu-Werte stammen von Sakana und wurden noch nicht unabhängig reproduziert.

Um Fable 5 ins Bild zu bekommen, habe ich die Benchmarks abgeglichen, die sowohl in Anthropics als auch in Sakanas Tabellen vorkommen, und geprüft, dass die gemeinsamen Baselines übereinstimmen. Bei SWE-Bench Pro und Humanity's Last Exam (ohne Tools) sind die Werte für Opus 4.8, GPT-5.5 und Gemini 3.1 Pro in beiden Quellen identisch – diese Vergleiche sind also sauber. Auf die zwei Systeme reduziert, sieht das Kopf-an-Kopf so aus:

Benchmark Sakana Fugu Sakana Fugu Ultra Claude Fable 5 Führend
SWE-Bench Pro 59.0 73.7 80.3 Fable 5 (+6.6)
Humanity's Last Exam (ohne Tools) 47.2 50.0 59.0 Fable 5 (+9.0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5 (+5.9)

‡ Die beiden Labs berichten unterschiedliche Baselines und verwenden verschiedene Scaffolds für TerminalBench, die Bedingungen sind also nicht identisch.

Das sind die einzigen Benchmarks, bei denen die veröffentlichten Ergebnisse direkt vergleichbar sind. Fable 5 führt alle drei an.

Auf jedem Benchmark, bei dem ein direkter Vergleich möglich ist, liegt Fable 5 also rund 6–9 Punkte vor Fugu Ultra. Das passt dazu, wo Fable 5 punkten soll: bei lang angelegten Aufgaben mit Endbewertung, bei denen ein einzelnes stärkeres Modell weniger Fehler akkumuliert.

Kurz gesagt:

  1. Alle Fugu-Werte sind Eigenaussagen und tauchen noch nicht auf unabhängigen Leaderboards auf.
  2. Sakana beschreibt Fugu als „Schulter an Schulter“ mit Fable 5 und Mythos Preview. Angesichts der Lücken oben ist das vertretbar, aber großzügig. „Nah dran, aber dahinter“ trifft es besser.
  3. Die Vergleichssätze überlappen nur teilweise. Fable 5 führt bei Vision (es kann den Source-Code einer Web-App aus Screenshots rekonstruieren), was Fugu gar nicht betont; Fugu veröffentlicht dafür Long-Context- und Banking-Benchmarks, die in Anthropics Tabelle fehlen. Beide sind also für etwas unterschiedliche Arbeitsprofile optimiert.

Sakana Fugu vs. Claude Fable 5: Verfügbarkeit und Zugang

Claude Fable 5 ist derzeit ausgesetzt. Anthropic hat den Zugang zu Fable 5 und Mythos 5 am 12. Juni nach einer US-Exportkontrollanordnung zurückgezogen und arbeitet daran, den Zugang so schnell wie möglich wiederherzustellen. Andere Modelle wie Opus 4.8 sind weiterhin verfügbar.

Sakana Fugu ist jetzt verfügbar über console.sakana.ai mit einer OpenAI-kompatiblen API – außer in der EU und dem EWR, wo Sakana die Verfügbarkeit pausiert hat, während es die DSGVO-Compliance sicherstellt. Einen genauen Zeitplan konnte ich nicht bekommen.

Aktuell könnte ein europäisches Team also keines der beiden Modelle nutzen.

Fazit

Auf dem Papier ist das ein enger, echter Wettstreit zweier Philosophien.

Anthropic setzt auf Skalierung – ein Mythos-Klassenmodell, so leistungsfähig, dass es ein paralleles Klassifizierersystem braucht.

Sakana setzt auf Koordination – dass ein trainierter Orchestrator über einem austauschbaren Pool in Schlagdistanz zu jedem einzelnen Spitzenmodell bleiben kann, dabei günstiger, robuster und anbieterunabhängig.

Nimmt man die Benchmarks beim Wort, liefert Anthropics Wette das stärkere Artefakt in den vergleichbaren Tests, während Sakanas Ansatz das verfügbarere und günstigere Produkt hervorbringt.


Josef Waples's photo
Author
Josef Waples

Sakana Fugu vs. Claude Fable FAQs

Ist Sakana Fugu besser als Claude Fable 5?

Auf den Benchmarks, bei denen ein Direktvergleich möglich ist (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), liegt Fable 5 etwa 6–9 Punkte vor Fugu Ultra.

Warum ist Fable 5 nicht in Fugus Benchmark-Tabelle?

Sakana schließt Fable 5 und Mythos Preview aus, weil sie nicht öffentlich zugänglich sind und daher nicht Teil von Fugus Agentenpool sein können. Der offizielle Vergleich erfolgt gegen Opus 4.8, GPT-5.5 und Gemini 3.1 Pro – und hier schlägt Fugu Ultra 10 von 11 Benchmarks.

Welches ist günstiger?

Fugu Ultra kostet mit $5/M Input und $30/M Output etwa die Hälfte von Fable 5 mit $10/M Input und $50/M Output. Beide bieten monatliche Abo-Stufen zu $20/$100/$200 an.

Kommt Fable 5 zurück?

Anthropic sagt, man arbeite daran, den Zugang zu Fable 5 und Mythos 5 so schnell wie möglich wiederherzustellen, hat aber keinen Zeitplan veröffentlicht. Andere Modelle, darunter Opus 4.8, bleiben derweil verfügbar.

Umgeht Fugu die Aussetzung von Fable 5 wirklich?

Nicht direkt – Fable 5 war nie im Fugu-Pool, daher kann Fugu dessen spezifische Fähigkeiten nicht „umleiten“ oder übernehmen.

Themen
Künstliche Intelligenz

Lerne KI mit DataCamp

Lernpfad

KI für Softwareentwicklung

7 Std.
Schreib Code und entwickle Software-Apps schneller als je zuvor mit den neuesten KI-Entwicklertools wie GitHub Copilot, Windsurf und Replit.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Die 36 wichtigsten Fragen und Antworten zum Thema generative KI für 2026

Dieser Blog hat eine ganze Reihe von Fragen und Antworten zu generativer KI, von den Grundlagen bis hin zu fortgeschrittenen Themen.
Hesam Sheikh Hassani's photo

Hesam Sheikh Hassani

15 Min.

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Blog

Ein kompletter Leitfaden zu den Gehältern von Business-Analysten im Jahr 2026

Finde raus, wie viel du als Business Analyst verdienen kannst und wie du dein jetziges Gehalt aufbessern kannst.
Matt Crabtree's photo

Matt Crabtree

14 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Fibonacci-Folge in Python: Lerne und entdecke Programmiertechniken

Finde raus, wie die Fibonacci-Folge funktioniert. Schau dir die mathematischen Eigenschaften und die Anwendungen in der echten Welt an.
Laiba Siddiqui's photo

Laiba Siddiqui

6 Min.

Tutorial

Python-Anweisungen IF, ELIF und ELSE

In diesem Tutorial lernst du ausschließlich Python if else-Anweisungen kennen.
Sejal Jaiswal's photo

Sejal Jaiswal

9 Min.

Mehr AnzeigenMehr Anzeigen