Program
Sakana memasarkan Fugu setara dengan Fable 5, tetapi tidak menyertakan Fable 5 dalam tabel tolok ukurnya sendiri. Jadi, kami akan membandingkan kedua model tersebut secara berdampingan sebisa mungkin.
Begini latar belakangnya. Pemerintah AS menangguhkan akses publik ke Claude Fable 5 hanya tiga hari setelah Anthropic meluncurkannya. Dan Fable 5 dipromosikan sebagai model paling andal mereka. Kini, dua minggu kemudian, Sakana AI dari Tokyo merilis Fugu dengan sejumlah klaim besar. Satu klaim khususnya banyak dibicarakan: Sakana AI menyatakan Fugu Ultra "setara dengan model terdepan seperti Fable 5 dan Mythos Preview" pada tolok ukur teknik, sains, dan penalaran tersulit di industri, tanpa risiko pengendalian ekspor. CEO David Ha mengatakan di X bahwa Fugu membuktikan kumpulan agen yang dapat dipertukarkan dan diorkestrasi bisa menyamai model frontier yang dibatasi seperti Fable.
Klaim-klaim ini agak sulit diverifikasi karena Fable 5 sama sekali tidak ada di tabel tolok ukur Fugu. Sakana mengecualikannya dengan alasan tidak dapat diakses publik. Kami melakukan yang kami bisa: Kami memeriksa segelintir tolok ukur yang muncul di tabel terbitan kedua lab dengan baseline yang cocok. Dan sebagai penutup, kami akan membahas harga serta situasi akses.
Jika Anda ingin latar belakang untuk masing-masing sistem, kami punya blognya: baca liputan Claude Fable 5 dan ulasan Sakana Fugu.
Apa Itu Sakana Fugu?
Sakana Fugu bukan satu model terlatih dalam pengertian biasa. Ini adalah orkestrator: model yang menerima permintaan Anda, memutuskan apakah menjawab langsung atau mendelegasikan ke model spesialis dalam sebuah pool, mengelola verifikasi dan sintesis, lalu mengembalikan satu respons melalui satu API yang kompatibel dengan OpenAI. Dari luar Anda memanggil satu endpoint; di dalam, satu set model frontier yang terkoordinasi melakukan pekerjaannya.
Produk ini hadir dalam dua varian. Fugu menyeimbangkan kualitas dengan latensi rendah dan diposisikan sebagai default harian untuk coding, review, dan layanan interaktif. Fugu Ultra mengoordinasikan pool agen ahli yang lebih dalam dan dituning untuk kualitas jawaban maksimum pada masalah sulit dan bertahap — reproduksi paper, analisis keamanan siber, data science gaya Kaggle, investigasi paten.
Gagasannya sebenarnya ada dua.
- Pertama, orkestrasi terpelajar: koordinator dilatih untuk memutuskan kapan mendelegasikan dan bagaimana menggabungkan output, alih-alih menjalankan pipeline yang dikodekan manual.
- Kedua, pool agen yang dapat dipertukarkan: ketika model frontier baru tersedia untuk publik, Sakana memperkirakan butuh sekitar dua minggu untuk memasukkannya. (Penting untuk sisa artikel: Fable 5 tidak ada di pool tersebut karena tidak dapat diakses publik.)
Apa Itu Claude Fable 5?
Claude Fable 5 adalah model kelas Mythos, yaitu satu tingkatan yang oleh Anthropic diposisikan di atas kelas Opus, dibuat aman untuk penggunaan umum melalui serangkaian pengklasifikasi. Ini adalah model dasar yang sama dengan Claude Mythos 5; perbedaannya, Fable 5 berjalan (pernah berjalan) dengan pengklasifikasi keselamatan aktif, sementara Mythos 5 memiliki sebagian yang dinonaktifkan dan dibatasi untuk mitra Project Glasswing serta peneliti biologi terpilih.
Klaim Anthropic adalah bahwa Fable 5 menjadi yang mutakhir di hampir setiap tolok ukur yang mereka pantau, dengan keunggulan yang makin besar pada tugas yang lebih panjang dan kompleks. Detail praktis utamanya: saat kueri menyentuh keamanan siber, biologi/kimia, atau distilasi model, pengklasifikasi dua tahap mengarahkan ulang respons ke Claude Opus 4.8 dan memberi tahu pengguna bahwa hal itu terjadi.
Sakana Fugu vs. Claude Fable 5: Tolok Ukur
Tabel perbandingan terbitan Sakana mengecualikan Fable 5 dan Mythos Preview, dengan alasan keduanya tidak dapat diakses publik dan karenanya tidak dapat masuk ke pool Fugu. Jadi angka resmi Fugu diukur terhadap Opus 4.8, GPT-5.5, dan Gemini 3.1 Pro, yang semuanya dapat Anda lihat di tabel di bawah. Anda bisa melihat Fugu menang di 10 dari 11 tolok ukur.
| Tolok Ukur | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* scaffolding mini-swe-agent. † baseline yang dilaporkan penyedia. Semua skor Fugu dilaporkan oleh Sakana dan belum direproduksi secara independen.
Untuk memasukkan Fable 5 ke dalam gambar, saya melakukan silang referensi tolok ukur yang muncul di tabel Anthropic dan Sakana, serta memeriksa bahwa baseline yang sama selaras. Pada SWE-Bench Pro dan Humanity's Last Exam (tanpa tools), angka Opus 4.8, GPT-5.5, dan Gemini 3.1 Pro identik di kedua sumber — jadi dua perbandingan itu bersih. Disederhanakan hanya pada dua sistem, head-to-head-nya seperti ini:
| Tolok Ukur | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | Pemenang |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (tanpa tools) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ Kedua lab melaporkan baseline yang berbeda dan menggunakan scaffolding berbeda untuk TerminalBench, sehingga kondisinya tidak identik.
Ini adalah satu-satunya tolok ukur yang kami temukan dengan hasil terbitan yang dapat dibandingkan secara langsung. Fable 5 memimpin ketiganya.
Jadi, pada setiap tolok ukur di mana perbandingan berdampingan memungkinkan, Fable 5 unggul atas Fugu Ultra sekitar 6–9 poin. Ini sejalan dengan area kekuatan Fable 5, yakni pada tugas berjangka panjang yang dinilai di akhir, di mana satu model yang lebih kuat menumpuk lebih sedikit galat berantai.
Singkatnya:
- Semua angka Fugu bersifat swapelaporan dan belum muncul di leaderboard pihak ketiga.
- Sakana menggambarkan Fugu "setara" dengan Fable 5 dan Mythos Preview. Mengingat selisih di atas, itu penilaian yang bisa dipertahankan namun dermawan. "Dekat, tetapi tertinggal" lebih akurat.
- Set perbandingan hanya tumpang tindih sebagian. Fable 5 unggul pada visi (dapat membangun ulang sumber aplikasi web dari tangkapan layar), yang sama sekali tidak menjadi fokus Fugu; Fugu memublikasikan tolok ukur konteks panjang dan perbankan yang tidak tercakup di tabel Anthropic. Jadi keduanya dioptimalkan untuk bentuk pekerjaan yang agak berbeda.
Sakana Fugu vs. Claude Fable 5: Ketersediaan dan Akses
Claude Fable 5 saat ini ditangguhkan. Anthropic menarik akses ke Fable 5 dan Mythos 5 pada 12 Juni mengikuti arahan pengendalian ekspor pemerintah AS, dan menyatakan sedang bekerja untuk memulihkan akses secepatnya. Model Anthropic lainnya, seperti Opus 4.8, tetap tersedia.
Sakana Fugu tersedia sekarang melalui console.sakana.ai dengan API yang kompatibel dengan OpenAI — kecuali di UE dan EEA, di mana Sakana menghentikan sementara ketersediaan sambil menyelesaikan kepatuhan GDPR. Saya tidak mendapat lini masa pasti untuk itu.
Saat ini, tim di Eropa mungkin tidak dapat menggunakan salah satu model.
Pemikiran Akhir
Di atas kertas, ini adalah persaingan yang ketat dan nyata antara dua filosofi.
Anthropic bertaruh pada skala — satu model kelas Mythos yang begitu andal hingga memerlukan sistem pengklasifikasi paralel.
Sakana bertaruh pada koordinasi — bahwa orkestrator terlatih di atas pool yang dapat dipertukarkan dapat tetap mendekati model frontier mana pun sembari lebih murah, lebih tangguh, dan agnostik terhadap penyedia.
Tolok ukur, jika diambil apa adanya, mengatakan taruhan Anthropic menghasilkan artefak yang lebih kuat pada uji yang sebanding, sementara taruhan Sakana menghasilkan yang lebih tersedia dan lebih murah.

Saya penulis dan editor data science dengan kontribusi pada artikel riset di jurnal ilmiah. Saya sangat tertarik pada aljabar linear, statistika, R, dan sejenisnya. Saya juga cukup sering bermain catur!
FAQ Sakana Fugu vs. Claude Fable
Apakah Sakana Fugu lebih baik daripada Claude Fable 5?
Pada tolok ukur yang memungkinkan perbandingan berdampingan (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 unggul atas Fugu Ultra sekitar 6–9 poin.
Mengapa Fable 5 tidak ada di tabel tolok ukur Fugu?
Sakana mengecualikan Fable 5 dan Mythos Preview karena keduanya tidak dapat diakses publik dan karenanya tidak dapat menjadi bagian dari pool agen Fugu. Perbandingan resminya adalah terhadap Opus 4.8, GPT-5.5, dan Gemini 3.1 Pro, yang semuanya dikalahkan Fugu Ultra pada 10 dari 11 tolok ukur.
Mana yang lebih murah?
Fugu Ultra, dengan harga $5/M input dan $30/M output, kira-kira setengah dari harga Fable 5 yang $10/M input dan $50/M output. Keduanya menawarkan paket langganan bulanan $20/$100/$200.
Apakah Fable 5 akan kembali?
Anthropic mengatakan sedang berupaya memulihkan akses ke Fable 5 dan Mythos 5 secepat mungkin, tetapi belum menerbitkan lini masa. Model lainnya, termasuk Opus 4.8, tetap tersedia untuk sementara.
Apakah Fugu benar-benar mengakali penangguhan Fable 5?
Tidak secara langsung — Fable 5 tidak pernah ada di pool Fugu, jadi Fugu tidak dapat memulihkan kapabilitas spesifiknya.
