Chuyển đến nội dung chính

Sakana Fugu vs. Claude Fable 5: Điểm chuẩn, giá cả và hơn thế nữa

Claude Fable 5 thắng trên điểm chuẩn nhưng hiện đang bị tạm ngưng. Sakana Fugu hiện đã khả dụng và có giá chỉ bằng một nửa.
Đã cập nhật 31 thg 8, 2026  · 6 phút đọc

Khám phá với AI

ChatGPTClaudePerplexity

Sakana quảng bá Fugu là sánh ngang Fable 5, nhưng lại loại Fable 5 khỏi chính bảng điểm chuẩn của mình. Vì vậy, chúng tôi sẽ so sánh hai mô hình này song song trong phạm vi có thể.

Bối cảnh như sau. Chính phủ Mỹ đã tạm ngưng quyền truy cập công khai vào Claude Fable 5 chỉ ba ngày sau khi Anthropic ra mắt. Và Fable 5 được giới thiệu là mô hình mạnh nhất của họ. Giờ đây, hai tuần sau, Sakana AI tại Tokyo đã tung ra Fugu với một số tuyên bố lớn. Một tuyên bố đặc biệt được lan truyền: Sakana AI nói Fugu Ultra "đứng ngang hàng với các mô hình hàng đầu như Fable 5 và Mythos Preview" trên những điểm chuẩn khó nhất của ngành về kỹ thuật, khoa học và lập luận, đồng thời không có rủi ro kiểm soát xuất khẩu. CEO David Ha nói trên X rằng Fugu chứng minh một nhóm tác tử được điều phối có thể hoán đổi có thể sánh kịp các mô hình tuyến đầu bị hạn chế như Fable.

Những tuyên bố này hơi khó kiểm chứng vì Fable 5 hoàn toàn không có trong bảng điểm chuẩn của Fugu. Sakana loại trừ vì cho rằng nó không thể truy cập công khai. Chúng tôi làm những gì có thể: Chúng tôi kiểm tra một số ít điểm chuẩn xuất hiện trong cả hai bảng công bố của các phòng thí nghiệm với cùng mốc so sánh. Và để kết lại, chúng tôi sẽ nói về giá và tình trạng truy cập

Nếu bạn muốn xem bối cảnh về từng hệ thống riêng lẻ, chúng tôi có bài viết về điều đó: đọc bài viết về Claude Fable 5bài viết về Sakana Fugu.

Sakana Fugu là gì?

Sakana Fugu không phải là một mô hình đơn lẻ theo nghĩa thông thường. Đây là một bộ điều phối: một mô hình nhận yêu cầu của bạn, quyết định nên trả lời trực tiếp hay giao cho các mô hình chuyên biệt trong một nhóm, quản lý việc kiểm chứng và tổng hợp, rồi trả về một phản hồi thông qua một API tương thích với OpenAI. Từ bên ngoài bạn gọi một endpoint; bên trong, một tập hợp mô hình tuyến đầu được điều phối phối hợp xử lý công việc.

Sản phẩm có hai biến thể. Fugu cân bằng chất lượng với độ trễ thấp và được định vị là mặc định hằng ngày cho viết mã, rà soát và dịch vụ tương tác. Fugu Ultra điều phối một nhóm tác tử chuyên gia sâu hơn và được tinh chỉnh để tối đa chất lượng câu trả lời cho các bài toán khó, nhiều bước — tái hiện bài báo, phân tích an ninh mạng, khoa học dữ liệu kiểu Kaggle, điều tra bằng sáng chế.

Ý tưởng thực ra gồm hai ý.

  • Thứ nhất, điều phối được học: bộ điều phối được huấn luyện để quyết định khi nào nên giao việc và cách kết hợp đầu ra, thay vì chạy một pipeline viết tay.
  • Thứ hai, một nhóm tác tử có thể hoán đổi: khi một mô hình tuyến đầu mới trở nên công khai, Sakana dự kiến mất khoảng hai tuần để tích hợp. (Quan trọng cho phần còn lại: Fable 5 không nằm trong nhóm đó vì không thể truy cập công khai.

Claude Fable 5 là gì?

Claude Fable 5 là một mô hình thuộc lớp Mythos, một bậc mà Anthropic xếp trên lớp Opus, được làm an toàn cho sử dụng phổ quát thông qua một tập bộ phân loại. Nó cùng là mô hình nền tảng với Claude Mythos 5; khác biệt là Fable 5 chạy (đã chạy) với bộ phân loại an toàn hoạt động, trong khi Mythos 5 gỡ bớt một số bộ phân loại và bị giới hạn cho đối tác Project Glasswing và một số nhà nghiên cứu sinh học được chọn.

Anthropic cho biết Fable 5 đạt mức tối tân trên gần như mọi điểm chuẩn họ theo dõi, với lợi thế tăng lên trên các tác vụ dài hơn, phức tạp hơn. Chi tiết thực tế đáng chú ý: khi một truy vấn chạm đến an ninh mạng, sinh học/hóa học hoặc chưng cất mô hình, một bộ phân loại hai giai đoạn sẽ chuyển hướng phản hồi sang Claude Opus 4.8 và thông báo cho người dùng biết. 

Sakana Fugu vs. Claude Fable 5: Điểm chuẩn

Bảng so sánh công bố của Sakana loại Fable 5 và Mythos Preview, với lý do chúng không thể truy cập công khai và do đó không thể nằm trong nhóm của Fugu. Vì vậy, số liệu chính thức của Fugu được đo so với Opus 4.8, GPT-5.5, và Gemini 3.1 Pro, tất cả đều có trong bảng dưới đây. Bạn có thể thấy Fugu thắng trên 10/11 điểm chuẩn. 

Điểm chuẩn Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Lập luận ngữ cảnh dài 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* giàn giáo mini-swe-agent. † mốc so sánh do nhà cung cấp báo cáo. Tất cả điểm của Fugu do Sakana báo cáo và chưa được tái lập độc lập.

Để đưa Fable 5 vào bức tranh, tôi đối chiếu các điểm chuẩn xuất hiện trong cả bảng của Anthropic và Sakana, và kiểm tra các mốc so sánh chung khớp nhau. Ở SWE-Bench Pro và Humanity's Last Exam (không công cụ), các số của Opus 4.8, GPT-5.5 và Gemini 3.1 Pro là giống hệt nhau ở cả hai nguồn — vậy nên hai phép so sánh này là sạch. Thu gọn chỉ còn hai hệ thống, đối đầu trực tiếp như sau:

Điểm chuẩn Sakana Fugu Sakana Fugu Ultra Claude Fable 5 Dẫn đầu
SWE-Bench Pro 59.0 73.7 80.3 Fable 5 (+6.6)
Humanity's Last Exam (không công cụ) 47.2 50.0 59.0 Fable 5 (+9.0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5 (+5.9)

‡ Hai phòng thí nghiệm báo cáo mốc so sánh khác nhau và dùng giàn giáo khác nhau cho TerminalBench, nên điều kiện không hoàn toàn giống nhau.

Đây là những điểm chuẩn duy nhất chúng tôi tìm được có kết quả công bố có thể so sánh trực tiếp. Fable 5 dẫn cả ba.

Vì vậy, trên mọi điểm chuẩn mà có thể đặt cạnh nhau, Fable 5 vượt Fugu Ultra khoảng 6–9 điểm. Điều này khớp với thế mạnh của Fable 5: các tác vụ tầm dài được chấm điểm ở cuối, nơi một mô hình mạnh hơn tích lũy ít lỗi chồng chất hơn.

Tóm lại:

  1. Tất cả số liệu của Fugu do chính họ báo cáo và chưa xuất hiện trên các bảng xếp hạng bên thứ ba.
  2. Sakana mô tả Fugu là "sánh vai" với Fable 5 và Mythos Preview. Với các khoảng cách nêu trên, đó là cách diễn đạt có thể biện minh nhưng khá rộng rãi. "Gần, nhưng còn sau" thì chính xác hơn.
  3. Tập so sánh chỉ trùng nhau một phần. Fable 5 dẫn về thị giác (có thể tái tạo mã nguồn web app từ ảnh chụp màn hình), điều mà Fugu không nhấn mạnh; Fugu công bố các điểm chuẩn ngữ cảnh dài và ngân hàng mà bảng của Anthropic không đề cập. Vì vậy chúng được tối ưu cho những dạng công việc hơi khác nhau.

Sakana Fugu vs. Claude Fable 5: Tình trạng và quyền truy cập

Claude Fable 5 hiện đang bị tạm ngưng. Anthropic đã rút quyền truy cập vào cả Fable 5 và Mythos 5 vào ngày 12 tháng 6 theo một chỉ thị kiểm soát xuất khẩu của chính phủ Mỹ, và cho biết đang làm việc để khôi phục truy cập sớm nhất có thể. Các mô hình khác của Anthropic, như Opus 4.8, vẫn khả dụng.

Sakana Fugu hiện đã khả dụng qua console.sakana.ai với API tương thích OpenAI — ngoại trừ tại EU và EEA, nơi Sakana đã tạm dừng để xử lý tuân thủ GDPR. Tôi không thể có được mốc thời gian chính xác cho việc đó.

Hiện tại, một đội ngũ tại châu Âu có thể không sử dụng được cả hai mô hình.

Kết luận

Trên giấy tờ, đây là một cuộc đọ sức sát sao, thực sự giữa hai triết lý.

Anthropic suy nghĩ về quy mô — một mô hình lớp Mythos đủ mạnh để cần một hệ thống phân loại song song.

Sakana đặt cược vào điều phối — rằng một bộ điều phối được huấn luyện trên một nhóm có thể hoán đổi có thể bám sát bất kỳ mô hình tuyến đầu đơn lẻ nào trong khi rẻ hơn, bền bỉ hơn và không phụ thuộc nhà cung cấp.

Các điểm chuẩn, nếu hiểu theo đúng nghĩa, cho thấy canh bạc của Anthropic tạo ra hiện vật mạnh hơn trên các bài kiểm tra có thể so sánh, trong khi của Sakana tạo ra lựa chọn dễ tiếp cận hơn và rẻ hơn.


Josef Waples's photo
Author
Josef Waples

Tôi là một cây bút và biên tập viên về khoa học dữ liệu, đã có bài đóng góp cho các nghiên cứu đăng trên tạp chí khoa học. Tôi đặc biệt quan tâm đến đại số tuyến tính, thống kê, R và các chủ đề tương tự. Tôi cũng chơi cờ vua khá thường xuyên! 

Câu hỏi thường gặp về Sakana Fugu vs. Claude Fable

Sakana Fugu có tốt hơn Claude Fable 5 không?

Ở các điểm chuẩn có thể so sánh trực tiếp (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench), Fable 5 dẫn Fugu Ultra khoảng 6–9 điểm. 

Vì sao Fable 5 không có trong bảng điểm chuẩn của Fugu?

Sakana loại Fable 5 và Mythos Preview vì chúng không thể truy cập công khai và do đó không thể là một phần của nhóm tác tử của Fugu. So sánh chính thức của họ là với Opus 4.8, GPT-5.5 và Gemini 3.1 Pro, và Fugu Ultra vượt qua 10 trên 11 điểm chuẩn trong số đó.

Bên nào rẻ hơn?

Fugu Ultra, với giá $5/triệu đầu vào và $30/triệu đầu ra, rẻ khoảng một nửa so với Fable 5 ở mức $10/triệu đầu vào và $50/triệu đầu ra. Cả hai đều có gói thuê bao hàng tháng $20/$100/$200.

Fable 5 có quay lại không?

Anthropic cho biết đang làm việc để khôi phục quyền truy cập vào Fable 5 và Mythos 5 sớm nhất có thể, nhưng chưa công bố mốc thời gian. Trong lúc chờ đợi, các mô hình khác của họ, bao gồm Opus 4.8, vẫn khả dụng.

Fugu thực sự có thể lách việc Fable 5 bị tạm ngưng không?

Không trực tiếp — Fable 5 chưa từng nằm trong nhóm của Fugu, nên Fugu không thể khôi phục các năng lực cụ thể của nó.

Chủ đề
Trí tuệ Nhân tạo

Học AI với DataCamp

Tracks

Trí tuệ nhân tạo trong Kỹ thuật phần mềm

7 giờ
Viết mã và phát triển ứng dụng phần mềm nhanh hơn bao giờ hết với các công cụ phát triển AI mới nhất, bao gồm GitHub Copilot, Windsurf và Replit.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow
Có liên quan

blogs

Claude Opus 4.6: Tính năng, Điểm chuẩn, Bài kiểm tra thực hành và hơn thế nữa

Mô hình mới nhất của Anthropic dẫn đầu ở mã hóa tác tử và lập luận phức tạp. Thêm vào đó, nó có cửa sổ ngữ cảnh 1M.
Matt Crabtree's photo

Matt Crabtree

10 phút

Xem ThêmXem Thêm