Tracks
Sakana โปรโมตว่า Fugu ทำผลงานทัดเทียม Fable 5 แต่กลับไม่ใส่ Fable 5 ในตารางผลทดสอบของตัวเอง ดังนั้นเราจะลองเปรียบเทียบทั้งสองรุ่นเคียงข้างกันเท่าที่ทำได้จริง
ที่มาของเรื่องคือ รัฐบาลสหรัฐฯ ระงับการเข้าถึงสาธารณะของ Claude Fable 5 เพียงสามวันหลัง Anthropic เปิดตัว และ Fable 5 ได้รับการนำเสนอว่าเป็นรุ่นที่ทรงพลังที่สุดของค่าย ตอนนี้ผ่านไปสองสัปดาห์ Sakana AI จากโตเกียวได้ปล่อย Fugu พร้อมคำกล่าวอ้างก้าวร้าว โดยเฉพาะประเด็นที่แพร่สะพัดกัน: Sakana AI ระบุว่า Fugu Ultra “ยืนเคียงบ่าเคียงไหล่กับรุ่นชั้นนำอย่าง Fable 5 และ Mythos Preview” บนเกณฑ์ทดสอบด้านวิศวกรรม วิทยาศาสตร์ และการให้เหตุผลที่ยากที่สุดของอุตสาหกรรม และไม่มีความเสี่ยงด้านข้อกำกับการส่งออก CEO David Ha กล่าวบน X ว่า Fugu พิสูจน์แนวคิดที่ว่า สระตัวแทนแบบสลับเปลี่ยนได้ซึ่งถูกจัดประสานงาน สามารถทำผลงานทัดเทียมรุ่นแนวหน้าที่ถูกจำกัดอย่าง Fable ได้
ข้ออ้างเหล่านี้ยากจะตรวจสอบเล็กน้อย เพราะ Fable 5 ไม่ได้อยู่ในตารางผลทดสอบของ Fugu เลย Sakana ตัดออกโดยให้เหตุผลว่าไม่สามารถเข้าถึงได้สาธารณะ เราจึงทำเท่าที่ทำได้: ตรวจเกณฑ์ทดสอบไม่กี่ตัวที่ปรากฏในตารางของทั้งสองฝ่ายพร้อมฐานเปรียบเทียบที่ตรงกัน และท้ายสุดจะพูดถึงราคาและสถานะการเข้าถึง
หากต้องการพื้นหลังของแต่ละระบบ แยกอ่านได้ในบล็อกของเรา: ดูบทความครอบคลุม Claude Fable 5 และสรุป Sakana Fugu
Sakana Fugu คืออะไร
Sakana Fugu ไม่ใช่โมเดลที่เทรนเดี่ยวแบบทั่วไป แต่เป็นตัวประสานงาน: โมเดลที่รับคำขอของผู้ใช้ ตัดสินใจว่าจะตอบเองหรือมอบหมายให้โมเดลผู้เชี่ยวชาญในพูล จัดการการตรวจทานและสังเคราะห์คำตอบ แล้วส่งผลลัพธ์เดียวกลับมาผ่าน API ที่เข้ากันได้กับ OpenAI จากภายนอกเรียกเพียงเอ็นด์พอยต์เดียว; ภายในเป็นชุดโมเดลแนวหน้าที่ทำงานประสานกัน
มีสองรุ่นย่อย Fugu เน้นสมดุลคุณภาพกับเวลาตอบสนองต่ำ เป็นค่าเริ่มต้นสำหรับงานโค้ด รีวิว และบริการเชิงโต้ตอบในทุกวัน ส่วน Fugu Ultra ประสานตัวแทนผู้เชี่ยวชาญในพูลที่ลึกกว่า ปรับจูนเพื่อคุณภาพคำตอบสูงสุดสำหรับปัญหายากหลายขั้นตอน — ทำซ้ำงานวิจัย วิเคราะห์ด้านความปลอดภัยไซเบอร์ งานดาต้าไซเอนซ์สไตล์ Kaggle การสืบค้นสิทธิบัตร
แนวคิดหลักมีสองชั้น
- หนึ่ง การประสานงานแบบเรียนรู้ได้: ตัวประสานถูกเทรนให้ตัดสินใจว่าจะมอบหมายเมื่อใดและรวมผลลัพธ์อย่างไร แทนที่จะใช้ไปป์ไลน์ที่เขียนกฎด้วยมือ
- สอง พูลตัวแทนที่สลับได้: เมื่อมีโมเดลแนวหน้าใหม่ที่เข้าถึงสาธารณะได้ Sakana คาดว่าจะใช้เวลาราวสองสัปดาห์ในการผนวกเข้าไป (จุดสำคัญสำหรับบทความที่เหลือ: Fable 5 ไม่อยู่ในพูลนั้นเพราะไม่สามารถเข้าถึงสาธารณะได้)
Claude Fable 5 คืออะไร
Claude Fable 5 เป็นโมเดลระดับ Mythos ซึ่งเป็นชั้นที่ Anthropic จัดวางไว้เหนือระดับ Opus และทำให้ปลอดภัยสำหรับการใช้งานทั่วไปด้วยชุดตัวจัดประเภท เป็นโมเดลพื้นฐานเดียวกับ Claude Mythos 5 ความต่างคือ Fable 5 ทำงาน (เคยทำงาน) พร้อมตัวจัดประเภทความปลอดภัย ในขณะที่ Mythos 5 ยกเลิกบางตัวและจำกัดให้พันธมิตร Project Glasswing และนักวิจัยชีววิทยาบางส่วนใช้งาน
Anthropic อ้างว่า Fable 5 ทำผลงานระดับแนวหน้าบนแทบทุกเกณฑ์ทดสอบที่ติดตาม โดยยิ่งโดดเด่นขึ้นในงานที่ยาวและซับซ้อน ประเด็นปฏิบัติที่สำคัญ: เมื่อคำถามเกี่ยวข้องกับความปลอดภัยไซเบอร์ ชีววิทยา/เคมี หรือการกลั่นโมเดล ระบบตัวจัดประเภทสองชั้นจะเปลี่ยนเส้นทางคำตอบไปยัง Claude Opus 4.8 และแจ้งผู้ใช้ว่าทำเช่นนั้น
Sakana Fugu เทียบกับ Claude Fable 5: ผลทดสอบ
ตารางเปรียบเทียบที่ Sakana เผยแพร่ไม่รวม Fable 5 และ Mythos Preview โดยให้เหตุผลว่าไม่เปิดให้เข้าถึงสาธารณะ จึงไม่อาจอยู่ในพูลของ Fugu ได้ ตัวเลขทางการของ Fugu จึงเทียบกับ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ซึ่งเห็นได้ในตารางด้านล่าง จะเห็นว่า Fugu ชนะ 10 จาก 11 เกณฑ์
| เกณฑ์ทดสอบ | Fugu | Fugu Ultra | Opus 4.8 † | Gemini 3.1 Pro † | GPT-5.5 † |
|---|---|---|---|---|---|
| SWE-Bench Pro * | 59.0 | 73.7 | 69.2 | 54.2 | 58.6 |
| TerminalBench 2.1 | 80.2 | 82.1 | 74.6 | 70.3 | 78.2 |
| LiveCodeBench | 92.9 | 93.2 | 87.8 | 88.5 | 85.3 |
| LiveCodeBench Pro | 87.8 | 90.8 | 84.8 | 82.9 | 88.4 |
| Humanity's Last Exam | 47.2 | 50.0 | 49.8 | 44.4 | 41.4 |
| CharXiv Reasoning | 85.1 | 86.6 | 84.2 | 83.3 | 84.1 |
| GPQA-D | 95.5 | 95.5 | 92.0 | 94.3 | 93.6 |
| SciCode | 60.1 | 58.7 | 53.5 | 58.9 | 56.1 |
| τ³ Banking | 21.7 | 20.6 | 20.6 | 8.4 | 20.6 |
| Long Context Reasoning | 74.7 | 73.3 | 67.7 | 72.7 | 74.3 |
| MRCRv2 | 86.6 | 93.6 | 87.9 | 84.9 | 94.8 |
* ใช้ mini-swe-agent เป็นโครงรองรับ † ค่าฐานที่ผู้ให้บริการรายงาน คะแนนของ Fugu ทั้งหมดเป็นตัวเลขที่ Sakana รายงานเองและยังไม่ถูกทำซ้ำโดยอิสระ
เพื่อให้มี Fable 5 ในภาพ รวมตารางเกณฑ์ทดสอบที่ปรากฏในทั้งของ Anthropic และของ Sakana และตรวจว่าฐานเปรียบเทียบที่ใช้ร่วมกันตรงกัน บน SWE-Bench Pro และ Humanity's Last Exam (ไม่ใช้เครื่องมือ) ตัวเลขของ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ตรงกันทั้งสองแหล่ง — จึงเปรียบเทียบได้สะอาด เมื่อตัดให้เหลือเพียงสองระบบ ภาพดวลตัวต่อตัวเป็นดังนี้:
| เกณฑ์ทดสอบ | Sakana Fugu | Sakana Fugu Ultra | Claude Fable 5 | ผู้นำ |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 73.7 | 80.3 | Fable 5 (+6.6) |
| Humanity's Last Exam (ไม่ใช้เครื่องมือ) | 47.2 | 50.0 | 59.0 | Fable 5 (+9.0) |
| Terminal-Bench 2.1 ‡ | 80.2 | 82.1 | 88.0 | Fable 5 (+5.9) |
‡ ห้องแล็บทั้งสองรายงานค่าฐานต่างกันและใช้โครงรองรับสำหรับ TerminalBench ไม่เหมือนกัน เงื่อนไขจึงไม่เหมือนกันทุกประการ
นี่คือเกณฑ์ทดสอบเพียงชุดเดียวที่พบว่าผลลัพธ์ที่เผยแพร่เปรียบเทียบกันได้โดยตรง โดย Fable 5 นำทั้งสาม
ดังนั้น บนทุกเกณฑ์ที่สามารถเปรียบเทียบเคียงข้างกันได้ Fable 5 นำหน้า Fugu Ultra ราว 6–9 คะแนน ซึ่งสอดคล้องกับจุดแข็งของ Fable 5 คือภารกิจระยะยาวที่ให้คะแนนตอนจบ ที่ซึ่งโมเดลเดี่ยวที่แข็งแกร่งกว่าจะสะสมความผิดพลาดเชิงพอกพูนได้น้อยกว่า
สรุป
- ตัวเลขของ Fugu ทั้งหมดเป็นการรายงานด้วยตนเอง และยังไม่ปรากฏบนลีดเดอร์บอร์ดของบุคคลที่สาม
- Sakana ระบุว่า Fugu “ยืนเคียงบ่าเคียงไหล่” กับ Fable 5 และ Mythos Preview เมื่อเทียบช่องว่างข้างต้น ถือว่าอธิบายได้แต่ค่อนข้างใจกว้าง “ใกล้เคียงแต่ตามหลัง” ตรงกว่า
- ชุดเปรียบเทียบซ้อนทับกันเพียงบางส่วน Fable 5 เด่นด้านวิชวล (สามารถสร้างซอร์สเว็บแอปจากสกรีนช็อต) ซึ่ง Fugu ไม่ได้เน้นเลย; Fugu เผยแพร่ผลทดสอบบริบทยาวและธนาคารที่ตารางของ Anthropic ไม่ครอบคลุม จึงถูกปรับให้เหมาะกับรูปแบบงานที่ต่างกันบ้าง
Sakana Fugu เทียบกับ Claude Fable 5: ความพร้อมใช้งานและการเข้าถึง
Claude Fable 5 ถูกระงับอยู่ในขณะนี้ Anthropic ถอนการเข้าถึงทั้ง Fable 5 และ Mythos 5 เมื่อวันที่ 12 มิถุนายน ตามคำสั่งควบคุมการส่งออกของรัฐบาลสหรัฐฯ และระบุว่ากำลังเร่งกู้คืนการเข้าถึงให้เร็วที่สุด รุ่นอื่น ๆ ของ Anthropic อย่าง Opus 4.8 ยังใช้งานได้
Sakana Fugu พร้อมใช้งานแล้ว ผ่าน console.sakana.ai ด้วย API ที่เข้ากันได้กับ OpenAI — ยกเว้น ในสหภาพยุโรปและเขตเศรษฐกิจยุโรป ซึ่ง Sakana หยุดให้บริการชั่วคราวระหว่างดำเนินการให้สอดคล้องกับ GDPR ยังไม่ได้กำหนดกรอบเวลาแน่ชัด
ณ ตอนนี้ ทีมในยุโรปอาจใช้ไม่ได้ทั้งสองรุ่น
ข้อคิดส่งท้าย
ในทางทฤษฎี นี่คือศึกที่สูสีและจริงจังระหว่างสองปรัชญา
Anthropic คิดในเชิงสเกล — โมเดลระดับ Mythos เดียวที่ทรงพลังจนต้องมีระบบตัวจัดประเภทคู่ขนาน
Sakana เดิมพันกับการประสานงาน — เชื่อว่าตัวประสานที่เทรนทับบนพูลที่สลับเปลี่ยนได้ จะตามติดโมเดลแนวหน้าเดี่ยวตัวใดก็ได้ในระยะประชิด พร้อมต้นทุนที่ถูกกว่า ทนทานกว่า และไม่ผูกกับผู้ให้บริการรายใด
หากดูตัวเลขตามที่รายงาน เดิมพันของ Anthropic ให้ผลลัพธ์ที่แข็งแกร่งกว่าบนการทดสอบที่เทียบได้ ขณะที่ของ Sakana ให้สิ่งที่เข้าถึงได้มากกว่าและถูกกว่า
คำถามที่พบบ่อย: Sakana Fugu เทียบกับ Claude Fable
Sakana Fugu ดีกว่า Claude Fable 5 หรือไม่
บนเกณฑ์ที่เปรียบเทียบเคียงข้างกันได้ (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench) Fable 5 นำหน้า Fugu Ultra ราว 6–9 คะแนน
ทำไม Fable 5 ไม่อยู่ในตารางผลทดสอบของ Fugu
Sakana ตัด Fable 5 และ Mythos Preview ออก เพราะไม่สามารถเข้าถึงสาธารณะ และจึงไม่อาจเป็นส่วนหนึ่งของพูลเอเจนต์ของ Fugu การเปรียบเทียบอย่างเป็นทางการจึงเทียบกับ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ซึ่ง Fugu Ultra ชนะ 10 จาก 11 เกณฑ์
รุ่นไหนถูกกว่า
Fugu Ultra ที่ $5 ต่ออินพุตล้านโทเค็น และ $30 ต่อเอาต์พุตล้านโทเค็น มีราคาประมาณครึ่งหนึ่งของ Fable 5 ที่ $10 ต่ออินพุตล้านโทเค็น และ $50 ต่อเอาต์พุตล้านโทเค็น ทั้งคู่มีแพ็กเกจสมัครรายเดือน $20/$100/$200
Fable 5 จะกลับมาไหม
Anthropic ระบุว่ากำลังเร่งกู้คืนการเข้าถึง Fable 5 และ Mythos 5 โดยเร็วที่สุด แต่ยังไม่ประกาศเส้นเวลา รุ่นอื่น ๆ รวมถึง Opus 4.8 ยังคงใช้งานได้ในระหว่างนี้
Fugu แก้ปัญหาการถูกระงับของ Fable 5 ได้จริงหรือไม่
ไม่โดยตรง — Fable 5 ไม่ได้อยู่ในพูลของ Fugu ตั้งแต่แรก ดังนั้น Fugu จึงไม่สามารถทดแทนความสามารถเฉพาะของมันได้