ข้ามไปยังเนื้อหาหลัก

Sakana Fugu เทียบกับ Claude Fable 5: ผลทดสอบ ราคา และอื่น ๆ

Claude Fable 5 ชนะบนผลทดสอบแต่ถูกระงับชั่วคราว Sakana Fugu พร้อมใช้งานแล้วและมีราคาครึ่งหนึ่ง
อัปเดตแล้ว 31 ส.ค. 2569  · 6 นาที อ่าน

สำรวจด้วย AI

ChatGPTClaudePerplexity

Sakana โปรโมตว่า Fugu ทำผลงานทัดเทียม Fable 5 แต่กลับไม่ใส่ Fable 5 ในตารางผลทดสอบของตัวเอง ดังนั้นเราจะลองเปรียบเทียบทั้งสองรุ่นเคียงข้างกันเท่าที่ทำได้จริง

ที่มาของเรื่องคือ รัฐบาลสหรัฐฯ ระงับการเข้าถึงสาธารณะของ Claude Fable 5 เพียงสามวันหลัง Anthropic เปิดตัว และ Fable 5 ได้รับการนำเสนอว่าเป็นรุ่นที่ทรงพลังที่สุดของค่าย ตอนนี้ผ่านไปสองสัปดาห์ Sakana AI จากโตเกียวได้ปล่อย Fugu พร้อมคำกล่าวอ้างก้าวร้าว โดยเฉพาะประเด็นที่แพร่สะพัดกัน: Sakana AI ระบุว่า Fugu Ultra “ยืนเคียงบ่าเคียงไหล่กับรุ่นชั้นนำอย่าง Fable 5 และ Mythos Preview” บนเกณฑ์ทดสอบด้านวิศวกรรม วิทยาศาสตร์ และการให้เหตุผลที่ยากที่สุดของอุตสาหกรรม และไม่มีความเสี่ยงด้านข้อกำกับการส่งออก CEO David Ha กล่าวบน X ว่า Fugu พิสูจน์แนวคิดที่ว่า สระตัวแทนแบบสลับเปลี่ยนได้ซึ่งถูกจัดประสานงาน สามารถทำผลงานทัดเทียมรุ่นแนวหน้าที่ถูกจำกัดอย่าง Fable ได้

ข้ออ้างเหล่านี้ยากจะตรวจสอบเล็กน้อย เพราะ Fable 5 ไม่ได้อยู่ในตารางผลทดสอบของ Fugu เลย Sakana ตัดออกโดยให้เหตุผลว่าไม่สามารถเข้าถึงได้สาธารณะ เราจึงทำเท่าที่ทำได้: ตรวจเกณฑ์ทดสอบไม่กี่ตัวที่ปรากฏในตารางของทั้งสองฝ่ายพร้อมฐานเปรียบเทียบที่ตรงกัน และท้ายสุดจะพูดถึงราคาและสถานะการเข้าถึง

หากต้องการพื้นหลังของแต่ละระบบ แยกอ่านได้ในบล็อกของเรา: ดูบทความครอบคลุม Claude Fable 5 และสรุป Sakana Fugu

Sakana Fugu คืออะไร

Sakana Fugu ไม่ใช่โมเดลที่เทรนเดี่ยวแบบทั่วไป แต่เป็นตัวประสานงาน: โมเดลที่รับคำขอของผู้ใช้ ตัดสินใจว่าจะตอบเองหรือมอบหมายให้โมเดลผู้เชี่ยวชาญในพูล จัดการการตรวจทานและสังเคราะห์คำตอบ แล้วส่งผลลัพธ์เดียวกลับมาผ่าน API ที่เข้ากันได้กับ OpenAI จากภายนอกเรียกเพียงเอ็นด์พอยต์เดียว; ภายในเป็นชุดโมเดลแนวหน้าที่ทำงานประสานกัน

มีสองรุ่นย่อย Fugu เน้นสมดุลคุณภาพกับเวลาตอบสนองต่ำ เป็นค่าเริ่มต้นสำหรับงานโค้ด รีวิว และบริการเชิงโต้ตอบในทุกวัน ส่วน Fugu Ultra ประสานตัวแทนผู้เชี่ยวชาญในพูลที่ลึกกว่า ปรับจูนเพื่อคุณภาพคำตอบสูงสุดสำหรับปัญหายากหลายขั้นตอน — ทำซ้ำงานวิจัย วิเคราะห์ด้านความปลอดภัยไซเบอร์ งานดาต้าไซเอนซ์สไตล์ Kaggle การสืบค้นสิทธิบัตร

แนวคิดหลักมีสองชั้น

  • หนึ่ง การประสานงานแบบเรียนรู้ได้: ตัวประสานถูกเทรนให้ตัดสินใจว่าจะมอบหมายเมื่อใดและรวมผลลัพธ์อย่างไร แทนที่จะใช้ไปป์ไลน์ที่เขียนกฎด้วยมือ
  • สอง พูลตัวแทนที่สลับได้: เมื่อมีโมเดลแนวหน้าใหม่ที่เข้าถึงสาธารณะได้ Sakana คาดว่าจะใช้เวลาราวสองสัปดาห์ในการผนวกเข้าไป (จุดสำคัญสำหรับบทความที่เหลือ: Fable 5 ไม่อยู่ในพูลนั้นเพราะไม่สามารถเข้าถึงสาธารณะได้)

Claude Fable 5 คืออะไร

Claude Fable 5 เป็นโมเดลระดับ Mythos ซึ่งเป็นชั้นที่ Anthropic จัดวางไว้เหนือระดับ Opus และทำให้ปลอดภัยสำหรับการใช้งานทั่วไปด้วยชุดตัวจัดประเภท เป็นโมเดลพื้นฐานเดียวกับ Claude Mythos 5 ความต่างคือ Fable 5 ทำงาน (เคยทำงาน) พร้อมตัวจัดประเภทความปลอดภัย ในขณะที่ Mythos 5 ยกเลิกบางตัวและจำกัดให้พันธมิตร Project Glasswing และนักวิจัยชีววิทยาบางส่วนใช้งาน

Anthropic อ้างว่า Fable 5 ทำผลงานระดับแนวหน้าบนแทบทุกเกณฑ์ทดสอบที่ติดตาม โดยยิ่งโดดเด่นขึ้นในงานที่ยาวและซับซ้อน ประเด็นปฏิบัติที่สำคัญ: เมื่อคำถามเกี่ยวข้องกับความปลอดภัยไซเบอร์ ชีววิทยา/เคมี หรือการกลั่นโมเดล ระบบตัวจัดประเภทสองชั้นจะเปลี่ยนเส้นทางคำตอบไปยัง Claude Opus 4.8 และแจ้งผู้ใช้ว่าทำเช่นนั้น

Sakana Fugu เทียบกับ Claude Fable 5: ผลทดสอบ

ตารางเปรียบเทียบที่ Sakana เผยแพร่ไม่รวม Fable 5 และ Mythos Preview โดยให้เหตุผลว่าไม่เปิดให้เข้าถึงสาธารณะ จึงไม่อาจอยู่ในพูลของ Fugu ได้ ตัวเลขทางการของ Fugu จึงเทียบกับ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ซึ่งเห็นได้ในตารางด้านล่าง จะเห็นว่า Fugu ชนะ 10 จาก 11 เกณฑ์

เกณฑ์ทดสอบ Fugu Fugu Ultra Opus 4.8 † Gemini 3.1 Pro † GPT-5.5 †
SWE-Bench Pro * 59.0 73.7 69.2 54.2 58.6
TerminalBench 2.1 80.2 82.1 74.6 70.3 78.2
LiveCodeBench 92.9 93.2 87.8 88.5 85.3
LiveCodeBench Pro 87.8 90.8 84.8 82.9 88.4
Humanity's Last Exam 47.2 50.0 49.8 44.4 41.4
CharXiv Reasoning 85.1 86.6 84.2 83.3 84.1
GPQA-D 95.5 95.5 92.0 94.3 93.6
SciCode 60.1 58.7 53.5 58.9 56.1
τ³ Banking 21.7 20.6 20.6 8.4 20.6
Long Context Reasoning 74.7 73.3 67.7 72.7 74.3
MRCRv2 86.6 93.6 87.9 84.9 94.8

* ใช้ mini-swe-agent เป็นโครงรองรับ † ค่าฐานที่ผู้ให้บริการรายงาน คะแนนของ Fugu ทั้งหมดเป็นตัวเลขที่ Sakana รายงานเองและยังไม่ถูกทำซ้ำโดยอิสระ

เพื่อให้มี Fable 5 ในภาพ รวมตารางเกณฑ์ทดสอบที่ปรากฏในทั้งของ Anthropic และของ Sakana และตรวจว่าฐานเปรียบเทียบที่ใช้ร่วมกันตรงกัน บน SWE-Bench Pro และ Humanity's Last Exam (ไม่ใช้เครื่องมือ) ตัวเลขของ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ตรงกันทั้งสองแหล่ง — จึงเปรียบเทียบได้สะอาด เมื่อตัดให้เหลือเพียงสองระบบ ภาพดวลตัวต่อตัวเป็นดังนี้:

เกณฑ์ทดสอบ Sakana Fugu Sakana Fugu Ultra Claude Fable 5 ผู้นำ
SWE-Bench Pro 59.0 73.7 80.3 Fable 5 (+6.6)
Humanity's Last Exam (ไม่ใช้เครื่องมือ) 47.2 50.0 59.0 Fable 5 (+9.0)
Terminal-Bench 2.1 ‡ 80.2 82.1 88.0 Fable 5 (+5.9)

‡ ห้องแล็บทั้งสองรายงานค่าฐานต่างกันและใช้โครงรองรับสำหรับ TerminalBench ไม่เหมือนกัน เงื่อนไขจึงไม่เหมือนกันทุกประการ

นี่คือเกณฑ์ทดสอบเพียงชุดเดียวที่พบว่าผลลัพธ์ที่เผยแพร่เปรียบเทียบกันได้โดยตรง โดย Fable 5 นำทั้งสาม

ดังนั้น บนทุกเกณฑ์ที่สามารถเปรียบเทียบเคียงข้างกันได้ Fable 5 นำหน้า Fugu Ultra ราว 6–9 คะแนน ซึ่งสอดคล้องกับจุดแข็งของ Fable 5 คือภารกิจระยะยาวที่ให้คะแนนตอนจบ ที่ซึ่งโมเดลเดี่ยวที่แข็งแกร่งกว่าจะสะสมความผิดพลาดเชิงพอกพูนได้น้อยกว่า

สรุป

  1. ตัวเลขของ Fugu ทั้งหมดเป็นการรายงานด้วยตนเอง และยังไม่ปรากฏบนลีดเดอร์บอร์ดของบุคคลที่สาม
  2. Sakana ระบุว่า Fugu “ยืนเคียงบ่าเคียงไหล่” กับ Fable 5 และ Mythos Preview เมื่อเทียบช่องว่างข้างต้น ถือว่าอธิบายได้แต่ค่อนข้างใจกว้าง “ใกล้เคียงแต่ตามหลัง” ตรงกว่า
  3. ชุดเปรียบเทียบซ้อนทับกันเพียงบางส่วน Fable 5 เด่นด้านวิชวล (สามารถสร้างซอร์สเว็บแอปจากสกรีนช็อต) ซึ่ง Fugu ไม่ได้เน้นเลย; Fugu เผยแพร่ผลทดสอบบริบทยาวและธนาคารที่ตารางของ Anthropic ไม่ครอบคลุม จึงถูกปรับให้เหมาะกับรูปแบบงานที่ต่างกันบ้าง

Sakana Fugu เทียบกับ Claude Fable 5: ความพร้อมใช้งานและการเข้าถึง

Claude Fable 5 ถูกระงับอยู่ในขณะนี้ Anthropic ถอนการเข้าถึงทั้ง Fable 5 และ Mythos 5 เมื่อวันที่ 12 มิถุนายน ตามคำสั่งควบคุมการส่งออกของรัฐบาลสหรัฐฯ และระบุว่ากำลังเร่งกู้คืนการเข้าถึงให้เร็วที่สุด รุ่นอื่น ๆ ของ Anthropic อย่าง Opus 4.8 ยังใช้งานได้

Sakana Fugu พร้อมใช้งานแล้ว ผ่าน console.sakana.ai ด้วย API ที่เข้ากันได้กับ OpenAI — ยกเว้น ในสหภาพยุโรปและเขตเศรษฐกิจยุโรป ซึ่ง Sakana หยุดให้บริการชั่วคราวระหว่างดำเนินการให้สอดคล้องกับ GDPR ยังไม่ได้กำหนดกรอบเวลาแน่ชัด

ณ ตอนนี้ ทีมในยุโรปอาจใช้ไม่ได้ทั้งสองรุ่น

ข้อคิดส่งท้าย

ในทางทฤษฎี นี่คือศึกที่สูสีและจริงจังระหว่างสองปรัชญา

Anthropic คิดในเชิงสเกล — โมเดลระดับ Mythos เดียวที่ทรงพลังจนต้องมีระบบตัวจัดประเภทคู่ขนาน

Sakana เดิมพันกับการประสานงาน — เชื่อว่าตัวประสานที่เทรนทับบนพูลที่สลับเปลี่ยนได้ จะตามติดโมเดลแนวหน้าเดี่ยวตัวใดก็ได้ในระยะประชิด พร้อมต้นทุนที่ถูกกว่า ทนทานกว่า และไม่ผูกกับผู้ให้บริการรายใด

หากดูตัวเลขตามที่รายงาน เดิมพันของ Anthropic ให้ผลลัพธ์ที่แข็งแกร่งกว่าบนการทดสอบที่เทียบได้ ขณะที่ของ Sakana ให้สิ่งที่เข้าถึงได้มากกว่าและถูกกว่า

คำถามที่พบบ่อย: Sakana Fugu เทียบกับ Claude Fable

Sakana Fugu ดีกว่า Claude Fable 5 หรือไม่

บนเกณฑ์ที่เปรียบเทียบเคียงข้างกันได้ (SWE-Bench Pro, Humanity's Last Exam, Terminal-Bench) Fable 5 นำหน้า Fugu Ultra ราว 6–9 คะแนน

ทำไม Fable 5 ไม่อยู่ในตารางผลทดสอบของ Fugu

Sakana ตัด Fable 5 และ Mythos Preview ออก เพราะไม่สามารถเข้าถึงสาธารณะ และจึงไม่อาจเป็นส่วนหนึ่งของพูลเอเจนต์ของ Fugu การเปรียบเทียบอย่างเป็นทางการจึงเทียบกับ Opus 4.8, GPT-5.5 และ Gemini 3.1 Pro ซึ่ง Fugu Ultra ชนะ 10 จาก 11 เกณฑ์

รุ่นไหนถูกกว่า

Fugu Ultra ที่ $5 ต่ออินพุตล้านโทเค็น และ $30 ต่อเอาต์พุตล้านโทเค็น มีราคาประมาณครึ่งหนึ่งของ Fable 5 ที่ $10 ต่ออินพุตล้านโทเค็น และ $50 ต่อเอาต์พุตล้านโทเค็น ทั้งคู่มีแพ็กเกจสมัครรายเดือน $20/$100/$200

Fable 5 จะกลับมาไหม

Anthropic ระบุว่ากำลังเร่งกู้คืนการเข้าถึง Fable 5 และ Mythos 5 โดยเร็วที่สุด แต่ยังไม่ประกาศเส้นเวลา รุ่นอื่น ๆ รวมถึง Opus 4.8 ยังคงใช้งานได้ในระหว่างนี้

Fugu แก้ปัญหาการถูกระงับของ Fable 5 ได้จริงหรือไม่

ไม่โดยตรง — Fable 5 ไม่ได้อยู่ในพูลของ Fugu ตั้งแต่แรก ดังนั้น Fugu จึงไม่สามารถทดแทนความสามารถเฉพาะของมันได้

หัวข้อ
ปัญญาประดิษฐ์

เรียนรู้ AI กับ DataCamp

Tracks

AI สำหรับวิศวกรรมซอฟต์แวร์

7 ชม.
เขียนโค้ดและสร้างแอปพลิเคชันซอฟต์แวร์ได้เร็วขึ้นกว่าที่เคยด้วยเครื่องมือสำหรับนักพัฒนา AI ล่าสุด รวมถึง GitHub Copilot, Windsurf และ Replit.
ดูรายละเอียดRight Arrow
เริ่มหลักสูตร
ดูเพิ่มเติมRight Arrow