ข้ามไปยังเนื้อหาหลัก

Mistral Large 4 (Le Chonk): ทุกอย่างที่รู้จนถึงตอนนี้

โมเดล open-weight ระดับล้านล้านพารามิเตอร์ของ Mistral นำโด่งบนเบนช์มาร์กด้านความปลอดภัยไซเบอร์และกฎหมาย
อัปเดตแล้ว 9 ต.ค. 2569  · 15 นาที อ่าน

สำรวจด้วย AI

ChatGPTClaudePerplexity

เมื่อวันที่ 6 ตุลาคม 2026 Mistral เปิดตัว รุ่นพรีวิวสาธารณะของ Mistral Large 4 (ML4) โมเดลที่มีพารามิเตอร์ 1 ล้านล้าน โดยมีพารามิเตอร์ทำงาน 49 พันล้าน รับอินพุตเป็นข้อความและภาพ และสัญญาว่าจะเปิดเผยน้ำหนักโมเดลภายในสิ้นเดือน นี่เป็นโมเดลที่ใหญ่ที่สุดที่ Mistral เคยสร้าง และได้รับการเทรนตั้งแต่ต้นบน Nvidia Grace Blackwell GPU จำนวน 3,800 ตัว ในดาต้าเซ็นเตอร์ของ Mistral เองในยุโรป

ตลอดปีที่ผ่านมา โมเดล open-weight ที่แข็งแกร่งที่สุดส่วนใหญ่มาจากห้องทดลองในจีน (GLM, DeepSeek, Kimi, Qwen) ขณะที่โมเดลที่แข็งแกร่งที่สุดโดยรวมยังคงปิดและให้บริการหลัง API ของสหรัฐฯ Mistral ต้องการเป็นตัวเลือกที่สาม โดยระบุว่า ML4 "มีประสิทธิภาพที่แข่งขันได้กับโมเดลโอเพ่นซอร์สที่แข็งแกร่งที่สุดทั่วโลก และเหนือกว่าโมเดล open-weight ใด ๆ ที่พัฒนาขึ้นในสหรัฐฯ หรือยุโรปอย่างมีนัยสำคัญ"

ภาพรวมจริงซับซ้อนกว่าที่โพสต์เปิดตัวสะท้อน ด้านล่างนี้จะอธิบายสถาปัตยกรรม ผลทดสอบ (แยกระหว่างสิ่งที่ยืนยันซ้ำโดยอิสระแล้วกับสิ่งที่ยังไม่ได้) การเขียนโค้ด วิสัยทัศน์ ความปลอดภัยไซเบอร์ น้ำหนักโมเดลแบบเปิด และสิ่งที่ยังไม่รู้ หากมีเวลาอ่านแค่ส่วนเดียว แนะนำให้อ่านเรื่องความปลอดภัยไซเบอร์

คำตอบแบบย่อ

Mistral Large 4 (Le Chonk) เป็นโมเดล open-weight ที่มีพารามิเตอร์ 1 ล้านล้าน ซึ่ง Mistral วางตำแหน่งว่าเป็นโมเดลที่แข็งแกร่งที่สุดที่สร้างนอกจีน โดยเฉพาะในด้านความปลอดภัยไซเบอร์ การเงิน กฎหมาย และการยึดโยงเชิงภาพ ผลประเมินอิสระสนับสนุนเคลมด้านความปลอดภัยไซเบอร์และกฎหมาย จัดให้ด้านการเงินอยู่ระดับกลาง ๆ และจัดอันดับ ML4 เป็นที่ 32 จาก 44 โมเดลบนดัชนีรวมกว้าง ๆ API ใช้งานได้แล้วตอนนี้ และน้ำหนักโมเดลจะปล่อยวันที่ 27 ตุลาคม

Mistral Large 4 (Le Chonk) คืออะไร?

สรุปสั้น ๆ ข้างต้นยังตกหล่นหลายอย่าง เริ่มจากพื้นฐานก่อน ML4 เป็นเรือธงรุ่นใหม่ของ Mistral และตามคำของ Mistral เองคือ "โมเดลที่ใหญ่และมีความสามารถสูงสุดจนถึงปัจจุบัน" Le Chonk เป็นชื่อเล่น แม้ว่าในข้อความเปิดตัวของ Mistral จะเล่นสลับปกติว่า: "อย่างไม่เป็นทางการคือ ML4 อย่างเป็นทางการมาก ๆ คือ le Chonk"

เป็นโมเดล Mixture-of-Experts (MoE) แบบมัลติโมดัลโดยกำเนิด ตัวเลขไฮไลต์คือพารามิเตอร์รวม 1 ล้านล้าน และพารามิเตอร์ทำงานต่อโทเค็น 49 พันล้าน แม้ว่า เอกสารโมเดลของ Mistral เองจะระบุตัวเลขต่างออกไปเล็กน้อย (รวม 1.05T ทำงาน 52B) ไม่มีแหล่งใดอธิบายช่องว่างนี้ (เหตุผลที่ "ทำงาน" สำคัญจะอธิบายในส่วนถัดไป)

Mistral เล็ง ML4 สำหรับงานองค์กร: การเขียนโค้ด ความปลอดภัยไซเบอร์ การเงิน กฎหมาย การผลิตและวิศวกรรม และงานภาพ เช่น อ่านแบบเทคนิคหรือภาพถ่ายดาวเทียม

สเปก

รายละเอียด

พารามิเตอร์รวม

1 ล้านล้านตาม ประกาศ 1.05T ตาม เอกสาร

พารามิเตอร์ทำงาน

49B ตาม ประกาศ 52B ตาม เอกสาร

สถาปัตยกรรม

Mixture-of-Experts แบบผสมคำสั่งและการให้เหตุผล

อินพุต

ข้อความและภาพ

เอาต์พุต

ข้อความเท่านั้น

หน้าต่างบริบท

1M โทเค็นตาม เอกสาร 512K ตาม vals.ai (ยังไม่ชัดเจน)

มีสองแถวที่สำคัญที่สุดสำหรับผู้วางแผนดีพลอย และทั้งสองยังไม่ลงตัว: หน้าต่างบริบทและสัญญาอนุญาต ก่อนจะเข้าไปว่าโมเดลทำงานอย่างไร ชื่อก็ควรอธิบายสั้น ๆ

ทำไมถึงชื่อ Le Chonk?

ในเดือนมิถุนายน 2026 Mistral โพสต์ประกาศเชิงล้อเลียนสำหรับ "Le Chaton Fat" โมเดลสมมุติที่มีพารามิเตอร์ 24 ล้านล้าน แล้วลบออก แต่โลกอินเทอร์เน็ตยังเล่นต่อ ยกระดับสเปกไปถึงหลักหลายร้อยล้านล้าน สี่เดือนต่อมา Mistral ส่งมอบโมเดลที่มีพารามิเตอร์ระดับล้านล้านจริง ๆ และชื่อก็แทบเลือกตัวเอง นั่นคือทั้งหมด กลับมาที่โมเดลกัน

Mistral Large 4 ทำงานอย่างไร

Mistral ยังไม่เผยรายละเอียดสถาปัตยกรรมฉบับเต็ม (สัญญาว่าจะมาพร้อมน้ำหนักโมเดล) ส่วนนี้จึงยึดตามที่เปิดเผยแล้ว

พารามิเตอร์ 1 ล้านล้าน ทำงาน 49 พันล้าน

โมเดลที่มีพารามิเตอร์ 1 ล้านล้านไม่ได้ใช้ครบทุกตัวในทุกโทเค็น โมเดล MoE จะส่งแต่ละโทเค็นผ่านเครือข่ายย่อยแบบ "ผู้เชี่ยวชาญ" เพียงบางส่วน ดังนั้นคอมพิวต์ขณะอนุมานจึงสอดคล้องกับพารามิเตอร์ทำงาน 49 พันล้าน ทำให้ใกล้เคียงกับโมเดลหนาแน่นราว ~50B มากกว่าระดับ 1T

แล้วเสิร์ฟถูกไหม? ไม่ เพราะพารามิเตอร์ 1 ล้านล้านทั้งหมดต้องอยู่ในหน่วยความจำที่ไหนสักแห่ง การโฮสต์ ML4 เองจึงต้องใช้โครงสร้างพื้นฐานหลาย GPU ที่จริงจัง อีกทั้งโมเดล MoE ยังให้บริการที่ latency ต่ำได้ยากกว่าโมเดลหนาแน่นที่มีจำนวนพารามิเตอร์ทำงานเท่ากัน Mistral ยังไม่เผยข้อกำหนดฮาร์ดแวร์ และน่าประหลาดใจหากมีหลายทีมที่อยู่นอกองค์กรขนาดใหญ่และหน่วยงานรัฐสามารถรันโมเดลเต็มได้เอง

อินพุตแบบมัลติโมดัล

พารามิเตอร์ทำงานเหล่านั้นรองรับมากกว่าข้อความ ML4 รับภาพได้ด้วย แม้จะส่งกลับเป็นข้อความอย่างเดียว Mistral ระบุว่าโมเดลนี้ "ให้เหตุผลได้ทรงพลังกับเอกสารซับซ้อน ชาร์ต และภาพธรรมชาติ" และเล็งอุตสาหกรรมที่การรับรู้เชิงภาพสำคัญ เช่น วิศวกรรม การผลิต และการสังเกตโลก เดโมทั้งหมดเป็นเชิงอุตสาหกรรม: ตรวจสอบชิ้นส่วนกลไกในแบบเทคนิค ดึงพยานหลักฐานจาก PDF สแกนภาพถ่ายดาวเทียมระดับกิกะพิกเซลเพื่อหาออบเจ็กต์ที่ค้นหายาก

มากกว่า 160 ภาษา

ลูกค้าอุตสาหกรรมกลุ่มเดียวกันมักทำงานข้ามพรมแดน ซึ่งทำให้เรื่องภาษามีบทบาท Mistral ระบุว่า "สัดส่วนสำคัญ" ของข้อมูลฝึกเป็นพหุภาษา ครอบคลุมมากกว่า 160 ภาษา และทุกภาษาราชการของสหภาพยุโรป สำหรับบริษัทยุโรปที่ต้องการหน่วยงานรัฐยุโรป นี่คือส่วนสำคัญของข้อเสนอ

โครงสร้างพื้นฐานการฝึก

สำหรับข้อเสนอเชิงยุโรป สถานที่ฝึกก็สำคัญเช่นกัน ตามที่ Mistral ระบุ ML4 ถูก เทรนตั้งแต่ต้นบน Nvidia Grace Blackwell GPU จำนวน 3,800 ตัว ในดาต้าเซ็นเตอร์ของตนเองในยุโรป Pierre Stock รองประธานฝ่ายวิทยาการของ Mistral ให้ตัวเลขกลม ๆ กับ TechCrunch ที่ 4,000 และบอกว่านั่นคือ "น้อยกว่าคู่แข่งจีนสองถึงสามเท่า" ยังไม่มีใครยืนยันการเปรียบเทียบนี้

การสร้างคอมพิวต์เบื้องหลังเรื่องนี้ถูกเปิดเผยมาระยะหนึ่งแล้ว มีนาคม 2026 Mistral กู้เงิน 830 ล้านดอลลาร์ เพื่อซื้อ Nvidia GB300 GPU จำนวน 13,800 ตัวสำหรับดาต้าเซ็นเตอร์ใกล้ปารีส Mistral ไม่ได้บอกว่า ML4 ถูกเทรนบนคลัสเตอร์นั้นโดยเฉพาะหรือไม่ จึงยังไม่เชื่อมโยงสองเรื่องนี้

มีรายละเอียดหนึ่งอย่างที่เปลี่ยนวิธีอ่านทุกเบนช์มาร์กในบทความนี้ การรัน reinforcement learning (RL) ยังดำเนินอยู่ RL คือช่วงหลังการเทรนที่โมเดลพัฒนาตนเองจากการถูกให้คะแนนบนการลองทำงานของตัวเอง และ Mistral ระบุว่าขณะนี้ใช้ GPU ราว 3,000 ตัว สร้างโทเค็นราว 33 พันล้านต่อวัน และ "ยังไม่เห็นสัญญาณอิ่มตัว" ดังนั้นโมเดลที่เรียกผ่าน API วันนี้จะไม่ใช่โมเดลเดียวกับที่ปล่อยน้ำหนักวันที่ 27 ตุลาคม

ผลทดสอบของ Mistral Large 4

การรัน RL ที่ยังไม่เสร็จคือเหตุผลแรกที่ควรมองทุกอย่างในส่วนนี้เป็นข้อมูลชั่วคราว เหตุผลที่สองคือ ตัวเลขส่วนใหญ่ของ Mistral ยังไม่ถูกทำซ้ำโดยอิสระ และบางส่วนที่ทำซ้ำแล้วก็ไม่ตรงกัน

การประเมินอิสระในวันเปิดตัวแบ่งเป็นสามกลุ่ม:

  • ทำซ้ำโดยอิสระแล้ว: Artificial Analysis (AA) Cyber Index รวมถึงส่วน CyberGym-E2E และการประเมินบน vals.ai ห้ารายการ รวมถึง Terminal-Bench 4.0
  • รันโดย AA แต่ยังไม่เป็นสาธารณะ: เชิงอรรถบนชาร์ตการเขียนโค้ดของ Mistral ระบุว่า คะแนน DeepSWE, Terminal-Bench และ SWE-Atlas "ใช้ตัวเลขที่ Artificial Analysis ประเมินแบบส่วนตัวก่อนเปิดตัวฮาร์เนสต่อสาธารณะ" ซึ่งจะไปปรากฏบน Coding Agent Index ของ AA เมื่อฮาร์เนสดังกล่าวปล่อยออกมา ก่อนหน้านั้นไม่มีใครนอก AA และ Mistral ตรวจสอบได้
  • เฉพาะ Mistral: อย่างอื่นทั้งหมด

ให้ความสนใจกับคอลัมน์สุดท้ายของตารางมากที่สุด เบนช์มาร์กอาจถูกสร้างโดยกลุ่มอิสระ แต่คะแนน ML4 บนเบนช์มาร์กนั้นอาจยังเป็นเพียงเคลมของ Mistral

สรุปผลเบนช์มาร์ก

เบนช์มาร์ก

ผลของ ML4

คู่แข่ง

วัดอะไร

DeepSWE v1.1

61.7%, รันแบบส่วนตัวโดย AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (รายงานเอง)

งานวิศวกรรมซอฟต์แวร์ระยะยาว

Terminal-Bench 4.0

28.3% ตาม Mistral 22.73% ตาม vals.ai

ที่ 20 จาก 44 บน vals.ai

เวิร์กโฟลว์เทอร์มินัลที่ซับซ้อน

SWE-Atlas-QnA

59.4%, รันแบบส่วนตัวโดย AA

ไม่ได้เผยแพร่

ความเข้าใจที่เก็บซอร์สโค้ด

Coding Agent Index

49.8%, รันแบบส่วนตัวโดย AA

นำหน้า DeepSeek V4 Pro 0813 และ Qwen3.8 Max

องค์รวมของสามเบนช์มาร์กการเขียนโค้ดข้างต้น

AutomationBench

59.9% ตาม Mistral

นำหน้า Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

เวิร์กโฟลว์ธุรกิจ 657 รายการบนแอปอย่าง Gmail, Slack และ Salesforce

AA-Briefcase

Elo 1,393, อ้างโดย Mistral ว่าเป็นของ AA

นำหน้า DeepSeek V4 Pro

งานความรู้ระยะยาว

Dense 200

42% ตาม Mistral

GPT-6 Astra 41%

การยึดโยงเชิงภาพ (visual grounding)

AA Cyber Index

50%, ท็อป 5 จาก 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

การค้นหาและแก้จุดบกพร่องในซอฟต์แวร์จริง

CyberGym-E2E

82%, อันดับ 1 จาก 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

ทำซ้ำและแพตช์ช่องโหว่จริง

Cybench

93% ตาม Mistral

"หนึ่งในคะแนนสูงสุด" สำหรับ open weights ตาม Mistral

โจทย์แข่งขันความปลอดภัย 40 ข้อ

Finance Agent v2

54.68%

ที่ 22 จาก 75 ที่ 7 จาก 32 สำหรับ open-weight

งานเอเจนต์ด้านการเงิน

Harvey's Legal Agent

15.83%, อันดับ 6 จาก 75

อันดับ 1 จาก 31 โมเดล open-weight

งานกฎหมายแบบอัตโนมัติ

KORA Benchmark

1.691 จาก 2 ตาม Mistral

สูงสุดในหมู่โมเดลเปิดที่ Mistral ทดสอบ

พฤติกรรม AI ที่รับผิดชอบ

B3 Attack Resistance

93.3% ตาม Mistral

"ไม่มีคู่แข่งที่ได้คะแนนสูงกว่า" ตาม Mistral

ความต้านทานต่อ prompt injection

Vals Index

48.05%, อันดับ 32 จาก 44

อันดับ 9 จาก 16 สำหรับ open-weight

ดัชนีรวมกว้าง ๆ ข้ามงาน

อันดับเบนช์มาร์กของ Mistral 4

อ่านแถวสุดท้ายเคียงคู่กับเคลมหัวข่าวของ Mistral บนดัชนีกว้างของ vals.ai ML4 อยู่ที่ 32 จาก 44 โดยรวม และ 9 จาก 16 ในบรรดาโมเดล open-weight เท่านั้น ซึ่งยากจะสอดคล้องกับ "แข่งขันได้กับโมเดลโอเพ่นซอร์สที่แข็งแกร่งที่สุดทั่วโลก" อย่างน้อยในภาพรวม ผลลัพธ์ในแนวดิ่งของ Mistral ดูดีกว่ามาก และไม่ได้ผิด เพียงแต่วัดสิ่งที่แคบกว่า หากกำลังตัดสินใจจะสร้างบน ML4 แนวดิ่งที่เกี่ยวข้องกับงานของคุณสำคัญกว่าข่าวพาดหัวทั้งสอง

การเขียนโค้ด

การเขียนโค้ดคือจุดที่ช่องว่างระหว่างหัวข่าวกับรายละเอียดปรากฏก่อน ตัวเลขของ Mistral ดูดีเมื่อมองผ่าน ๆ แต่หากดูชาร์ต DeepSWE จะเห็นสิ่งที่ข้อความไม่เอ่ยถึง แท่งที่สูงสุดคือ Kimi K3 ที่ 69% สูงกว่า ML4 อยู่เจ็ดจุด ML4 เฉือน GLM-5.3 (62% เทียบ 61%) แต่หนึ่งจุดอยู่ในช่วงสัญญาณรบกวนจากการเลือกฮาร์เนส "ฮาร์เนส" คือโครงครอบที่ห่อโมเดลระหว่างการทดสอบแบบเอเจนต์ ได้แก่ เครื่องมือ พรอมป์ต และจำนวนครั้งที่ลอง ในชาร์ตของ Mistral คู่แข่งแต่ละรายรันในฮาร์เนสต่างกันทั้งหมด บน กระดานผู้นำ DeepSWE แบบสดของ Datacurve ซึ่งรันทุกโมเดลในเซ็ตอัพเดียวกัน GLM-5.3 และ Kimi K3 ทำได้ 69% และ DeepSeek V4 Pro ทำได้ 63% ML4 ยังไม่ถูกขึ้นตาราง

Terminal-Bench ก็สะท้อนผลในอีกทิศ Mistral รายงาน 28.3% ส่วนการรันอิสระของ vals.ai ได้ 22.73% ไม่ได้มองว่าใครฟูตัวเลข เพียงย้ำว่าเลขเดียวจากเซ็ตอัพเดียวไม่ใช่อันดับ

การประเมินโดยมนุษย์น่าสนใจกว่า ในการประเมินแบบปกปิดที่ Mistral ว่าจ้างจาก Surge AI ผู้อนุทินมืออาชีพให้คะแนนผลลัพธ์การเขียนโค้ดตั้งแต่ 1 ถึง 5 ML4 ได้ที่สองจากห้า (3.74) นำหน้า GLM-5.3 (3.60) Kimi K3 (3.59) และ GLM-5.2 (3.40) และตามหลัง Claude Opus 5 (4.22) อย่างมาก สังเกต Kimi K3: นำ ML4 เจ็ดจุดบน DeepSWE แต่ตามหลังในการชอบของมนุษย์ การผ่านข้อสอบกับการเขียนโค้ดที่คนอ่านชอบไม่ใช่ทักษะเดียวกัน (และนั่นคือ Opus 5 ไม่ใช่ 5.5 รุ่นใหม่กว่า ช่องว่างกับโมเดลปิดที่ดีที่สุดจึงน่าจะกว้างกว่า)

การประเมินภายในของ Mistral ชุดที่สองทำให้เรื่องยิ่งคลุมเครือ พบว่า ML4 "พอ ๆ กันหรือใกล้เคียง" กับ GLM-5.3 ในด้านโค้ดและการเงิน และเหนือกว่าเฉพาะด้าน CAD และ STEM โดยรวมมองว่าใกล้เคียงกัน

การเงิน

ด้านการเงินง่ายกว่า ส่วนใหญ่เพราะมีตัวเลขอิสระยึดโยง ML4 ทำได้ 54.68% บน Finance Agent v2 บน vals.ai ซึ่งจัดอันดับที่ 22 จาก 75 โดยรวม และที่ 7 จาก 32 ในหมู่โมเดล open-weight อยู่กลางตารางอย่างมั่นคง เคลมจริงของ Mistral แคบกว่านั้น: ML4 ชนะ GPT-6 Astra ในเบนช์มาร์กนี้

Mistral ยังรายงานผลที่ดีบน FinWorkBench ซึ่งทดสอบว่าโมเดลสามารถสร้างและแก้ไขสเปรดชีตสำหรับงานการเงินและบัญชีจริงได้หรือไม่ ตัวเลขเหล่านั้นมาจากชาร์ตของ Mistral และยังไม่มีการทำซ้ำที่อื่น

กฎหมาย

ด้านกฎหมายดูดีกว่ามากบนกระดาษ บน Harvey's Legal Agent Benchmark ML4 อยู่อันดับ 6 จาก 75 และอันดับหนึ่งในหมู่โมเดล open-weight 31 โมเดล คะแนนคือ 15.83%

อ่านตัวเลขนั้นซ้ำอีกครั้ง การได้ที่หกของโลกในงานกฎหมายแบบอัตโนมัติหมายถึงทำสำเร็จประมาณหนึ่งในหกงาน เบนช์มาร์กนี้ยากและอันดับเป็นของจริง แต่ไม่ควรตีความว่า "ML4 ทำงานกฎหมายได้โดยไม่ต้องกำกับดูแล" ยังไม่มีโมเดลไหนทำได้

วิสัยทัศน์และการยึดโยงเชิงภาพ

ด้านวิสัยทัศน์เป็นกรณีตรงข้าม เคลมแรง แต่ยังไม่มีข้อมูลอิสระ เคลมหัวข่าวคือเรื่อง visual grounding ซึ่งหมายถึงการระบุตำแหน่งวัตถุหรือบริเวณเฉพาะในภาพจากคำอธิบายข้อความ เช่น "หาการเชื่อมที่แตกร้าวในแบบนี้" มากกว่า "อธิบายภาพนี้" Mistral รายงาน 42% บน Dense 200 นำหน้า GPT-6 Astra ที่ 41% เพียงเล็กน้อย ไม่ควรตัดสินใจซื้อจากช่องว่างหนึ่งจุด

Mistral ระบุว่า ML4 ทำได้ดีบน ChartQA Pro และ GDP.pdf ซึ่งเป็นเบนช์มาร์กให้เหตุผลกับเอกสาร ผลด้านวิสัยทัศน์ยังไม่มีใครทำซ้ำอย่างอิสระ กรณีใช้งานที่ Mistral เน้นส่วนใหญ่เป็นอุตสาหกรรม ตั้งแต่ภาพดาวเทียมเพื่อรับมือภัยพิบัติ ไปจนถึงตรวจแบบเทคนิคและสแกนภาพภูมิสารสนเทศขนาดใหญ่

Mistral Large 4 เหมาะกับงานเขียนโค้ดแค่ไหน?

กลับมาที่การเขียนโค้ด ซึ่งเป็นสิ่งที่ผู้อ่านส่วนใหญ่จะใช้ ML4 จริง ๆ ถือว่าแข่งขันได้ในหมู่โมเดล open-weight แต่ไม่ใช่โมเดลโค้ดที่ดีที่สุด และไม่ใช่แม้แต่โมเดลเปิดที่ดีที่สุดบนชาร์ตของ Mistral เอง ไม่ต้องทวนตัวเลข นี่คือการแปลผลสู่รูปงาน:

  • แก้ปัญหาในโค้ดเบสจริง (วิศวกรรมซอฟต์แวร์แบบเอเจนต์): ใช้งานได้ แต่ Kimi K3 ดูแข็งแกร่งกว่า
  • เข้าใจที่เก็บขนาดใหญ่: มีแนวโน้มดี แม้จะอิงบนคะแนนที่รันแบบส่วนตัวเพียงครั้งเดียว
  • การรันเอเจนต์ยาวหลายชั่วโมง: การตั้งค่า RL ของ Mistral ถูกออกแบบมาสำหรับเส้นทางยาว แต่ยังไม่มีใครทดสอบแบบอิสระ
  • งานที่พึ่งพาเทอร์มินัลมาก: สัญญาณอิสระที่อ่อนสุดจนถึงตอนนี้

ควรรอให้ ML4 ถูกบันทึกบน Coding Agent Index แบบสาธารณะของ AA ซึ่งคาดว่าจะตามมาหลังปล่อยน้ำหนัก ก่อนจะสรุปว่าเกินกว่าตัวเลือก open-weight ที่น่าเชื่อถือ

สิ่งที่ open weights เติมเต็มในส่วนนี้ไม่เกี่ยวกับคะแนน บริษัทสามารถรัน ML4 บนโครงสร้างพื้นฐานของตนและไม่ต้องส่งซอร์สโค้ดลับออกไปยัง API ภายนอก สำหรับเอเจนต์เขียนโค้ดบนโค้ดเบสลับ เพียงเหตุผลนี้ก็ชี้ขาดได้

Mistral Large 4 สำหรับความปลอดภัยไซเบอร์

นี่คือเคลมที่กล้าหาญที่สุดของ Mistral บน Artificial Analysis Cyber Index การประเมินอิสระของ AA ว่าโมเดลค้นหา ทำซ้ำ และแพตช์ช่องโหว่ในซอฟต์แวร์จริงได้ดีเพียงใด ML4 ได้ 50% อยู่ท็อปไฟว์จาก 18 โมเดลที่ทดสอบ มีเพียง Grok 4.7, MiMo-V2.6-Pro และ GPT-6 Luna ที่สูงกว่า และ GLM-5.3 Flash เสมอกัน Mistral ระบุว่า ML4 "นำหน้าโมเดล open-weight ที่พัฒนานอกจีนอย่างทิ้งห่าง" ซึ่งสอดคล้องกับชาร์ตของ AA

จุดเด่นคือ CyberGym-E2E หนึ่งในสามองค์ประกอบของดัชนี นี้ให้โมเดลทำซ้ำช่องโหว่จริงในโอเพ่นซอร์ส ("CVE" คือช่องโหว่ที่ถูกจัดทำรายการสาธารณะ) แล้วแพตช์ ML4 ได้ 82% เป็นที่หนึ่งจาก 18 โมเดลที่ AA ทดสอบ Mistral ยังรายงาน 93% บน Cybench ชุดโจทย์แข่งขันด้านความปลอดภัย 40 ข้อ แม้ยังไม่มีใครทำซ้ำคะแนนนี้

ข้อมูลการปฏิเสธก็น่าสนใจ บน CyberGym-E2E ชาร์ตของ AA แสดงว่า Claude Opus 5.5 ถูกบล็อกด้วยเหตุผลด้านความปลอดภัยราว 96% ของงาน และ GPT-6 Astra ถูกบล็อก 100% โมเดลเหล่านี้ได้คะแนนใกล้ศูนย์เพราะถูกปฏิเสธงาน จึงไม่ได้สะท้อนความสามารถที่แท้จริงว่าจะทำได้อะไร การปฏิเสธเป็นนโยบายที่เหมาะสมหรือไม่นั้นเป็นอีกประเด็นหนึ่ง

และนั่นคือข้อเสนอหลักของ Mistral งานป้องกันด้านความปลอดภัยมักเริ่มจากการทำซ้ำจุดบกพร่องเพื่อพิสูจน์ว่ามีอยู่จริง และทีมความปลอดภัยต้องทำสิ่งนี้ในปริมาณมาก สแกนโค้ดเบสขนาดใหญ่และคัดแยกผลจำนวนมาก โมเดลที่ปฏิเสธงานส่วนใหญ่ หรือผู้ให้บริการที่เปลี่ยนนโยบายการกำกับดูแลกลางเหตุการณ์ คือความเสี่ยง ข้อโต้แย้งที่ระบุไว้ของ Mistral คือการรัน ML4 บนโครงสร้างพื้นฐานของคุณเองทำให้พฤติกรรมของโมเดลอยู่ภายใต้การควบคุม การถกเถียงกว้าง ๆ เกี่ยวกับมาตรการคุ้มครอง AI ที่ไปขวางงานป้องกันโดยชอบได้ดำเนินมาระยะหนึ่งแล้ว

ตอนนี้คือส่วนแย่: เมื่อเผยแพร่น้ำหนักโมเดล ผู้โจมตีก็ได้ความสามารถเดียวกัน ดัชนีของ AA ถูกออกแบบให้เน้นฝ่ายป้องกัน (โมเดลทำงานจากซอร์สโค้ดและไม่ถูกขอให้สร้างเอ็กซ์พลอยต์ที่ทำงานได้จริง) ดังนั้นคะแนนทำซ้ำ 82% ไม่ได้หมายถึงความสามารถเชิงรุก 82% อย่างไรก็ตาม ระยะจาก "ทำซ้ำการแครช" ไปถึง "ทำให้เป็นอาวุธ" ก็ไม่ได้ไกลนัก Mistral ใช้เวลาสามสัปดาห์ก่อนปล่อยเพื่อทำ red-team กับโมเดล คือพยายามทำให้โมเดลประพฤติผิดโดยตั้งใจ ร่วมกับ "ผู้นำด้านไซเบอร์หุ้นส่วนที่ผ่านการคัดกรอง และหน่วยงานรัฐ"

เหตุผลที่ open weights สำคัญสำหรับ Mistral Large 4

กรณีด้านความปลอดภัยไซเบอร์แท้จริงคือข้อโต้แย้งเพื่อ open weights และขยายไปไกลกว่าด้านความปลอดภัยมาก "ดาวน์โหลดโมเดลได้" ยังอธิบายไม่หมด

ธนาคารที่รัน ML4 บนเซิร์ฟเวอร์ของตนไม่ต้องส่งข้อมูลลูกค้าไปยัง Mistral หน่วยงานรัฐควบคุมสภาพแวดล้อมดีพลอยทั้งหมด ทีมความปลอดภัยปรับพฤติกรรมโมเดลได้โดยไม่ต้องรอคอยนโยบายกำกับดูแลของผู้ให้บริการ ซึ่งหลังจากส่วนก่อนหน้าก็ไม่ใช่ข้อกังวลในเชิงสมมุติ และหากผู้ให้บริการล่มหรือยกเลิกเวอร์ชันโมเดล ดีพลอยที่โฮสต์เองยังคงทำงานต่อ

open weights ยังทำให้การปรับแต่งใช้งานได้จริง เคยกล่าวถึง Mistral Forge ไปแล้วในเดือนเมษายน และ Mistral ระบุว่า ML4 "ใช้สภาพแวดล้อมการเทรน ปรับแต่ง และ RL เดียวกัน" ที่มอบให้ลูกค้าองค์กรผ่าน Forge สำหรับองค์กรที่ต้องการปรับแต่ง ML4 บนข้อมูลของตน Forge คือเส้นทางที่ชัดเจน

คำจำกัดความสั้น ๆ: open-weight หมายถึงพารามิเตอร์ของโมเดลที่เทรนแล้วถูกเปิดเผยต่อสาธารณะ ไม่ได้หมายถึงข้อมูลฝึก โค้ดฝึก หรืออย่างอื่นถูกรวมภายใต้สัญญาอนุญาตโอเพ่นซอร์ส หน้า โมเดลของ Mistral อธิบาย ML4 ว่าเป็น open-weight แต่ยังไม่เผยเงื่อนไขสิทธิ์อนุญาต ตราบใดที่ยังไม่มี การใช้งานเชิงพาณิชย์ สิทธิ์ในการปรับแต่ง และการแจกจ่ายต่อ ล้วนเป็นคำถาม ยอมรับว่าหงุดหงิดเล็กน้อยที่ต้องเขียนว่า "ตรวจสอบสัญญาอนุญาต" กับโมเดลที่ข้อเสนอหลักคือการควบคุม แต่สถานการณ์เป็นเช่นนั้น

Mistral Large 4 กับแรงผลักดันอธิปไตย AI ของยุโรป

การควบคุมยังเป็นแก่นของข้อเสนอทางการเมืองของ Mistral ด้วย ประธานาธิบดีฝรั่งเศส Macron อธิบายแนวทางของ Mistral ว่า "ทางสายที่สามของ AI" สองทางแรกคือโมเดลปิดของสหรัฐฯ ที่มีความสามารถแต่ขึ้นกับกฎหมายอเมริกันและนโยบายผู้ให้บริการ และโมเดลเปิดของจีนที่มักมีความสามารถแต่ก่อกังวลเรื่องที่ตั้งข้อมูลและภูมิรัฐศาสตร์สำหรับสถาบันยุโรป ข้อเสนอของ Mistral คือ open weights โครงสร้างพื้นฐานในยุโรป และกฎหมายยุโรป

รวมถึงการดีพลอยในยุโรปที่ Mistral ระบุว่าดำเนินงาน "แบบ end-to-end โดยเป็นอิสระจากผู้ให้บริการดิจิทัลรายอื่น และอยู่ภายใต้กฎหมายยุโรป" หากอยู่ภายใต้ GDPR หรือกฎที่ตั้งข้อมูลตามอุตสาหกรรม ควรตรวจสอบข้ออ้างนี้กับข้อตกลงประมวลผลข้อมูลของ Mistral ก่อนพึ่งพา

Mistral ยังมีเงินหนุนข้อเสนอนี้ Mistral เรียก ML4 ว่า "หมุดหมายแรกบนโรดแมปที่ได้รับทุนจากรอบซีรีส์ D มูลค่า €3 พันล้าน" รอบที่นำโดย Samsung ที่มูลค่า €21 พันล้าน ซึ่ง Mistral อธิบายว่าเป็น รอบทุนที่ใหญ่ที่สุดเท่าที่บริษัทเทคโนโลยียุโรปเคยระดมได้ โดยส่วนใหญ่จะลงทุนในศักยภาพดาต้าเซ็นเตอร์ยุโรป

ดังนั้น ยุโรปจะผลิตโมเดลระดับแนวหน้าพร้อมให้การควบคุมสถานที่และวิธีการรันมากขึ้นได้หรือไม่? ML4 เป็นข้อมูลจุดแข็งสำหรับครึ่งเรื่องการควบคุม ส่วนครึ่งเรื่องแนวหน้า อันดับ 32 จาก 44 บน Vals Index บอกว่ายุโรปยังไปไม่ถึง

Mistral Large 4 เทียบกับโมเดล open-weight อื่น ๆ

หากยุโรปยังไปไม่ถึง ก็เป็นธรรมดาที่จะถามว่าใครไปถึงแล้ว และ ML4 เทียบกับพวกเขาอย่างไร จะไม่ใส่คะแนนของทุกโมเดลในตารางเดียว เพราะมาจากเซ็ตอัพต่างกันและตารางรวมจะสื่อว่ามันเปรียบเทียบกันได้ จำนวนพารามิเตอร์ก็ไม่ใช่ตัวแทนความสามารถเช่นกัน ตารางด้านล่างเพียงวางตำแหน่งแต่ละตัว:er. The table below just places each one:

โมเดล

สถาปัตยกรรม

มีน้ำหนักโมเดลหรือไม่

จุดแข็ง

แหล่งกำเนิด

Mistral Large 4

MoE, รวม 1T / ทำงาน 49B

27 ตุลาคม (ตามแผน)

ความปลอดภัยไซเบอร์ กฎหมาย (ได้รับการสนับสนุนโดยอิสระ)

ฝรั่งเศส

GLM-5.3

ไม่ได้เปิดเผย

มี

การเขียนโค้ด STEM

จีน

DeepSeek V4 Pro

MoE

มี

การเขียนโค้ด คณิตศาสตร์

จีน

Reflection Beam

ไม่ได้เปิดเผย

มี

การให้เหตุผลทั่วไป

สหรัฐฯ

Qwen3.8 Max

ไม่ได้เปิดเผย

ยังไม่ยืนยัน

พหุภาษา การเขียนโค้ด

จีน

Mistral Large 4 เทียบ GLM-5.3

การเปรียบเทียบที่สำคัญที่สุด เพราะ GLM-5.3 เป็นหนึ่งในโมเดลเปิดของจีนที่แข็งแกร่ง ตามที่กล่าวในส่วนการเขียนโค้ด ทั้งสองต่างกันหนึ่งจุดบนชาร์ตของ Mistral การประเมินโดยมนุษย์ให้ผลผสม และ GLM-5.3 ทำได้ 69% บนกระดานสดที่ ML4 ยังไม่ถูกทดสอบ ถือว่าเสมอกันจนกว่าจะมีลีดเดอร์บอร์ดอิสระที่มีทั้งคู่

Mistral Large 4 เทียบ DeepSeek V4 Pro

ML4 ชนะทุกการเปรียบเทียบที่ Mistral เผย (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase) แต่ไม่มีรายการใดยืนยันโดยอิสระ และ DeepSeek V4 Pro ทำได้ 63% บนลีดเดอร์บอร์ด DeepSWE สด สูงกว่า 62% ของ ML4 ยังไม่มีการเทียบตรงด้านการเงิน

Mistral Large 4 เทียบ Reflection Beam

Reflection Beam เป็นผู้ท้าชิง open-weight ฝั่งตะวันตกรายอื่น ทำให้เป็นบททดสอบตรงที่สุดของเคลม "ดีที่สุดนอกจีน" ของ Mistral ข้อมูลยังบาง ชาร์ต DeepSWE ของ Mistral ระบุ Beam ที่ 44% ต่ำกว่า ML4 เกือบ 18 จุด แต่นั่นเป็นตัวเลขรายงานเองเทียบกับคะแนนที่ AA รัน จึงไม่ควรยึดช่องว่างนี้ Reflection ยังไม่เปิดเผยขนาดของ Beam จึงเทียบสเกลไม่ได้ ML4 มีอินพุตมัลติโมดัลกว้างกว่าและมีหลักฐานด้านความปลอดภัยไซเบอร์ที่เผยแพร่เข้มแข็งกว่าอย่างชัดเจน

จะใช้ Mistral Large 4 ได้เมื่อไร?

ไม่จำเป็นต้องรอให้การเปรียบเทียบทั้งหมดนิ่งก่อนลองใช้ ML4 ด้วยตัวเอง ไทม์ไลน์จนถึงตอนนี้:

  1. 6 ตุลาคม: เริ่มพรีวิวสาธารณะ ทุกคนเรียก mistral-large-4 ผ่าน Mistral Studio ได้
  2. ระหว่างพรีวิว: ผู้นำด้านความปลอดภัยไซเบอร์ หุ้นส่วนที่ผ่านการคัดกรอง และหน่วยงานรัฐจะได้เวอร์ชันที่ "ลดการกำกับดูแลและขยายความสามารถด้านไซเบอร์" เพื่อทำ red-team Pierre Stock บอกกับ TechCrunch ว่า Mistral จะ "ทำงานร่วมกับพันธมิตรที่ไว้ใจได้และรัฐบาลเพื่อให้แน่ใจว่าน้ำหนักโมเดลโอเพ่นซอร์สจะใช้เพื่อการป้องกัน ไม่ใช่เพื่อการโจมตีที่เป็นอันตราย" ขณะเดียวกัน RL ยังเทรนต่อ จึงทำให้โมเดลบน API เปลี่ยนไปเรื่อย ๆ
  3. 27 ตุลาคม: มีกำหนดปล่อยน้ำหนักโมเดล พร้อมรายละเอียดสถาปัตยกรรมฉบับเต็ม เบนช์มาร์กเพิ่มเติม และวิธีการหลังการเทรนของ Mistral

ส่วนนี้จะอัปเดตเมื่อปล่อยน้ำหนักโมเดล

สิ่งที่เรายังไม่รู้เกี่ยวกับ Mistral Large 4

ก่อนหน้านั้น ยังมีหลายเรื่องเปิดอยู่ เขียนในวันเปิดตัว จึงมีรายการยาว:

  • ประสิทธิภาพเบนช์มาร์กสุดท้าย: RL ยังรันอยู่ ทุกคะแนนด้านบนอาจเปลี่ยน Mistral คาดว่า "จะดีขึ้นมากและรวดเร็ว" แต่ยังไม่มีใครวัด
  • ผลอิสระด้านโค้ด วิสัยทัศน์ และงานความรู้: นอกเหนือจาก AA Cyber Index และ vals.ai ยังไม่มีใครทำซ้ำ
  • ราคา: ประกาศกับหน้าเอกสารให้ข้อมูลไม่ตรงกัน และอัตราช่วงพรีวิวอาจไม่ถูกใช้ต่อ
  • เงื่อนไขสิทธิ์อนุญาต: สร้างผลิตภัณฑ์บนคำว่า "open-weight" อย่างเดียวไม่ได้
  • ข้อกำหนดฮาร์ดแวร์สำหรับโฮสต์เอง: ยังไม่เผย
  • สถาปัตยกรรมฉบับเต็ม: สัญญาว่าจะมาพร้อมน้ำหนักโมเดล ซึ่งอาจอธิบายความคลาดเคลื่อน 49B เทียบ 52B ได้ด้วย
  • หน้าต่างบริบท: 1M โทเค็นตามเอกสารของ Mistral 512K ตาม vals.ai
  • การประเมินความปลอดภัยขั้นสุดท้าย: การทำ red-team ดำเนินตลอดเดือนตุลาคม

บทสรุป

Mistral Large 4 เป็นโมเดลสปาร์สที่มีพารามิเตอร์ 1 ล้านล้าน พารามิเตอร์ทำงาน 49 พันล้าน อินพุตมัลติโมดัล และกำลังจะเปิดน้ำหนักโมเดล ในวันเปิดตัว เห็นว่าเป็นโมเดล open-weight ที่ดีที่สุดบนเบนช์มาร์กกฎหมายของ Harvey แต่ติดอันดับ 32 จาก 44 บน Vals Index และตามหลัง Kimi K3 บนชาร์ตโค้ดของ Mistral เอง

แต่เชื่อว่า Mistral ไม่ได้เดิมพันกับการเป็นผู้นำเบนช์มาร์กอยู่แล้ว เดิมพันจริงคือ open weights ที่มีศักยภาพและการโฮสต์เองคือสิ่งที่องค์กรและรัฐบาลให้ความสำคัญที่สุด ข้อมูลการปฏิเสธด้านความปลอดภัยไซเบอร์คือหลักฐานที่ชัดเจนที่สุดจนถึงตอนนี้ว่าชุดนี้แก้ปัญหาที่ทีมความปลอดภัยเผชิญอยู่แล้ว

27 ตุลาคมคือวันที่ต้องจับตา ตอนนั้นจะปล่อยน้ำหนักโมเดล นักวิจัยอิสระจะได้รันเช็คพอยต์สุดท้ายเอง และ Artificial Analysis กับ vals.ai จะได้ทดสอบโมเดลที่ Mistral ปล่อยจริง แทนพรีวิวที่ยังเทรนอยู่ Le Chonk จะสมคำเปิดตัวหรือไม่ก็ตอนนั้น

สำหรับพื้นฐานแนวคิดเบื้องหลังโมเดล MoE คอร์ส Introduction to Large Language Models ของเราครอบคลุมพื้นฐาน สำหรับข้อมูลเพิ่มเติมเกี่ยวกับผลิตภัณฑ์ของ Mistral ดูบทความเกี่ยวกับ Mistral Forge, Mistral Large 3, Mistral Le Chat และ Mistral Vibe 2.0 เอเจนต์เขียนโค้ดแบบเทอร์มินัล

FAQs

Mistral Large 4 (Le Chonk) คืออะไร?

นี่คือเรือธงรุ่นใหม่ของ Mistral เปิดพรีวิวสาธารณะเมื่อ 6 ตุลาคม 2026: โมเดล Mixture-of-Experts ที่มีพารามิเตอร์รวมราว 1 ล้านล้าน และพารามิเตอร์ทำงานต่อโทเค็น 49 พันล้าน รับข้อความและภาพ สร้างผลลัพธ์เป็นข้อความ และมีแผนปล่อย open weights ในวันที่ 27 ตุลาคม

ทำไมถึงชื่อ Le Chonk?

เป็นการย้อนถึง "Le Chaton Fat" โมเดลสมมุติที่มีพารามิเตอร์ 24 ล้านล้านซึ่ง Mistral ล้อเล่นประกาศแล้วลบไปในเดือนมิถุนายน 2026 มุกดังกล่าวแพร่ในโซเชียลมีเดียสาย AI และเมื่อโมเดลระดับล้านล้านจริงมาถึง ชื่อก็ตามมา

Mistral Large 4 เด่นด้านใด?

ผลงานอิสระที่เด่นที่สุดคือด้านความปลอดภัยไซเบอร์และงานกฎหมาย ติดท็อปไฟว์จาก 18 โมเดลบน Artificial Analysis Cyber Index และอยู่อันดับหกจาก 75 บน Harvey's Legal Agent Benchmark อันดับหนึ่งในหมู่โมเดล open-weight (ทั้งสอง ณ วันที่ 6 ตุลาคม) บน Vals Index โดยรวมอยู่อันดับ 32 จาก 44 จึงสะท้อนว่าความแข็งแรงตามแนวดิ่งกับภาพรวมให้เรื่องราวต่างกัน

Mistral Large 4 เป็นโอเพ่นซอร์สหรือไม่?

ไม่ใช่ เป็น open-weight ซึ่งต่างออกไป open-weight หมายถึงพารามิเตอร์ของโมเดลถูกเปิดเผยต่อสาธารณะ แต่ไม่จำเป็นต้องรวมข้อมูลฝึก โค้ดฝึก หรือองค์ประกอบอื่น ๆ Mistral ยังไม่เผยเงื่อนไขสิทธิ์อนุญาต จึงควรตรวจสอบก่อนสร้างผลิตภัณฑ์บนโมเดลนี้

จะดาวน์โหลดน้ำหนักโมเดล Mistral Large 4 ได้เมื่อไร?

27 ตุลาคม 2026, ตามรายงานของ Axios API ใช้งานได้แล้วผ่าน Mistral Studio แต่ช่วงพรีวิวยังอยู่ในเฟส reinforcement learning จึงทำให้น้ำหนักที่ปล่อยจะต่างจากโมเดลที่ API ให้บริการวันนี้

หัวข้อ
ปัญญาประดิษฐ์

เรียนรู้กับ DataCamp

คอร์ส

ทำความเข้าใจปัญญาประดิษฐ์

2 ชม.
427.3K
เรียนรู้แนวคิดพื้นฐานของปัญญาประดิษฐ์ เช่น machine learning, deep learning, NLP, generative AI และอื่นๆ
ดูรายละเอียดRight Arrow
เริ่มคอร์ส

คอร์ส

แนวคิด LLMOps

1 ชม.
19.7K
เรียนรู้เกี่ยวกับ LLMOps ตั้งแต่แนวคิดจนถึงการนำไปใช้งาน เข้าใจวงจรชีวิตและความท้าทาย และเรียนรู้การประยุกต์ใช้แนวคิดเหล่านี้กับแอปพลิเคชันของคุณ
ดูเพิ่มเติมRight Arrow