मुख्य सामग्री पर जाएं

Mistral Large 4 (Le Chonk): अब तक जो कुछ पता है

Mistral का ट्रिलियन-पैरामीटर ओपन-वेट मॉडल साइबरसुरक्षा और कानूनी बेंचमार्क्स पर आगे है।
अपडेट किया गया 9 अक्टू॰ 2026  · 15 मि॰ पढ़ें

AI के साथ खोजें

ChatGPTClaudePerplexity

6 अक्टूबर, 2026 को Mistral ने Mistral Large 4 (ML4) का सार्वजनिक प्रीव्यू लॉन्च किया—यह 1 ट्रिलियन पैरामीटर वाला मॉडल है, जिसमें 49 बिलियन सक्रिय पैरामीटर, टेक्स्ट-और-इमेज इनपुट, और महीने के अंत तक ओपन वेट्स का वादा है। यह अब तक का Mistral का सबसे बड़ा मॉडल है, जिसे Mistral के यूरोपीय डेटा सेंटर्स में 3,800 Nvidia Grace Blackwell GPU पर शुरू से प्रशिक्षित किया गया।

पिछले साल के ज़्यादातर समय, सबसे मज़बूत ओपन-वेट मॉडल चीनी लैबों (GLM, DeepSeek, Kimi, Qwen) से आए, जबकि समग्र रूप से सबसे मज़बूत मॉडल US API के पीछे बंद रहे। Mistral तीसरी जगह चाहता है। उसके ऐलान के मुताबिक ML4 "पहले से ही वैश्विक स्तर पर सबसे मज़बूत ओपन-सोर्स मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन हासिल करता है, जबकि US या यूरोप में विकसित किसी भी ओपन-वेट मॉडल से काफी बेहतर है।"

तस्वीर लॉन्च पोस्ट से ज़्यादा उलझी हुई है। नीचे, मैं आर्किटेक्चर, बेंचमार्क (जहां स्वतंत्र रूप से दोहराया गया है और जहां नहीं), कोडिंग, विज़न, साइबरसुरक्षा, ओपन वेट्स, और जो अब भी अज्ञात है, सब कवर करता/करती हूँ। अगर आपके पास सिर्फ़ एक सेक्शन का समय है, तो साइबरसुरक्षा पढ़ें।

संक्षिप्त उत्तर

Mistral Large 4 (Le Chonk) 1-ट्रिलियन-पैरामीटर का ओपन-वेट मॉडल है, जिसे Mistral चीन के बाहर बना सबसे मज़बूत बताता है—खासकर साइबरसुरक्षा, वित्त, क़ानून, और विज़ुअल ग्राउंडिंग के लिए। स्वतंत्र मूल्यांकन साइबरसुरक्षा और क़ानूनी दावों का समर्थन करते हैं, वित्त को औसत के आसपास रखते हैं, और एक व्यापक समग्र इंडेक्स पर ML4 को 44 में 32वाँ रैंक देते हैं। API अभी लाइव है, और वेट्स 27 अक्टूबर को आने वाले हैं।

Mistral Large 4 (Le Chonk) क्या है?

यह छोटा संस्करण बहुत कुछ छोड़ देता है, तो मूल बातों से शुरू करें। ML4, Mistral का नया फ़्लैगशिप है और Mistral के शब्दों में उसका "अब तक का सबसे बड़ा और सबसे सक्षम मॉडल"। Le Chonk इसका उपनाम है, हालांकि Mistral के लॉन्च कॉपी में सामान्य क्रम उलटा है: "अनौपचारिक रूप से ML4, बहुत आधिकारिक तौर पर: le Chonk."

यह एक नैटिव मल्टीमॉडल Mixture-of-Experts (MoE) मॉडल है। शीर्ष आँकड़े हैं—1 ट्रिलियन कुल पैरामीटर और प्रति टोकन 49 बिलियन सक्रिय, हालांकि Mistral के अपने मॉडल डॉक कुछ अलग संख्या देते हैं (1.05T कुल, 52B सक्रिय)। किसी भी स्रोत ने यह अंतर नहीं समझाया। ("सक्रिय" क्यों महत्वपूर्ण है, अगला सेक्शन कवर करता है।)

Mistral, ML4 को एंटरप्राइज कार्यों पर लक्षित कर रहा है: कोडिंग, साइबरसुरक्षा, वित्त, क़ानून, विनिर्माण और इंजीनियरिंग, और तकनीकी ड्रॉइंग या सैटेलाइट इमेजरी पढ़ने जैसे विज़ुअल कार्य।

विनिर्देश

विवरण

कुल पैरामीटर

घोषणा के अनुसार 1 ट्रिलियन , डॉक के अनुसार 1.05T

सक्रिय पैरामीटर

घोषणा के अनुसार 49B , डॉक के अनुसार 52B

आर्किटेक्चर

Mixture-of-Experts, हाइब्रिड इंस्ट्रक्ट और रीजनिंग

इनपुट

टेक्स्ट और इमेज

आउटपुट

सिर्फ़ टेक्स्ट

कॉन्टेक्स्ट विंडो

डॉक के अनुसार 1M टोकन , vals.ai के अनुसार 512K (असुलझा)

किसी भी डिप्लॉयमेंट की योजना बनाने वालों के लिए दो पंक्तियाँ सबसे महत्वपूर्ण हैं, और दोनों ही अनिश्चित हैं: कॉन्टेक्स्ट विंडो और लाइसेंस। मॉडल कैसे काम करता है, उसमें जाने से पहले, नाम का एक छोटा सा स्पष्टीकरण बनता है।

इसे Le Chonk क्यों कहा जाता है?

जून 2026 में, Mistral ने "Le Chaton Fat"—एक काल्पनिक 24-ट्रिलियन-पैरामीटर मॉडल—का व्यंग्यात्मक ऐलान पोस्ट किया और फिर हटा दिया। इंटरनेट चलता रहा और स्पेक्स सैकड़ों ट्रिलियन तक फुला दिए गए। चार महीने बाद Mistral ने एक वास्तविक ट्रिलियन-पैरामीटर मॉडल शिप किया, और नाम अपने आप तय हो गया। बस इतनी ही कहानी। अब मॉडल पर लौटते हैं।

Mistral Large 4 कैसे काम करता है

Mistral ने अभी पूर्ण आर्किटेक्चरल विवरण प्रकाशित नहीं किए हैं (वे वेट्स के साथ आने का वादा है), इसलिए यह सेक्शन सिर्फ़ वही कवर करता है जो बताया गया है।

1 ट्रिलियन पैरामीटर, 49 बिलियन सक्रिय

1-ट्रिलियन-पैरामीटर मॉडल हर टोकन पर सभी 1 ट्रिलियन पैरामीटर नहीं चलाता। MoE मॉडल हर टोकन को चुनिंदा "एक्सपर्ट" सब-नेटवर्क के छोटे समूह से रूट करते हैं, इसलिए इन्फेरेंस कंप्यूट 49 बिलियन सक्रिय पैरामीटर के अनुसार ट्रैक करता है। इससे यह ~50B-पैरामीटर डेंस मॉडल के क़रीब बैठता है, 1T के नहीं।

क्या इसे सर्व करना सस्ता है? नहीं। सभी 1 ट्रिलियन पैरामीटरों को कहीं मेमोरी में रहना ही पड़ता है, तो ML4 को स्वयं-होस्ट करने के लिए गंभीर मल्टी-GPU इन्फ्रास्ट्रक्चर चाहिए। MoE मॉडल्स को उतने ही सक्रिय पैरामीटर वाले डेंस मॉडल्स की तुलना में कम लेटेंसी पर सर्व करना भी कठिन होता है। Mistral ने हार्डवेयर आवश्यकताएँ प्रकाशित नहीं की हैं, और मुझे आश्चर्य नहीं होगा अगर बड़े एंटरप्राइज और सरकारों के अलावा कम टीमें पूरा मॉडल स्वयं चलाएँ।

मल्टीमॉडल इनपुट

वे सक्रिय पैरामीटर सिर्फ़ टेक्स्ट नहीं संभालते। ML4 इमेज भी लेता है, हालांकि आउटपुट केवल टेक्स्ट देता है। Mistral कहता है कि यह "जटिल दस्तावेज़ों, चार्ट्स, और नेचुरल इमेजेस पर मज़बूती से तर्क करता है" और वह इंजीनियरिंग, विनिर्माण, और पृथ्वी अवलोकन जैसे उद्योगों को लक्षित कर रहा है जहाँ विज़ुअल परसेप्शन मायने रखता है। डेमो सभी औद्योगिक हैं: तकनीकी ड्रॉइंग्स में मैकेनिकल पार्ट्स का निरीक्षण, PDF से साक्ष्य निकालना, गीगापिक्सेल सैटेलाइट इमेज में कठिन-से-ढूँढ ऑब्जेक्ट्स स्कैन करना।

160+ भाषाएँ

इन्हीं औद्योगिक ग्राहकों का काम अक्सर सीमाओं के पार होता है, यहीं भाषा काम आती है। Mistral कहता है कि ट्रेनिंग डेटा का "महत्वपूर्ण हिस्सा" बहुभाषी था—160 से अधिक भाषाएँ और हर आधिकारिक EU भाषा शामिल। यूरोपीय सरकारों को रिझाने वाली यूरोपीय कंपनी के लिए यह बिक्री का बड़ा आधार है।

ट्रेनिंग इन्फ्रास्ट्रक्चर

यूरोपीय पिच में, ट्रेनिंग कहाँ हुई यह भी मायने रखता है। Mistral के अनुसार, ML4 3,800 Nvidia Grace Blackwell GPU पर शुरू से प्रशिक्षित किया गया, और वह भी अपने यूरोपीय डेटा सेंटर्स में। Mistral के VP ऑफ़ साइंस पियरे स्टॉक ने TechCrunch को 4,000 का गोल आंकड़ा दिया और कहा कि यह "हमारे चीनी प्रतिद्वंद्वियों से दो से तीन गुना कम है।" इस तुलना की किसी ने पुष्टि नहीं की है।

इसके पीछे का कंप्यूट बिल्डआउट काफ़ी समय से सार्वजनिक है। मार्च 2026 में, Mistral ने ऋण में $830 मिलियन जुटाए 13,800 Nvidia GB300 GPU ख़रीदने के लिए—पेरिस के पास एक डेटा सेंटर हेतु। Mistral यह नहीं कहता कि खास तौर पर वही क्लस्टर ML4 के लिए इस्तेमाल हुआ, इसलिए मैं दोनों को नहीं जोड़ता/जोड़ती।

एक विवरण इस लेख के हर बेंचमार्क को पढ़ने का तरीका बदल देता है। रिइनफ़ोर्समेंट लर्निंग (RL) रन अभी चल रहा है। RL वह पोस्ट-ट्रेनिंग चरण है जहाँ मॉडल अपनी ही कोशिशों पर स्कोर होकर सुधरता है, और Mistral कहता है कि इसका रन वर्तमान में लगभग 3,000 GPU इस्तेमाल करता है, रोज़ क़रीब 33 बिलियन टोकन जनरेट करता है, और "सैचुरेशन के कोई संकेत नहीं" दिख रहे। इसलिए आज API से आप जो मॉडल कॉल कर सकते हैं, वही वह मॉडल नहीं होगा जिसके वेट्स 27 अक्टूबर को शिप होंगे।

Mistral Large 4 बेंचमार्क

चल रहे RL रन के कारण इस सेक्शन की हर बात को प्रारंभिक मानें। दूसरा कारण: Mistral की ज़्यादातर संख्याएँ स्वतंत्र रूप से दोहराई नहीं गईं, और जहाँ हुईं भी, वे हमेशा मेल नहीं खातीं।

लॉन्च पर स्वतंत्र मूल्यांकन तीन हिस्सों में बँटता है:

  • स्वतंत्र रूप से दोहराया गया: Artificial Analysis (AA) Cyber Index, जिसमें उसका CyberGym-E2E कंपोनेंट शामिल है, और पाँच vals.ai मूल्यांकन, जिनमें Terminal-Bench 4.0 शामिल है।
  • AA द्वारा चलाया गया, पर अभी सार्वजनिक नहीं: Mistral के कोडिंग चार्ट्स के एक फुटनोट में कहा गया है कि DeepSWE, Terminal-Bench, और SWE-Atlas स्कोर "हर्नेस के सार्वजनिक लॉन्च से पहले Artificial Analysis द्वारा निजी तौर पर मूल्यांकित संख्याएँ" इस्तेमाल करते हैं। वे AA के Coding Agent Index पर तब दिखेंगी जब वह हर्नेस जारी होगा। तब तक, AA और Mistral के बाहर कोई उन्हें जाँच नहीं सकता।
  • सिर्फ़ Mistral: बाकी सब।

टेबल के आख़िरी कॉलम पर सबसे ज़्यादा ध्यान दें। कोई बेंचमार्क किसी स्वतंत्र समूह द्वारा बनाया जा सकता है, जबकि उस पर ML4 का स्कोर अब भी सिर्फ़ Mistral का दावा हो।

बेंचमार्क सारांश

बेंचमार्क

ML4 परिणाम

प्रतिद्वंद्वी

क्या मापता है

DeepSWE v1.1

61.7%, AA द्वारा निजी रूप से चलाया गया

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (स्व-रिपोर्टेड)

लंबी-अवधि का सॉफ्टवेयर इंजीनियरिंग

Terminal-Bench 4.0

Mistral के अनुसार 28.3% , vals.ai के अनुसार 22.73%

vals.ai पर 44 में 20वाँ

जटिल टर्मिनल वर्कफ़्लो

SWE-Atlas-QnA

59.4%, AA द्वारा निजी रूप से चलाया गया

प्रकाशित नहीं

रिपॉज़िटरी समझ

Coding Agent Index

49.8%, AA द्वारा निजी रूप से चलाया गया

DeepSeek V4 Pro 0813 और Qwen3.8 Max से आगे

ऊपर दिए तीन कोडिंग बेंचमार्क्स का समग्र

AutomationBench

Mistral के अनुसार 59.9%

Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro से आगे

Gmail, Slack, और Salesforce जैसे ऐप्स में 657 बिज़नेस वर्कफ़्लो

AA-Briefcase

1,393 Elo, Mistral द्वारा AA के रूप में उद्धृत

DeepSeek V4 Pro से आगे

लंबी-अवधि का नॉलेज वर्क

Dense 200

Mistral के अनुसार 42%

GPT-6 Astra 41%

विज़ुअल ग्राउंडिंग

AA Cyber Index

50%, 18 में शीर्ष 5

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

वास्तविक सॉफ़्टवेयर में खामियाँ ढूँढना और ठीक करना

CyberGym-E2E

82%, 18 में #1

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

वास्तविक भेद्यता को पुन:उत्पादित करना और पैच करना

Cybench

Mistral के अनुसार 93%

Mistral के अनुसार ओपन वेट्स में "सबसे ऊँचे में से एक"

40 सुरक्षा प्रतियोगिता चुनौतियाँ

Finance Agent v2

54.68%

75 में 22वाँ, 32 ओपन-वेट में 7वाँ

वित्तीय एजेंट कार्य

Harvey's Legal Agent

15.83%, 75 में #6

31 ओपन-वेट में #1

स्वायत्त कानूनी कार्य

KORA Benchmark

Mistral के अनुसार 2 में 1.691

Mistral द्वारा जाँचे गए ओपन मॉडलों में सर्वोच्च

उत्तरदायी AI व्यवहार

B3 Attack Resistance

Mistral के अनुसार 93.3%

Mistral के अनुसार "प्रतिद्वंद्वियों में इससे ऊँचे स्कोर नहीं"

प्रॉम्प्ट इंजेक्शन रेज़िस्टेंस

Vals Index

48.05%, 44 में 32वाँ

16 ओपन-वेट में 9वाँ

कार्य-समूहों में व्यापक समग्र

Mistral 4 बेंचमार्क रैंकिंग

Mistral के हेडलाइन दावे के साथ आख़िरी पंक्ति पढ़ें। vals.ai के व्यापक इंडेक्स पर, ML4 कुल मिलाकर 44 में 32वाँ और केवल ओपन-वेट मॉडलों में 16 में 9वाँ आता है। कम से कम समग्र पैमाने पर इसे "वैश्विक स्तर के सबसे मज़बूत ओपन-सोर्स मॉडलों के बराबर" कहना कठिन है। Mistral के वर्टिकल परिणाम काफ़ी बेहतर दिखते हैं—और वे ग़लत नहीं—बस वे दायरे में संकरे हैं। अगर आप ML4 पर निर्माण का फ़ैसला कर रहे हैं, तो आपके लिए प्रासंगिक वर्टिकल दोनों हेडलाइन से ज़्यादा महत्वपूर्ण है।

कोडिंग

कोडिंग में हेडलाइन और विवरण का गैप सबसे पहले दिखता है। ऊपर-ऊपर Mistral की संख्याएँ अच्छी लगती हैं। मगर उसके DeepSWE चार्ट को देखें—टेक्स्ट कभी नहीं बताता कि सबसे ऊँची बार Kimi K3 की है, 69% पर, ML4 से सात अंक आगे। ML4, GLM-5.3 को थोड़ा सा पीछे छोड़ता है (62% बनाम 61%), पर एक अंक हर्नेस पसंद की शोर सीमा में है। "हर्नेस" वह ढांचा है जो किसी एजेंटिक बेंचमार्क के दौरान मॉडल को लपेटता है—टूल्स, प्रॉम्प्ट्स, और प्रयासों की संख्या। Mistral के चार्ट पर हर प्रतिद्वंद्वी अलग हर्नेस में चला। Datacurve के अपने लाइव DeepSWE लीडरबोर्ड पर, जो हर मॉडल को समान सेटअप में चलाता है, GLM-5.3 और Kimi K3 दोनों 69% तक पहुँचते हैं और DeepSeek V4 Pro 63% तक। ML4 अभी सूचीबद्ध नहीं है।

Terminal-Bench उल्टी दिशा से वही प्रभाव दिखाता है। Mistral 28.3% बताता है, vals.ai के स्वतंत्र रन में 22.73% आया। मैं इसे किसी के आंकड़े फुलाने के रूप में नहीं पढ़ता—बस याद दिलाता है कि एक सेटअप से एक संख्या कोई रैंकिंग नहीं बनाती।

मानव मूल्यांकन ज़्यादा रोचक हैं। Surge AI से Mistral ने एक ब्लाइंड मूल्यांकन कराया, जिसमें पेशेवर एनोटेटर्स ने कोडिंग आउटपुट को 1 से 5 तक रेट किया। ML4 पाँच में दूसरे स्थान पर रहा (3.74)—GLM-5.3 (3.60), Kimi K3 (3.59), और GLM-5.2 (3.40) से आगे—और Claude Opus 5 (4.22) से काफ़ी पीछे। ध्यान दें: Kimi K3—DeepSWE पर ML4 से सात अंक आगे—मानव पसंद में पीछे। टेस्ट पास करना और ऐसा कोड लिखना जिसे लोग पढ़ना पसंद करें, अलग कौशल हैं। (और यह Opus 5 है, नया 5.5 नहीं, तो सर्वश्रेष्ठ क्लोज़्ड मॉडल से गैप शायद और चौड़ा है।)

Mistral के दूसरे, आंतरिक मूल्यांकन ने तस्वीर और धुँधली कर दी। इसमें पाया गया कि कोडिंग और वित्त में ML4 GLM-5.3 के "बराबर या क़रीब" है, और केवल CAD और STEM में वरीय है। मैं दोनों को लगभग बराबर कहूँगा/कहूँगी।

वित्त

वित्त सरल है, मुख्यतः क्योंकि एक स्वतंत्र संख्या इसे आधार देती है। ML4 Finance Agent v2 पर 54.68% स्कोर करता है, जो इसे कुल 75 में 22वाँ और ओपन-वेट 32 में 7वाँ रैंक देता है। ठोस मिड-पैक। Mistral का वास्तविक दावा और संकरा है: कि ML4 इस बेंचमार्क पर GPT-6 Astra को पछाड़ता है।

Mistral FinWorkBench पर भी मज़बूत परिणाम रिपोर्ट करता है, जो जाँचता है कि मॉडल वास्तविक वित्त और अकाउंटिंग कार्यों के लिए स्प्रेडशीट बना और संपादित कर सकता है या नहीं। ये संख्याएँ Mistral के चार्ट्स से आती हैं और अन्यत्र दोहराई नहीं गई हैं।

क़ानून

क़ानून काग़ज़ पर काफ़ी बेहतर दिखता है। Harvey's Legal Agent Benchmark पर, ML4 75 में 6वाँ और 31 ओपन-वेट मॉडलों में पहले स्थान पर है। इसका स्कोर 15.83% है।

इस संख्या को दो बार पढ़ें। स्वायत्त कानूनी कार्य में दुनिया में छठा स्थान पाने का मतलब है लगभग हर छह में एक कार्य पूरा करना। बेंचमार्क कठिन है और रैंकिंग असली, पर इसे "ML4 बिना निगरानी के कानूनी काम कर सकता है" के रूप में न लें। अभी कोई मॉडल नहीं कर सकता।

विज़न और विज़ुअल ग्राउंडिंग

विज़न में उलटा मामला है—तेज़ दावे, अभी स्वतंत्र डेटा नहीं। हेडलाइन दावा विज़ुअल ग्राउंडिंग पर है, जिसका मतलब है टेक्स्ट विवरण से इमेज में विशिष्ट ऑब्जेक्ट/क्षेत्र का पता लगाना—जैसे "इस ड्रॉइंग में टूटी वेल्ड खोजो" बजाय "इस तस्वीर का वर्णन करो"। Mistral Dense 200 पर 42% रिपोर्ट करता है, GPT-6 Astra के 41% से थोड़ा आगे। एक अंक पर खरीद फ़ैसला न टाँगें।

Mistral कहता है कि ML4 ChartQA Pro और GDP.pdf—एक डॉक्यूमेंट-रीज़निंग बेंचमार्क—पर भी अच्छा करता है। किसी भी विज़न परिणाम को अभी स्वतंत्र रूप से दोहराया नहीं गया है। जिन यूज़ केसों को Mistral उजागर करता है वे ज़्यादातर औद्योगिक हैं—आपदा प्रतिक्रिया हेतु सैटेलाइट इमेजरी से लेकर तकनीकी ड्रॉइंग का निरीक्षण और बड़े जियोस्पैटियल इमेज स्कैन करना।

कोडिंग के लिए Mistral Large 4 कितना अच्छा है?

वापस कोडिंग पर—क्योंकि ज़्यादातर पाठक ML4 को इसी के लिए इस्तेमाल करेंगे। यह ओपन-वेट मॉडलों में प्रतिस्पर्धी है, पर उपलब्ध सबसे अच्छा कोडिंग मॉडल नहीं, और Mistral के अपने चार्ट पर भी सबसे अच्छा ओपन नहीं। संख्याएँ दोहराऊँगा/दोहऱाऊँगी नहीं। वे आपके काम पर यूँ उतरती हैं:

  • वास्तविक कोडबेस में मुद्दे ठीक करना (एजेंटिक सॉफ़्टवेयर इंजीनियरिंग): इस्तेमाल योग्य, पर Kimi K3 ज़्यादा मज़बूत दिखता है।
  • बड़ी रिपॉज़िटरी समझना: आशाजनक, हालांकि यह एक निजी रूप से चलाए गए स्कोर पर टिका है।
  • लंबी, कई घंटों की एजेंट रन: Mistral का RL सेटअप लंबी ट्रैजेक्टरी के लिए बना है, पर किसी ने इसे स्वतंत्र रूप से नहीं परखा।
  • टर्मिनल-प्रधान काम: अब तक का सबसे कमजोर स्वतंत्र संकेत।

मैं AA के सार्वजनिक Coding Agent Index पर ML4 की एंट्री (वेट्स शिप होने के बाद अपेक्षित) का इंतज़ार करूँगा/करूँगी, इससे पहले कि इसे एक विश्वसनीय ओपन-वेट विकल्प से ज़्यादा कहूँ।

यहाँ ओपन वेट्स का फ़ायदा स्कोर से संबंधित नहीं है। कोई कंपनी ML4 को अपने इन्फ्रास्ट्रक्चर पर चलाकर स्वामित्व वाले सोर्स कोड को बाहर की API पर कभी न भेजे—कोडिंग एजेंट्स के लिए गोपनीय कोडबेस पर यह बात अपने आप में निर्णायक हो सकती है।

साइबरसुरक्षा के लिए Mistral Large 4

यह Mistral का सबसे बोल्ड दावा है। पर Artificial Analysis Cyber Index—AA का स्वतंत्र मूल्यांकन कि मॉडल वास्तविक सॉफ़्टवेयर में कमजोरियाँ कितनी अच्छी तरह ढूँढते, पुन:उत्पादित करते, और पैच करते हैं—ML4 50% स्कोर करता है। यह 18 मॉडलों में शीर्ष पाँच में आता है। सिर्फ़ Grok 4.7, MiMo-V2.6-Pro, और GPT-6 Luna इससे ऊपर हैं, और GLM-5.3 Flash इसके बराबर है। Mistral कहता है कि ML4 "चीन के बाहर विकसित ओपन-वेट मॉडलों में बड़े अंतर से आगे है," और AA का चार्ट इससे संगत है।

सबसे अलग नज़र आता है CyberGym-E2E—इंडेक्स के तीन घटकों में से एक। यह मॉडल से कहता है कि खुले-स्रोत सॉफ़्टवेयर में वास्तविक भेद्यता ("CVE," यानी सार्वजनिक रूप से सूचीबद्ध सुरक्षा खामी) को पुन:उत्पादित करे और फिर पैच करे। ML4 82% स्कोर करता है—AA द्वारा जाँचे 18 मॉडलों में पहला। Mistral Cybench पर 93% भी रिपोर्ट करता है—40 सुरक्षा प्रतियोगिता चुनौतियों का सेट—हालाँकि इसे किसी ने दोहराया नहीं है।

रिफ़्यूज़ल डेटा भी दिलचस्प है। CyberGym-E2E पर, AA का चार्ट दिखाता है कि Claude Opus 5.5 लगभग 96% कार्यों पर सेफ़्टी के आधार पर ब्लॉक हो गया, और GPT-6 Astra 100% पर। वे मॉडल कार्य अस्वीकार होने के कारण लगभग शून्य स्कोर करते हैं, तो उनके स्कोर यह नहीं बताते कि वे वास्तव में क्या कर सकते थे। अस्वीकार करना सही नीति है या नहीं—यह अलग बहस है।

और यही Mistral की कोर पिच है। डिफेंसिव सिक्योरिटी का काम अक्सर किसी खामी को दोहराने से शुरू होता है ताकि उसके अस्तित्व का सबूत मिले, और सिक्योरिटी टीमें यह बड़े पैमाने पर करती हैं—बड़े कोडबेस स्कैन करना और सैकड़ों फ़ाइंडिंग्स की ट्रायेज करना। कोई ऐसा मॉडल जो इस वर्कलोड के ज़्यादातर हिस्से को रिफ़्यूज़ करे, या जिसका प्रोवाइडर घटना के बीच में मॉडरेशन नियम बदल दे—वह दायित्व बनता है। Mistral का कहा हुआ तर्क है कि अपने इन्फ्रास्ट्रक्चर पर ML4 चलाने से उसका व्यवहार आपके नियंत्रण में रहता है। वैध डिफेंसिव काम को AI सेफ़गार्ड्स द्वारा ब्लॉक किए जाने पर व्यापक बहस काफी समय से चल रही है।

अब बुरा पक्ष: एक बार वेट्स सार्वजनिक होने के बाद, हमलावरों को भी वही क्षमता मिलती है। AA का इंडेक्स जानबूझकर डिफेंसिव है (मॉडल सोर्स कोड से काम करते हैं और कभी वर्किंग एक्सप्लॉइट बनाने को नहीं कहा जाता), इसलिए 82% पुनरुत्पादन स्कोर 82% आक्रामक क्षमता नहीं होता। फिर भी, "क्रैश दोहराओ" से "इसे हथियार बनाओ" तक की दूरी अनंत नहीं है। Mistral रिलीज़ से पहले तीन हफ्ते मॉडल को रेड-टीमिंग में लगा रहा है—मतलब जान-बूझकर गलत बर्ताव कराने की कोशिश—"साइबरसुरक्षा नेताओं, जाँचे-परखे पार्टनर्स, और राज्य प्राधिकरणों" के साथ।

Mistral Large 4 के लिए ओपन वेट्स क्यों मायने रखते हैं

साइबरसुरक्षा का मामला दरअसल ओपन वेट्स के पक्ष में तर्क है—और यह सुरक्षा से कहीं आगे तक पहुँचता है। "आप मॉडल डाउनलोड कर सकते हैं"—यह इसे कम आँकता है।

एक बैंक जो ML4 को अपने सर्वरों पर चलाता है, वह कभी भी ग्राहक डेटा Mistral को नहीं भेजता। कोई सरकारी एजेंसी पूरे डिप्लॉयमेंट परिवेश को नियंत्रित करती है। सिक्योरिटी टीम प्रोवाइडर की मॉडरेशन नीति का इंतज़ार किए बिना मॉडल के व्यवहार को समायोजित कर सकती है—जो पिछले सेक्शन के बाद कोई काल्पनिक चिंता नहीं रही। और अगर कोई प्रोवाइडर डाउन हो जाए या मॉडल संस्करण रिटायर कर दे, तो स्वयं-होस्टेड डिप्लॉयमेंट चलते रहते हैं।

ओपन वेट्स कस्टमाइज़ेशन को भी व्यावहारिक बनाते हैं। मैंने Mistral Forge को अप्रैल में कवर किया था, और Mistral कहता है कि ML4 "वही ट्रेनिंग, कस्टमाइज़ेशन, और RL वातावरण उपयोग करता है" जो वह Forge के माध्यम से एंटरप्राइज ग्राहकों को देता है। जो संगठन ML4 को अपने डेटा पर फ़ाइन-ट्यून करना चाहते हैं, उनके लिए Forge स्पष्ट मार्ग है।

शब्दावली पर एक त्वरित बात। ओपन-वेट का मतलब है कि प्रशिक्षित मॉडल पैरामीटर सार्वजनिक रूप से उपलब्ध हैं। इसका मतलब यह नहीं कि ट्रेनिंग डेटा, ट्रेनिंग कोड या अन्य कुछ भी ओपन-सोर्स लाइसेंस के तहत जारी किया गया है। Mistral के मॉडल पेज में ML4 को ओपन-वेट बताया गया है, पर लाइसेंस शर्तें प्रकाशित नहीं हैं। जब तक वे नहीं आतीं, व्यावसायिक उपयोग, फ़ाइन-ट्यूनिंग अधिकार, और पुनर्वितरण सभी खुले प्रश्न हैं। नियंत्रण पर टिका मॉडल लिखते हुए "लाइसेंस जाँचें" कहना थोड़ा खीझ पैदा करता है, पर स्थिति यही है।

Mistral Large 4 और यूरोप की AI संप्रभुता पहल

नियंत्रण Mistral की राजनीतिक पिच के केंद्र में भी है। फ्रांस के राष्ट्रपति मैक्रों ने Mistral के दृष्टिकोण को "AI में तीसरा रास्ता" बताया है। पहले दो रास्ते हैं—US के क्लोज़्ड मॉडल (सक्षम, पर अमेरिकी क़ानून और प्रोवाइडर नीति के अधीन) और चीन के ओपन मॉडल (अक्सर सक्षम, पर यूरोपीय संस्थानों के लिए डेटा रेज़िडेंसी और भू-राजनीतिक चिंता)। Mistral का ऑफ़र है—ओपन वेट्स, यूरोपीय इन्फ्रास्ट्रक्चर, और यूरोपीय क़ानून।

इसमें एक यूरोपीय डिप्लॉयमेंट शामिल है, जिसे Mistral कहता है कि वह "एंड-टू-एंड, अन्य डिजिटल सेवा प्रदाताओं से स्वतंत्र रूप से और यूरोपीय क़ानून के तहत" संचालित करता है। अगर आप GDPR या सेक्टर डेटा रेज़िडेंसी नियमों के अधीन हैं, तो इस दावे को Mistral के डेटा प्रोसेसिंग एग्रीमेंट्स के साथ जाँचें, फिर भरोसा करें।

Mistral के पास इस पिच का बैकअप देने के लिए धन भी है। Mistral ML4 को "हमारी €3 बिलियन सीरीज़ D से वित्तपोषित रोडमैप का पहला माइलस्टोन" कहता है—Samsung के नेतृत्व में €21 बिलियन वैल्यूएशन पर, जिसे Mistral यूरोप की अब तक की सबसे बड़ी इक्विटी राउंड बताता है। इसका अधिकांश भाग यूरोपीय डेटा सेंटर क्षमता में जा रहा है।

तो क्या यूरोप ऐसे फ़्रंटियर-स्तरीय मॉडल बना सकता है जो संगठनों को इस बात पर ज़्यादा नियंत्रण दे कि वे मॉडल कहाँ और कैसे चलते हैं? नियंत्रण वाले आधे हिस्से के लिए ML4 मज़बूत डेटा पॉइंट है। फ़्रंटियर वाले आधे के लिए, Vals Index पर 44 में 32वाँ बताता है कि यूरोप अभी वहाँ नहीं पहुँचा।

Mistral Large 4 बनाम अन्य ओपन-वेट मॉडल

अगर यूरोप अभी वहाँ नहीं है, तो यह पूछना उचित है कि कौन है—और ML4 उनसे कैसे तुलना करता है। मैं सब मॉडलों के स्कोर एक ही टेबल में नहीं रख रहा/रही, क्योंकि वे अलग सेटअप से आते हैं और एक संयुक्त टेबल उनके तुलनीय होने का संकेत देगा। पैरामीटर गिनती क्षमता का प्रॉक्सी भी नहीं है। नीचे की टेबल सिर्फ़ हर एक की स्थिति रखती है:

मॉडल

आर्किटेक्चर

वेट्स उपलब्ध

ताकत

उत्पत्ति

Mistral Large 4

MoE, 1T कुल / 49B सक्रिय

27 अक्टूबर (योजना)

साइबरसुरक्षा, क़ानून (स्वतंत्र रूप से समर्थित)

फ़्रांस

GLM-5.3

प्रकाशित नहीं

हाँ

कोडिंग, STEM

चीन

DeepSeek V4 Pro

MoE

हाँ

कोडिंग, गणित

चीन

Reflection Beam

प्रकाशित नहीं

हाँ

सामान्य तर्क

US

Qwen3.8 Max

प्रकाशित नहीं

पुष्ट नहीं

बहुभाषी, कोडिंग

चीन

Mistral Large 4 बनाम GLM-5.3

यह तुलना सबसे महत्वपूर्ण है, क्योंकि GLM-5.3 चीनी ओपन मॉडलों में सबसे मज़बूत में से है। कोडिंग सेक्शन में बताया गया—Mistral के चार्ट पर वे एक अंक के फ़र्क पर हैं, मानव मूल्यांकन बँटते हैं, और लाइव लीडरबोर्ड पर GLM-5.3 69% पर है जहाँ ML4 का अभी परीक्षण नहीं हुआ। जब तक दोनों स्वतंत्र लीडरबोर्ड पर साथ नहीं आते, इसे ड्रॉ मानें।

Mistral Large 4 बनाम DeepSeek V4 Pro

ML4, Mistral द्वारा प्रकाशित हर तुलना (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase) में आगे दिखता है, पर कोई भी स्वतंत्र रूप से पुष्ट नहीं है, और DeepSeek V4 Pro लाइव DeepSWE लीडरबोर्ड पर 63% तक पहुँचता है—ML4 के 62% से ऊपर। वित्त पर कोई प्रकाशित आमने-सामने नहीं।

Mistral Large 4 बनाम Reflection Beam

Reflection Beam दूसरा प्रमुख पाश्चात्य ओपन-वेट दावेदार है—जो Mistral के "चीन के बाहर सर्वश्रेष्ठ" दावे की सीधी क़सौटी बनता है। डेटा पतला है। Mistral के DeepSWE चार्ट में Beam 44% पर है—ML4 से लगभग 18 अंक नीचे—पर वह स्व-रिपोर्टेड संख्या है, जिसे AA-चलाए स्कोर के साथ रख दिया गया, इसलिए मैं इस गैप पर नहीं टिकूँगा/टिकूँगी। Reflection ने Beam का आकार प्रकाशित नहीं किया, तो स्केल तुलना भी संभव नहीं। ML4 के पास व्यापक मल्टीमॉडल इनपुट और कहीं ज़्यादा मज़बूत प्रकाशित साइबरसुरक्षा साक्ष्य हैं।

Mistral Large 4 कब इस्तेमाल कर सकते हैं?

इन तुलनाओं के सुलझने का इंतज़ार किए बिना आप ख़ुद ML4 आज़मा सकते हैं। अब तक का रोलआउट:

  1. 6 अक्टूबर: सार्वजनिक प्रीव्यू शुरू। कोई भी mistral-large-4 को Mistral Studio के ज़रिए कॉल कर सकता है।
  2. प्रीव्यू के दौरान: साइबरसुरक्षा नेता, जाँचे-परखे पार्टनर्स, और राज्य प्राधिकरणों को रेड-टीमिंग के लिए "घटी हुई मॉडरेशन और विस्तारित साइबर क्षमता" वाला संस्करण मिलता है। पियरे स्टॉक ने TechCrunch को बताया कि Mistral "विश्वसनीय पार्टनर्स और सरकारों के साथ काम करेगा ताकि ओपन-सोर्स वेट्स का उपयोग डिफेंस के लिए हो सके, न कि दुर्भावनापूर्ण हमलों के लिए।" इसी बीच RL ट्रेनिंग जारी रहती है, तो API मॉडल बदलता रहता है।
  3. 27 अक्टूबर: वेट्स शिप होने तय हैं—पूर्ण आर्किटेक्चरल विवरण, और बेंचमार्क, तथा Mistral की पोस्ट-ट्रेनिंग कार्यप्रणाली के साथ।

वेट्स शिप होने पर मैं इस सेक्शन को अपडेट करूँगा/करूँगी।

Mistral Large 4 के बारे में अब भी क्या नहीं पता

तब तक, बहुत कुछ खुला है। मैं यह लॉन्च डे पर लिख रहा/रही हूँ, इसलिए सूची लंबी है:

  • अंतिम बेंचमार्क प्रदर्शन: RL अभी चल रहा है, तो ऊपर की हर स्कोर बदल सकता है। Mistral "बड़े और तेजी से सुधार" की उम्मीद करता है, पर किसी ने इसे मापा नहीं।
  • स्वतंत्र कोडिंग, विज़न, और नॉलेज-वर्क परिणाम: AA Cyber Index और vals.ai से आगे, कुछ भी दोहराया नहीं गया।
  • प्राइसिंग: ऐलान और डॉक पेज असहमत हैं, और प्रीव्यू रेट आगे चलेंगे यह तय नहीं।
  • लाइसेंस शर्तें: सिर्फ़ "ओपन-वेट" पर आप प्रोडक्ट नहीं बना सकते।
  • स्वयं-होस्टिंग के हार्डवेयर आवश्यकताएँ: प्रकाशित नहीं।
  • पूर्ण आर्किटेक्चर: वेट्स के साथ वादा—जो 49B बनाम 52B सक्रिय-पैरामीटर के अंतर को भी समझा सकता है।
  • कॉन्टेक्स्ट विंडो: Mistral के डॉक में 1M टोकन, vals.ai में 512K।
  • अंतिम सेफ़्टी मूल्यांकन: अक्टूबर भर रेड-टीमिंग।

निष्कर्ष

Mistral Large 4 एक 1-ट्रिलियन-पैरामीटर का स्पार्स मॉडल है—49 बिलियन सक्रिय पैरामीटर, मल्टीमॉडल इनपुट, और आने वाले ओपन वेट्स के साथ। लॉन्च डे पर हम देखते हैं कि यह Harvey के लीगल बेंचमार्क पर सर्वश्रेष्ठ ओपन-वेट मॉडल है, फिर भी Vals Index पर 44 में 32वाँ और Mistral के अपने कोडिंग चार्ट पर Kimi K3 के पीछे।

मुझे नहीं लगता कि बेंचमार्क लीडरशिप Mistral की असली बाज़ी है। दाँव यह है कि सक्षम ओपन वेट्स और स्वयं-होस्टिंग—यही एंटरप्राइज़ और सरकारें सबसे ज़्यादा चाहती हैं। साइबरसुरक्षा रिफ़्यूज़ल डेटा अब तक का सबसे स्पष्ट प्रमाण है कि यह पैकेज उस समस्या को हल करता है जो सुरक्षा टीमों के पास पहले से है।

27 अक्टूबर देखने लायक तारीख है। तब वेट्स शिप होंगे, स्वतंत्र शोधकर्ता स्वयं अंतिम चेकपॉइंट चलाएँगे, और Artificial Analysis तथा vals.ai वह मॉडल टेस्ट कर सकेंगे जो Mistral वास्तव में रिलीज़ करेगा—न कि वह प्रीव्यू जो अब भी ट्रेनिंग में है। Le Chonk तब अपने लॉन्च पोस्ट पर खरा उतरेगा—या नहीं।

MoE मॉडलों के पीछे की अवधारणाओं की पृष्ठभूमि के लिए, हमारा Introduction to Large Language Models कोर्स मूल बातें कवर करता है। Mistral के प्रोडक्ट्स पर और जानकारी के लिए, हमारा कवरेज देखें— Mistral Forge, Mistral Large 3, Mistral Le Chat, और Mistral Vibe 2.0—इसका टर्मिनल-आधारित कोडिंग एजेंट।


Oluseye Jeremiah's photo
Author
Oluseye Jeremiah
LinkedIn

एआई, एमएल और डेटा साइंस में विशेषज्ञ तकनीकी लेखक, जो जटिल विचारों को स्पष्ट और सुगम बनाते हैं।

FAQs

Mistral Large 4 (Le Chonk) क्या है?

यह Mistral का नया फ़्लैगशिप है, जिसका सार्वजनिक प्रीव्यू 6 अक्टूबर, 2026 को लॉन्च हुआ: लगभग 1 ट्रिलियन कुल पैरामीटर और प्रति टोकन 49 बिलियन सक्रिय के साथ Mixture-of-Experts मॉडल। यह टेक्स्ट और इमेज लेता है, टेक्स्ट उत्पन्न करता है, और 27 अक्टूबर के लिए ओपन वेट्स नियोजित हैं।

इसे Le Chonk क्यों कहा जाता है?

यह "Le Chaton Fat" का संदर्भ है—एक काल्पनिक 24-ट्रिलियन-पैरामीटर मॉडल जिसे Mistral ने जून 2026 में मज़ाक में घोषित किया और फिर हटा दिया। मज़ाक AI सोशल मीडिया पर फैल गया, और जब असली ट्रिलियन-पैरामीटर मॉडल आया, तो नाम भी साथ आया।

Mistral Large 4 किसमें सबसे अच्छा है?

इसके सबसे मज़बूत स्वतंत्र परिणाम साइबरसुरक्षा और कानूनी काम में हैं। यह Artificial Analysis Cyber Index पर 18 मॉडलों में शीर्ष पाँच में और Harvey's Legal Agent Benchmark पर 75 में छठे स्थान पर है, ओपन-वेट मॉडलों में पहला (दोनों 6 अक्टूबर तक)। व्यापक Vals Index पर यह 44 में 32वाँ है—तो वर्टिकल ताकत और समग्र प्रदर्शन अलग कहानी बताते हैं।

क्या Mistral Large 4 ओपन सोर्स है?

नहीं। यह ओपन-वेट है, जो अलग बात है। ओपन-वेट का मतलब है कि मॉडल पैरामीटर सार्वजनिक रूप से उपलब्ध हैं, पर ज़रूरी नहीं कि ट्रेनिंग डेटा, ट्रेनिंग कोड, या अन्य घटक भी हों। Mistral ने अभी लाइसेंस शर्तें प्रकाशित नहीं की हैं, इसलिए मॉडल पर प्रोडक्ट बनाने से पहले उन्हें जाँचें।

मैं Mistral Large 4 के वेट्स कब डाउनलोड कर सकता/सकती हूँ?

27 अक्टूबर, 2026, Axios के अनुसार। API अभी Mistral Studio के ज़रिए उपलब्ध है, पर प्रीव्यू अभी रिइनफ़ोर्समेंट लर्निंग में है, इसलिए रिलीज़ किए गए वेट्स आज API में सर्व होने वाले से अलग होंगे।

विषय
कृत्रिम बुद्धिमत्ता

DataCamp के साथ सीखें

कोर्स

Understanding Artificial Intelligence

2 घंटा
427.3K
आर्टिफिशियल इंटेलिजेंस की बुनियादी अवधारणाएँ सीखें, जैसे मशीन लर्निंग, डीप लर्निंग, NLP, जनरेटिव AI और अधिक।
विवरण देखेंRight Arrow
पाठ्यक्रम शुरू करें

कोर्स

Large Language Models (LLMs) कॉन्सेप्ट्स

2 घंटा
112.1K
LLM के पूरे संभावनाओं को जानें हमारे अवधारणात्मक पाठ्यक्रम के साथ, जिसमें LLM अनुप्रयोग, प्रशिक्षण पद्धतियाँ, नैतिक विचार और नवीनतम शोध शामिल हैं।
और देखेंRight Arrow