Cursus
Op 6 oktober 2026 lanceerde Mistral een public preview van Mistral Large 4 (ML4), een model met 1 biljoen parameters en 49 miljard actieve parameters, invoer van tekst en afbeeldingen, en open weights die tegen het einde van de maand zijn beloofd. Het is het grootste model dat Mistral ooit heeft gebouwd en is vanaf nul getraind op 3.800 Nvidia Grace Blackwell-GPU’s in Mistrals eigen Europese datacenters.
Het afgelopen jaar kwamen de sterkste open-weight modellen vooral uit Chinese labs (GLM, DeepSeek, Kimi, Qwen), terwijl de sterkste modellen in het algemeen gesloten bleven achter Amerikaanse API’s. Mistral wil een derde optie zijn. In de aankondiging staat dat ML4 "al prestaties levert die concurreren met de sterkste open-source modellen wereldwijd, terwijl het aanzienlijk beter presteert dan elk open-weight model ontwikkeld in de VS of Europa."
Het plaatje is rommeliger dan de launchpost doet vermoeden. Hieronder behandel ik de architectuur, de benchmarks (met onderscheid tussen wat onafhankelijk is gerepliceerd en wat niet), coderen, visie, cybersecurity, open weights, en wat nog onbekend is. Heb je maar tijd voor één onderdeel, kies dan cybersecurity.
Het korte antwoord
Mistral Large 4 (Le Chonk) is een open-weight model met 1 biljoen parameters dat Mistral neerzet als het sterkste buiten China, vooral voor cybersecurity, financiën, recht en visual grounding. Onafhankelijke evaluaties ondersteunen de claims voor cybersecurity en juridisch werk, plaatsen financiën in de middenmoot en rangschikken ML4 als 32e van 44 modellen op een brede aggregatie-index. De API is nu live en de weights komen op 27 oktober.
Wat is Mistral Large 4 (Le Chonk)?
Die korte versie laat veel weg, dus beginnen we bij de basis. ML4 is Mistrals nieuwe vlaggenschip en, in Mistrals woorden, het "grootste en meest capabele model tot nu toe." Le Chonk is de bijnaam, al draait Mistral in de launchcopy de gebruikelijke volgorde om: "Onofficieel ML4, zeer officieel: le Chonk."
Het is een native multimodaal Mixture-of-Experts (MoE) model. De headlinegetallen zijn 1 biljoen totale parameters en 49 miljard actief per token, hoewel Mistrals eigen modeldocs lichtjes andere cijfers geven (1,05T totaal, 52B actief). Geen van beide bronnen legt het verschil uit. (Waarom "actief" telt, komt in de volgende sectie.)
Mistral richt ML4 op enterprise-werk: coderen, cybersecurity, financiën, juridisch, productie en engineering, en visuele taken zoals het lezen van technische tekeningen of satellietbeelden.
|
Specificatie |
Detail |
|
Totale parameters |
1 biljoen volgens de aankondiging, 1,05T volgens de docs |
|
Actieve parameters |
49B volgens de aankondiging, 52B volgens de docs |
|
Architectuur |
Mixture-of-Experts, hybride instruct en redeneren |
|
Input |
|
|
Output |
Alleen tekst |
|
Contextvenster |
1M tokens volgens de docs, 512K volgens vals.ai (onopgelost) |
Twee rijen zijn het belangrijkst voor iedereen die een deployment plant, en beide zijn onduidelijk: het contextvenster en de licentie. Voor we ingaan op hoe het model werkt, verdient de naam een korte uitleg.
Waarom heet het Le Chonk?
In juni 2026 plaatste Mistral een satirische aankondiging voor "Le Chaton Fat," een fictief model met 24 biljoen parameters, en verwijderde die vervolgens. Het internet ging toch door en blies de specs op tot honderden biljoenen. Vier maanden later leverde Mistral een echt model met een biljoen parameters, en de naam koos zichzelf min of meer. Dat is het hele verhaal. Terug naar het model.
Hoe Mistral Large 4 werkt
Mistral heeft nog geen volledige architectuurdetails gepubliceerd (ze zijn beloofd samen met de weights), dus deze sectie blijft bij wat is bekendgemaakt.
1 biljoen parameters, 49 miljard actief
Een model met 1 biljoen parameters gebruikt niet elke token al die 1 biljoen parameters. MoE-modellen leiden elke token door een kleine subset van "expert" sub-netwerken, dus de inferentieberekening volgt de 49 miljard actieve parameters. Dat brengt het dichter bij een dense model van ~50B parameters dan bij 1T.
Goedkoop te serven, dus? Nee. Alle 1 biljoen parameters moeten nog steeds ergens in het geheugen staan, dus zelf-hosting van ML4 vereist serieuze multi-GPU-infrastructuur. MoE-modellen zijn ook lastiger te serven met lage latency dan dense modellen met hetzelfde aantal actieve parameters. Mistral heeft geen hardwarevereisten gepubliceerd, en ik zou verbaasd zijn als veel teams buiten grote ondernemingen en overheden het volledige model zelf draaien.
Multimodale input
Die actieve parameters verwerken meer dan tekst. ML4 accepteert ook afbeeldingen, al geeft het alleen tekst terug. Mistral zegt dat het "krachtig redeneert over complexe documenten, grafieken en natuurlijke beelden" en richt zich op sectoren waar visuele waarneming telt, zoals engineering, productie en aardobservatie. De demo’s zijn allemaal industrieel: mechanische onderdelen inspecteren in technische tekeningen, bewijsmateriaal uit pdf’s halen, gigapixel-satellietbeelden scannen op moeilijk te vinden objecten.
160+ talen
Dezelfde industriële klanten werken vaak over grenzen heen, en daar komt taal om de hoek kijken. Mistral zegt dat een "significant deel" van de trainingsdata meertalig was, met meer dan 160 talen en elke officiële EU-taal. Voor een Europees bedrijf dat Europese overheden wil aantrekken, is dat een belangrijk deel van het verhaal.
Trainingsinfrastructuur
Voor een Europese propositie telt ook waar de training plaatsvond. Volgens Mistral is ML4 vanaf nul getraind op 3.800 Nvidia Grace Blackwell-GPU’s in de eigen Europese datacenters. Mistrals VP of Science Pierre Stock gaf TechCrunch een ronder getal van 4.000 en zei dat dat "twee tot drie keer minder is dan onze Chinese concurrenten." Niemand heeft die vergelijking geverifieerd.
De compute-uitbreiding hierachter is al een tijd publiek. In maart 2026 haalde Mistral $830 miljoen aan schuld op om 13.800 Nvidia GB300-GPU’s te kopen voor een datacenter bij Parijs. Mistral zegt niet of ML4 specifiek op dat cluster is getraind, dus ik leg die link niet.
Eén detail verandert hoe je elke benchmark in dit artikel moet lezen. De reinforcement learning (RL)-run loopt nog. RL is de post-trainingsfase waarin het model verbetert door beoordeeld te worden op zijn eigen pogingen bij taken, en Mistral zegt dat de run momenteel zo’n 3.000 GPU’s gebruikt, ongeveer 33 miljard tokens per dag genereert en "geen tekenen van verzadiging" vertoont. Het model dat je vandaag via de API kunt aanroepen, zal dus niet het model zijn waarvan de weights op 27 oktober verschepen.
Mistral Large 4-benchmarks
Die onvoltooide RL-run is de eerste reden om alles in deze sectie voorlopig te behandelen. De tweede is dat de meeste cijfers van Mistral niet onafhankelijk zijn gerepliceerd, en waar dat wel is gebeurd, komen ze niet altijd overeen.
Onafhankelijke evaluatie bij de lancering valt in drie categorieën:
- Onafhankelijk gerepliceerd: de Artificial Analysis (AA) Cyber Index, inclusief de CyberGym-E2E-component, en vijf vals.ai-evaluaties, waaronder Terminal-Bench 4.0.
- Uitgevoerd door AA, maar nog niet publiek: een voetnoot op Mistrals codinggrafieken zegt dat de DeepSWE-, Terminal-Bench- en SWE-Atlas-scores "de cijfers gebruiken die privé door Artificial Analysis zijn geëvalueerd voorafgaand aan de publieke lancering van de harness." Ze verschijnen op AA’s Coding Agent Index zodra die harness is vrijgegeven. Tot die tijd kan niemand buiten AA en Mistral ze controleren.
- Alleen Mistral: al het overige.
Let vooral op de laatste kolom van de tabel. Een benchmark kan zijn opgebouwd door een onafhankelijke groep, terwijl de ML4-score erop nog steeds alleen Mistrals claim is.
Samenvatting benchmarks
|
Benchmark |
ML4-resultaat |
Concurrenten |
Wat het meet |
|
DeepSWE v1.1 |
61,7%, privé gedraaid door AA |
Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (zelf gerapporteerd) |
Langetermijn software engineering |
|
Terminal-Bench 4.0 |
28,3% volgens Mistral, 22,73% volgens vals.ai |
20e van 44 op vals.ai |
Complexe terminal-workflows |
|
SWE-Atlas-QnA |
59,4%, privé gedraaid door AA |
Niet gepubliceerd |
Repository-begrip |
|
Coding Agent Index |
49,8%, privé gedraaid door AA |
Voor DeepSeek V4 Pro 0813 en Qwen3.8 Max |
Composiet van de drie coding-benchmarks hierboven |
|
AutomationBench |
59,9% volgens Mistral |
Voor Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro |
657 business-workflows in apps als Gmail, Slack en Salesforce |
|
AA-Briefcase |
1.393 Elo, door Mistral aangehaald als AA |
Voor DeepSeek V4 Pro |
Langdurig kenniswerk |
|
Dense 200 |
42% volgens Mistral |
GPT-6 Astra 41% |
Visual grounding |
|
AA Cyber Index |
Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53% |
Fouten vinden en herstellen in echte software |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%, GPT-6 Luna 78% |
Een echte kwetsbaarheid reproduceren en patchen |
|
|
93% volgens Mistral |
"Een van de hoogste" voor open weights, volgens Mistral |
40 security-competitie-uitdagingen |
|
|
Finance Agent v2 |
22e van 75, 7e van 32 open-weight |
Financiële agenttaken |
|
|
Harvey's Legal Agent |
#1 van 31 open-weight |
Autonome juridische taken |
|
|
1,691 van 2 volgens Mistral |
Hoogste onder open modellen die Mistral testte |
Verantwoord AI-gedrag |
|
|
93,3% volgens Mistral |
"Geen hogere scores onder concurrenten," volgens Mistral |
Weerstand tegen promptinjectie |
|
|
Vals Index |
9e van 16 open-weight |
Brede aggregatie over taken |
Mistral 4-benchmarkranglijsten
Lees de laatste rij naast Mistrals headlineclaim. Op de brede index van vals.ai staat ML4 32e van 44 in totaal en 9e van 16 uitsluitend onder open-weight modellen. Dat is lastig te rijmen met "concurrerend met de sterkste open-source modellen wereldwijd," althans in aggregate. Mistrals verticale resultaten zien er veel beter uit, en die kloppen. Ze meten alleen iets smallers. Als je beslist of je op ML4 wilt bouwen, is de verticale use case die jij belangrijk vindt bepalender dan een van beide headlines.
Coderen
Coderen is waar de kloof tussen headline en detail het eerst zichtbaar wordt. Mistrals cijfers zien er op het eerste gezicht goed uit. Kijk echter naar de DeepSWE-grafiek en je ziet iets wat de tekst nooit noemt. De hoogste balk is Kimi K3, op 69%, zeven punten voor ML4. ML4 zit net boven GLM-5.3 (62% versus 61%), maar één punt valt ruim binnen de ruis van de keuze voor een harness. Een "harness" is de steiger rond een model tijdens een agentic benchmark, dus de tools, de prompts en hoeveel pogingen het krijgt, en op Mistrals grafiek draaide elke concurrent in een andere. Op Datacurves eigen live DeepSWE-leaderboard, waar elk model in dezelfde setup draait, halen GLM-5.3 en Kimi K3 allebei 69% en haalt DeepSeek V4 Pro 63%. ML4 staat er nog niet op.
Terminal-Bench laat hetzelfde effect zien, maar dan andersom. Mistral rapporteert 28,3%, de onafhankelijke run van vals.ai kwam op 22,73%. Ik lees dat niet als iemand die iets opblaast, maar als een reminder dat één getal uit één setup geen ranglijst is.
De menselijke evaluaties zijn interessanter. In een blinde evaluatie die Mistral liet uitvoeren door Surge AI, beoordeelden professionele annotators code-uitvoer van 1 tot 5. ML4 werd tweede van vijf (3,74), vóór GLM-5.3 (3,60), Kimi K3 (3,59) en GLM-5.2 (3,40), en ver achter Claude Opus 5 (4,22). Let op Kimi K3: zeven punten voor ML4 op DeepSWE, erachter op menselijke voorkeur. Tests halen en code schrijven die mensen graag lezen zijn niet dezelfde vaardigheid. (En dat is Opus 5, niet de nieuwere 5.5, dus de kloof met het beste gesloten model is waarschijnlijk groter.)
Een tweede, interne Mistral-evaluatie maakt het nog troebeler. Daaruit bleek dat ML4 "gelijk of dichtbij" GLM-5.3 zit in coderen en financiën, en alleen de voorkeur krijgt in CAD en STEM. Ik zou de twee ongeveer gelijkwaardig noemen.
Financiën
Financiën is eenvoudiger, vooral omdat er een onafhankelijk cijfer is om op te leunen. ML4 scoort 54,68% op Finance Agent v2 op vals.ai, waarmee het 22e van 75 in totaal en 7e van 32 onder open-weight modellen staat. Solide middenmoot. Mistrals daadwerkelijke claim is smaller: dat ML4 GPT-6 Astra op deze benchmark verslaat.
Mistral rapporteert ook sterke resultaten op FinWorkBench, dat test of een model spreadsheets kan bouwen en bewerken voor echte financiële en boekhoudkundige taken. Die cijfers komen uit Mistrals grafieken en zijn elders niet gerepliceerd.
Juridisch
Juridisch oogt op papier veel beter. Op Harvey’s Legal Agent Benchmark staat ML4 6e van 75 en eerste onder 31 open-weight modellen. De score is 15,83%.
Lees dat getal nog een keer. Zesde plaats ter wereld in autonoom juridisch werk betekent ongeveer één op de zes taken afronden. De benchmark is moeilijk en de rangschikking is echt, maar niemand moet dit lezen als "ML4 kan juridisch werk onbewaakt doen." Geen enkel model kan dat al.
Visie en visual grounding
Visie is het omgekeerde geval: stevige claims, nog geen onafhankelijke data. De headlineclaim gaat over visual grounding, wat betekent dat specifieke objecten of regio’s in een afbeelding worden gelokaliseerd op basis van een tekstbeschrijving, zoals "vind de gescheurde las in deze tekening" in plaats van "beschrijf deze afbeelding." Mistral rapporteert 42% op Dense 200, net voor GPT-6 Astra met 41%. Op één punt zou ik geen aankoopbeslissing baseren.
Mistral zegt dat ML4 ook goed presteert op ChartQA Pro en GDP.pdf, een document-reasoning benchmark. Geen van de visionresultaten is al onafhankelijk gerepliceerd. De use cases die Mistral uitlicht zijn vooral industrieel, van satellietbeelden voor rampenrespons tot het inspecteren van technische tekeningen en het scannen van grote geospatiale beelden.
Hoe goed is Mistral Large 4 voor coderen?
Terug naar coderen, want dat is waarvoor de meeste lezers ML4 daadwerkelijk zullen gebruiken. Het is competitief onder open-weight modellen, maar niet het beste codingmodel beschikbaar, en zelfs niet het beste open model op Mistrals eigen grafiek. Ik herhaal de cijfers niet. Zo vertalen ze zich naar het werk dat je het zou geven:
- Issues oplossen in een echte codebase (agentic software engineering): bruikbaar, maar Kimi K3 oogt sterker.
- Een grote repository begrijpen: veelbelovend, al leunt het op één privé gedraaide score.
- Lange, meer-uur durende agent-runs: Mistrals RL-setup is gebouwd voor lange trajecten, maar dat is nog niet onafhankelijk getest.
- Terminal-intensief werk: het zwakste onafhankelijke signaal tot nu toe.
Ik zou wachten op ML4’s vermelding op AA’s publieke Coding Agent Index, verwacht na het verschepen van de weights, voordat je het meer noemt dan een geloofwaardige open-weight optie.
Wat open weights hier toevoegen heeft niets met scores te maken. Een bedrijf kan ML4 op zijn eigen infrastructuur draaien en nooit proprietaire broncode naar een externe API sturen. Voor codingagents op vertrouwelijke codebases kan dat alleen al de keuze bepalen.
Mistral Large 4 voor cybersecurity
Dit is Mistrals stoutste claim. Op de Artificial Analysis Cyber Index, AA’s onafhankelijke evaluatie van hoe goed modellen kwetsbaarheden in echte software vinden, reproduceren en patchen, scoort ML4 50%. Dat plaatst het in de top vijf van de 18 geteste modellen. Alleen Grok 4.7, MiMo-V2.6-Pro en GPT-6 Luna scoren hoger, en GLM-5.3 Flash staat gelijk. Mistral zegt dat ML4 "open-weight modellen ontwikkeld buiten China met ruime marge aanvoert," en AA’s grafiek is daarmee in lijn.
De uitschieter is CyberGym-E2E, een van de drie componenten van de index. Het vraagt een model om een echte kwetsbaarheid in open-sourcesoftware (een "CVE," een publiek gecatalogiseerde beveiligingsfout) te reproduceren en vervolgens te patchen. ML4 scoort 82%, eerste van de 18 modellen die AA testte. Mistral rapporteert ook 93% op Cybench, een set van 40 security-competitie-uitdagingen, al is dat door niemand gerepliceerd.
De weigeringsdata is ook interessant. Op CyberGym-E2E toont AA’s grafiek dat Claude Opus 5.5 om veiligheidsredenen voor ongeveer 96% van de taken blokkeert, en GPT-6 Astra voor 100%. Die modellen scoren bijna nul omdat de taak wordt geweigerd, dus hun scores zeggen niets over wat ze daadwerkelijk zouden kunnen. Of weigeren het juiste beleid is, is een andere discussie.
En dat is Mistrals kernpitch. Defensief securitywerk begint vaak met het reproduceren van een fout om te bewijzen dat die bestaat, en securityteams moeten dat op schaal doen, grote codebases scannen en honderden bevindingen triëren. Een model dat het grootste deel van die workload weigert, of waarvan de provider midden in een incident de moderatieregels kan aanpassen, is een risico. Mistrals gestelde argument is dat ML4 op je eigen infrastructuur draaien het gedrag onder jouw controle brengt. Het bredere debat over AI-veiligheidsmaatregelen die legitiem defensief werk blokkeren, loopt al een tijd.
Nu het slechte nieuws: zodra de weights publiek zijn, krijgen aanvallers dezelfde capaciteit. AA’s index is bewust defensief (modellen werken vanuit broncode en worden nooit gevraagd een werkende exploit te bouwen), dus een reproductiescore van 82% is geen 82% offensieve capaciteit. Toch is de afstand van "reproduceer een crash" naar "maak het wapenbaar" niet oneindig. Mistral besteedt de drie weken voor de release aan red-teamen van het model, dus het expres proberen te laten ontsporen, met "cybersecurityleiders, gescreende partners en overheidsinstanties."
Waarom open weights belangrijk zijn voor Mistral Large 4
De cybersecuritycase is eigenlijk een pleidooi voor open weights, en reikt veel verder dan security. "Je kunt het model downloaden" doet het tekort.
Een bank die ML4 op eigen servers draait, stuurt nooit klantdata naar Mistral. Een overheidsinstantie beheert de volledige deploymentomgeving. Een securityteam kan modelgedrag aanpassen zonder te hoeven wachten op het moderatiebeleid van een provider, wat, na de vorige sectie, niet hypothetisch is. En als een provider uitvalt of een modelversie uitfaseert, blijven zelfgehoste deployments draaien.
Open weights maken maatwerk ook praktisch. Ik besprak Mistral Forge in april, en Mistral zegt dat ML4 "dezelfde training-, maatwerk- en RL-omgeving gebruikt" die het aan enterpriseklanten biedt via Forge. Voor organisaties die ML4 op eigen data willen fine-tunen, is Forge de logische route.
Een kort woord over termen. Open-weight betekent dat de getrainde modelparameters publiek beschikbaar zijn. Het betekent niet dat de trainingsdata, trainingscode of iets anders onder een open-sourcelicentie wordt vrijgegeven. Mistrals modelpagina beschrijft ML4 als open-weight maar heeft de licentievoorwaarden nog niet gepubliceerd. Totdat dat gebeurt, zijn commercieel gebruik, fine-tuningrechten en redistributie open vragen. Ik vind het wat frustrerend om "check de licentie" te schrijven over een model waarvan de kernpropositie controle is, maar zo staat het ervoor.
Mistral Large 4 en Europa’s push voor AI-soevereiniteit
Controle staat ook centraal in Mistrals politieke pitch. De Franse president Macron omschreef Mistrals aanpak als "een derde weg in AI". De eerste twee wegen zijn Amerikaanse gesloten modellen, capabel maar onderhevig aan Amerikaans recht en providerbeleid, en Chinese open modellen, vaak capabel maar een zorg qua dataresidentie en geopolitiek voor Europese instellingen. Mistrals aanbod is open weights, Europese infrastructuur en Europees recht.
Dat omvat een Europese deployment die Mistral zegt "end-to-end, onafhankelijk van andere digitale dienstverleners en onder Europees recht" uit te baten. Als je onder de AVG of sectorspecifieke dataresidentieregels valt, toets die claim dan aan Mistrals verwerkersovereenkomsten voordat je erop vertrouwt.
Mistral heeft ook het geld om de pitch te staven. Mistral noemt ML4 "de eerste mijlpaal op de roadmap gefinancierd door onze Series D van €3 miljard," een ronde geleid door Samsung tegen een waardering van €21 miljard, die Mistral omschrijft als de grootste aandelenronde die ooit is opgehaald door een Europees technologiebedrijf. Het meeste gaat naar Europese datacentercapaciteit.
Dus: kan Europa frontier-niveau modellen produceren terwijl organisaties meer controle krijgen over waar en hoe die modellen draaien? ML4 is een sterk datapunt voor de controlehelft. Voor de frontierhelft zegt 32e van 44 op de Vals Index dat Europa er nog niet is.
Mistral Large 4 versus andere open-weight modellen
Als Europa er nog niet is, is het fair om te vragen wie er wel is en hoe ML4 zich tot hen verhoudt. Ik zet niet alle modelcijfers in één tabel, omdat ze uit verschillende setups komen en één gecombineerde tabel zou impliceren dat ze vergelijkbaar zijn. Aantal parameters is ook geen proxy voor capaciteit. De onderstaande tabel plaatst elk model alleen:er. De tabel hieronder plaatst ze enkel:
|
Model |
Architectuur |
Weights beschikbaar |
Sterkte |
Herkomst |
|
Mistral Large 4 |
MoE, 1T totaal / 49B actief |
27 oktober (gepland) |
Cybersecurity, juridisch (onafhankelijk ondersteund) |
Frankrijk |
|
GLM-5.3 |
Niet bekendgemaakt |
Ja |
Coderen, STEM |
China |
|
DeepSeek V4 Pro |
MoE |
Ja |
Coderen, wiskunde |
China |
|
Reflection Beam |
Niet bekendgemaakt |
Ja |
Algemene redeneercapaciteit |
VS |
|
Qwen3.8 Max |
Niet bekendgemaakt |
Niet bevestigd |
Meertalig, coderen |
China |
Mistral Large 4 vs. GLM-5.3
De vergelijking die het meest telt, omdat GLM-5.3 een van de sterkste Chinese open modellen is. Zoals in de codingsectie behandeld, schelen ze één punt op Mistrals grafiek, de menselijke evaluaties zijn verdeeld, en GLM-5.3 haalt 69% op het live leaderboard waar ML4 nog niet is getest. Noem het gelijkspel totdat beide op onafhankelijke leaderboards staan.
Mistral Large 4 vs. DeepSeek V4 Pro
ML4 wint elke vergelijking die Mistral publiceerde (DeepSWE, de Coding Agent Index, AutomationBench, AA-Briefcase), maar geen daarvan is onafhankelijk bevestigd, en DeepSeek V4 Pro haalt 63% op het live DeepSWE-leaderboard, boven ML4’s 62%. Er is geen gepubliceerde head-to-head op financiën.
Mistral Large 4 vs. Reflection Beam
Reflection Beam is de andere westerse open-weight kanshebber, wat het de meest directe test maakt van Mistrals claim "beste buiten China." De data is dun. Mistrals DeepSWE-grafiek zet Beam op 44%, bijna 18 punten onder ML4, maar dat is een zelf gerapporteerd cijfer afgezet tegen een door AA-gedraaide score, dus ik zou niet op dat gat leunen. Reflection heeft de omvang van Beam niet bekendgemaakt, dus een schaalvergelijking is ook niet mogelijk. ML4 heeft wel bredere multimodale input en veel sterkere gepubliceerde cybersecurity-evidentie.
Wanneer kun je Mistral Large 4 gebruiken?
Je hoeft niet te wachten tot die vergelijkingen zijn beslecht om ML4 zelf te proberen. Dit is de uitrol tot nu toe:
- 6 oktober: de public preview begon. Iedereen kan mistral-large-4 aanroepen via Mistral Studio.
- Tijdens de preview: cybersecurityleiders, gescreende partners en overheidsinstanties krijgen een versie met "gereduceerde moderatie en uitgebreide cybercapaciteiten" voor red-teamen. Pierre Stock vertelde TechCrunch dat Mistral zal "samenwerken met vertrouwde partners en overheden om ervoor te zorgen dat de open-source weights kunnen worden gebruikt om te verdedigen, maar niet voor kwaadaardige aanvallen." Ondertussen gaat RL-training door, dus het API-model blijft veranderen.
- 27 oktober: de weights staan gepland om te verschepen samen met volledige architectuurdetails, meer benchmarks en Mistrals post-trainingsmethodologie.
Ik werk deze sectie bij wanneer de weights verschepen.
Wat we nog niet weten over Mistral Large 4
Tot die tijd staat er nog veel open. Ik schrijf dit op de lanceringsdag, dus de lijst is lang:
- Definitieve benchmarkprestaties: RL draait nog, dus elke score hierboven kan veranderen. Mistral verwacht "grote en snelle verbeteringen," maar niemand heeft dat nog gemeten.
- Onafhankelijke resultaten voor coderen, visie en kenniswerk: buiten de AA Cyber Index en vals.ai is niets gerepliceerd.
- Prijzen: de aankondiging en de docspagina spreken elkaar tegen, en previewtarieven gelden mogelijk niet straks.
- Licentievoorwaarden: je kunt geen product bouwen op "open-weight" zonder licentie.
- Hardwarevereisten voor zelf-hosting: niet gepubliceerd.
- Volledige architectuur: beloofd met de weights, wat ook de discrepantie 49B versus 52B actieve parameters kan verklaren.
- Contextvenster: 1M tokens volgens Mistrals docs, 512K volgens vals.ai.
- Definitieve veiligheidsevaluatie: red-teamen loopt tot in oktober.
Conclusie
Mistral Large 4 is een sparse model met 1 biljoen parameters, 49 miljard actieve parameters, multimodale input en open weights in aantocht. Op lanceringsdag zien we dat het het beste open-weight model is op Harvey’s juridische benchmark, maar 32e van 44 op de Vals Index en achter Kimi K3 op Mistrals eigen codinggrafiek.
Ik denk niet dat benchmarkkoploper zijn Mistrals echte inzet is. De inzet is dat capabele open weights en zelf-hosting zijn waar ondernemingen en overheden het meest om geven. De weigeringsdata voor cybersecurity is het duidelijkste bewijs tot nu toe dat dit pakket een probleem oplost dat securityteams al hebben.
27 oktober is de datum om in de gaten te houden. Dan verschepen de weights, kunnen onafhankelijke onderzoekers zelf de laatste checkpoint draaien, en kunnen Artificial Analysis en vals.ai het model testen dat Mistral daadwerkelijk uitbrengt in plaats van een preview die nog traint. Le Chonk maakt dan zijn launchpost waar, of niet.
Voor achtergrond bij de concepten achter MoE-modellen behandelt onze cursus Introduction to Large Language Models de basis. Voor meer over Mistrals producten, zie onze coverage van Mistral Forge, Mistral Large 3, Mistral Le Chat, en Mistral Vibe 2.0, zijn terminal-gebaseerde codingagent.
Techschrijver gespecialiseerd in AI, ML en data science, die complexe ideeën helder en toegankelijk maakt.
FAQs
Wat is Mistral Large 4 (Le Chonk)?
Het is Mistrals nieuwe vlaggenschip, gelanceerd in public preview op 6 oktober 2026: een Mixture-of-Experts-model met ongeveer 1 biljoen totale parameters en 49 miljard actief per token. Het neemt tekst en afbeeldingen, produceert tekst en heeft open weights gepland voor 27 oktober.
Waarom heet het Le Chonk?
Het verwijst naar "Le Chaton Fat," een fictief model met 24 biljoen parameters dat Mistral in juni 2026 gekscherend aankondigde en vervolgens verwijderde. De grap verspreidde zich op AI-social media, en toen er een echt model met een biljoen parameters kwam, volgde de naam vanzelf.
Waar is Mistral Large 4 het beste in?
De sterkste onafhankelijke resultaten zijn in cybersecurity en juridisch werk. Het staat in de top vijf van 18 modellen op de Artificial Analysis Cyber Index en zesde van 75 op Harvey’s Legal Agent Benchmark, eerste onder open-weight modellen (beide per 6 oktober). Op de brede Vals Index staat het 32e van 44, dus verticale sterkte en algehele performance vertellen verschillende verhalen.
Is Mistral Large 4 open source?
Nee. Het is open-weight, wat iets anders is. Open-weight betekent dat de modelparameters publiek beschikbaar zijn, maar niet per se de trainingsdata, trainingscode of andere componenten. Mistral heeft de licentievoorwaarden nog niet gepubliceerd, dus controleer die voordat je een product op het model bouwt.
Wanneer kan ik de Mistral Large 4-weights downloaden?
27 oktober 2026, volgens Axios. De API is nu beschikbaar via Mistral Studio, maar de preview zit nog in reinforcement learning, dus de vrijgegeven weights zullen verschillen van wat de API vandaag serveert.

