Hoppa till huvudinnehållet

Mistral Large 4 (Le Chonk): Allt vi vet

Mistrals modell med en biljon parametrar och öppna vikter leder på benchmark för cyber- och juridik.
Uppdaterad 9 okt. 2026  · 15 min läs

Utforska med AI

ChatGPTClaudePerplexity

Den 6 oktober 2026 lanserade Mistral en offentlig förhandsvisning av Mistral Large 4 (ML4), en modell med 1 biljon parametrar, 49 miljarder aktiva parametrar, text- och bildinmatning samt öppna vikter utlovade före månadsskiftet. Det är den största modellen Mistral har byggt och den tränades från grunden på 3 800 Nvidia Grace Blackwell-GPU:er i Mistrals egna europeiska datacenter.

Under större delen av det senaste året har de starkaste modellerna med öppna vikter kommit från kinesiska labb (GLM, DeepSeek, Kimi, Qwen), medan de starkaste modellerna överlag förblivit stängda bakom amerikanska API:er. Mistral vill bli det tredje alternativet. I sitt tillkännagivande säger Mistral att ML4 "redan uppnår en prestanda som är konkurrenskraftig med de starkaste open-source-modellerna globalt, samtidigt som den signifikant överträffar alla modeller med öppna vikter utvecklade i USA eller Europa."

Bildens verklighet är rörigare än vad lanseringsinlägget antyder. Nedan går jag igenom arkitektur, benchmarkresultat (med uppdelning mellan oberoende reproducerat och inte), kodning, vision, cybersäkerhet, öppna vikter och vad som fortfarande är okänt. Om du bara har tid för en sektion, läs om cybersäkerhet.

Det snabba svaret

Mistral Large 4 (Le Chonk) är en modell med 1 biljon parametrar och öppna vikter som Mistral positionerar som den starkaste byggd utanför Kina, särskilt för cybersäkerhet, finans, juridik och visuell förankring. Oberoende utvärderingar stödjer påståendena om cybersäkerhet och juridik, placerar finans mitt i fältet och rankar ML4 som nummer 32 av 44 modeller på ett brett aggregatindex. API:et är live nu, och vikterna är planerade till 27 oktober.

Vad är Mistral Large 4 (Le Chonk)?

Den korta versionen lämnar mycket ute, så låt oss börja med grunderna. ML4 är Mistrals nya flaggskepp och, med Mistrals egna ord, deras "största och mest kapabla modell hittills." Le Chonk är smeknamnet, även om Mistrals lanseringstext vänder på det vanliga upplägget: "Inofficiellt ML4, mycket officiellt: le Chonk."

Det är en inbyggt multimodal Mixture-of-Experts (MoE)-modell. Huvudsiffrorna är 1 biljon totala parametrar och 49 miljarder aktiva per token, även om Mistrals egna modelldokument listar något annorlunda tal (1,05T totalt, 52B aktiva). Ingen av källorna förklarar skillnaden. (Varför "aktiva" spelar roll tas upp i nästa avsnitt.)

Mistral siktar in ML4 på företagsarbete: kodning, cybersäkerhet, finans, juridik, tillverkning och ingenjörsarbete samt visuella uppgifter som att läsa tekniska ritningar eller satellitbilder.

Specifikation

Detalj

Totala parametrar

1 biljon enligt tillkännagivandet, 1,05T enligt dokumentationen

Aktiva parametrar

49B enligt tillkännagivandet, 52B enligt dokumentationen

Arkitektur

Mixture-of-Experts, hybrid instruktion och resonemang

Inmatning

Text och bilder

Utmatning

Endast text

Kontextfönster

1M token enligt dokumentationen, 512K enligt vals.ai (olöst)

Två rader spelar störst roll för alla som planerar en driftsättning, och båda är osäkra: kontextfönstret och licensen. Innan vi går in på hur modellen fungerar förtjänar dock namnet en snabb förklaring.

Varför heter den Le Chonk?

I juni 2026 postade Mistral ett satiriskt tillkännagivande för "Le Chaton Fat", en fiktiv modell med 24 biljoner parametrar, och tog sedan bort det. Internet körde vidare ändå och blåste upp specifikationerna till hundratals biljoner. Fyra månader senare levererade Mistral en verklig modell med en biljon parametrar, och namnet valde i princip sig självt. Det är hela historien. Tillbaka till modellen.

Hur Mistral Large 4 fungerar

Mistral har ännu inte publicerat fullständiga arkitekturdetaljer (de utlovas tillsammans med vikterna), så det här avsnittet håller sig till det som avslöjats.

1 biljon parametrar, 49 miljarder aktiva

En modell med 1 biljon parametrar använder inte alla 1 biljon vid varje token. MoE-modeller routar varje token genom en liten delmängd av "expert"-delnät, så inferensberäkningen följer de 49 miljarder aktiva parametrarna. Det placerar den närmare en tät modell på ~50B parametrar än en på 1T.

Billig att drifta, då? Nej. Alla 1 biljon parametrar måste ändå finnas i minnet någonstans, så självhystering av ML4 kräver rejäl multi-GPU-infrastruktur. MoE-modeller är också svårare att serva med låg latens än täta modeller med samma antal aktiva parametrar. Mistral har inte publicerat hårdvarukrav, och jag skulle bli förvånad om många team utanför stora företag och myndigheter kör hela modellen själva.

Multimodal inmatning

De aktiva parametrarna hanterar mer än text. ML4 tar även bilder, även om den bara returnerar text. Mistral säger att den "resonerar kraftfullt över komplexa dokument, diagram och naturliga bilder" och siktar på branscher där visuell perception är viktig, som ingenjörskonst, tillverkning och jordobservation. Demona är alla industriella: inspektion av mekaniska delar i tekniska ritningar, plocka evidens ur PDF:er, skanna gigapixel-satellitbilder efter svårfunna objekt.

160+ språk

Samma industrikunder arbetar ofta över gränser, vilket är där språken kommer in. Mistral säger att en "betydande andel" av träningsdatan var flerspråkig, med över 160 språk och alla officiella EU-språk. För ett europeiskt företag som försöker vinna europeiska myndigheter är det en stor del av erbjudandet.

Träningsinfrastruktur

För ett europeiskt erbjudande spelar det också roll var träningen skedde. Enligt Mistral tränades ML4 från grunden på 3 800 Nvidia Grace Blackwell-GPU:er i deras egna europeiska datacenter. Mistrals VP of Science Pierre Stock gav TechCrunch en rundare siffra på 4 000 och sa att det är "två till tre gånger mindre än våra kinesiska konkurrenter." Ingen har verifierat den jämförelsen.

Uppbyggnaden av beräkningsresurser bakom detta har varit offentlig ett tag. I mars 2026 tog Mistral in 830 miljoner dollar i lån för att köpa 13 800 Nvidia GB300-GPU:er till ett datacenter nära Paris. Mistral säger inte om ML4 tränades på just det klustret, så jag gör ingen koppling.

En detalj förändrar hur du bör läsa varje benchmark i den här artikeln. Förstärkningsinlärningen (RL) pågår fortfarande. RL är fasen efter träning där modellen förbättras genom att bedömas på sina egna försök på uppgifter, och Mistral säger att körningen för närvarande använder cirka 3 000 GPU:er, genererar ungefär 33 miljarder token per dag och "visar inga tecken på mättnad." Alltså kommer modellen du kan anropa via API:et idag inte vara samma som den vars vikter släpps den 27 oktober.

Mistral Large 4 benchmarkresultat

Den oavslutade RL-körningen är första skälet att betrakta allt i det här avsnittet som preliminärt. Det andra är att de flesta av Mistrals siffror inte har reproducerats oberoende, och de som har det stämmer inte alltid överens.

Oberoende utvärderingar vid lansering faller i tre grupper:

  • Oberoende reproducerade: Artificial Analysis (AA) Cyber Index, inklusive dess CyberGym-E2E-komponent, och fem vals.ai-utvärderingar, inklusive Terminal-Bench 4.0.
  • Körda av AA, men inte offentliga än: en fotnot på Mistrals kodningsdiagram säger att resultaten för DeepSWE, Terminal-Bench och SWE-Atlas "använder siffror som utvärderats privat av Artificial Analysis inför ramverkets offentliga lansering." De kommer att visas på AA:s Coding Agent Index när det ramverket släpps. Tills dess kan ingen utanför AA och Mistral granska dem.
  • Endast Mistral: allt annat.

Lägg mest vikt vid tabellens sista kolumn. Ett benchmark kan vara byggt av en oberoende grupp samtidigt som ML4:s poäng på det fortfarande bara är Mistrals påstående.

Sammanfattning av benchmark

Benchmark

ML4-resultat

Konkurrenter

Vad det mäter

DeepSWE v1.1

61,7%, kört privat av AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (självrapporterat)

Långsiktig mjukvaruengineer­ing

Terminal-Bench 4.0

28,3% enligt Mistral, 22,73% enligt vals.ai

20:e av 44 på vals.ai

Komplexa terminalarbetsflöden

SWE-Atlas-QnA

59,4%, kört privat av AA

Inte publicerat

Förståelse av kodförråd

Coding Agent Index

49,8%, kört privat av AA

Före DeepSeek V4 Pro 0813 och Qwen3.8 Max

Sammansatt av de tre kodningsbenchmarken ovan

AutomationBench

59,9% enligt Mistral

Före Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 affärsarbetsflöden över appar som Gmail, Slack och Salesforce

AA-Briefcase

1 393 Elo, citerat av Mistral som AA

Före DeepSeek V4 Pro

Långsiktigt kunskapsarbete

Dense 200

42% enligt Mistral

GPT-6 Astra 41%

Visuell förankring

AA Cyber Index

50%, topp 5 av 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Hitta och åtgärda brister i verklig programvara

CyberGym-E2E

82%, #1 av 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Reproducera och patcha en verklig sårbarhet

Cybench

93% enligt Mistral

"Ett av de högsta" för öppna vikter, enligt Mistral

40 tävlingsutmaningar inom säkerhet

Finance Agent v2

54,68%

22:a av 75, 7:a av 32 med öppna vikter

Finansiella agentuppgifter

Harveys Legal Agent

15,83%, #6 av 75

#1 av 31 med öppna vikter

Autonoma juridiska uppgifter

KORA Benchmark

1,691 av 2 enligt Mistral

Högst bland öppna modeller som Mistral testade

Ansvarsfullt AI-beteende

B3 Attack Resistance

93,3% enligt Mistral

"Inga högre poäng bland konkurrenter," enligt Mistral

Motstånd mot prompt-injektion

Vals Index

48,05%, 32:a av 44

9:a av 16 med öppna vikter

Brett aggregat över uppgifter

Mistral 4-benchmarkrankningar

Läs den sista raden tillsammans med Mistrals huvudpåstående. På vals.ai:s breda index hamnar ML4 på plats 32 av 44 totalt och 9 av 16 bland endast modeller med öppna vikter. Det är svårt att förena med "konkurrenskraftig med de starkaste open-source-modellerna globalt," åtminstone i aggregat. Mistrals vertikala resultat ser mycket bättre ut, och de är inte fel. De mäter bara något smalare. Om du ska avgöra om du ska bygga på ML4 spelar den vertikal du bryr dig om större roll än något av huvudpåståendena.

Kodning

Kodning är där gapet mellan rubrik och detaljer visar sig först. Mistrals siffror ser bra ut vid en första anblick. Titta på deras DeepSWE-diagram, så ser du något som texten aldrig nämner. Den högsta stapeln är Kimi K3, på 69%, sju poäng före ML4. ML4 nosar GLM-5.3 (62% mot 61%), men en poäng ligger väl inom bruset från val av ramverk. Ett "ramverk" är infrastrukturen som omger en modell under ett agentiskt benchmark, det vill säga verktygen, promptarna och hur många försök den får, och på Mistrals diagram kördes varje konkurrent i ett annat sådant. På Datacurves egna live-topplista för DeepSWE, som kör varje modell i samma setup, når både GLM-5.3 och Kimi K3 69% och DeepSeek V4 Pro 63%. ML4 finns ännu inte med.

Terminal-Bench visar samma effekt från andra hållet. Mistral rapporterar 28,3%, vals.ai:s oberoende körning fick 22,73%. Jag tolkar inte det som att någon blåser upp något, bara en påminnelse om att ett tal från en setup inte är en ranking.

De mänskliga utvärderingarna är mer intressanta. I en blind utvärdering som Mistral beställde från Surge AI betygsatte professionella annotatörer kodutmatningar från 1 till 5. ML4 placerade sig tvåa av fem (3,74), före GLM-5.3 (3,60), Kimi K3 (3,59) och GLM-5.2 (3,40), och klart bakom Claude Opus 5 (4,22). Notera Kimi K3: sju poäng före ML4 på DeepSWE, bakom det på mänsklig preferens. Att klara tester och skriva kod som folk gillar att läsa är inte samma sak. (Och det är Opus 5, inte den nyare 5.5, så gapet till den bästa stängda modellen är sannolikt större.)

En andra, intern Mistral-utvärdering grumlar bilden ytterligare. Den fann att ML4 var "i paritet med eller nära" GLM-5.3 inom kodning och finans, och föredrogs endast i CAD och STEM. Jag skulle kalla de två ungefär jämnstarka.

Finans

Finans är enklare, mest för att det finns en oberoende siffra att förhålla sig till. ML4 får 54,68% på Finance Agent v2 på vals.ai, vilket rankar den 22:a av 75 totalt och 7:a av 32 bland modeller med öppna vikter. Stadigt i mitten. Mistrals egentliga påstående är smalare: att ML4 slår GPT-6 Astra på detta benchmark.

Mistral rapporterar också starka resultat på FinWorkBench, som testar om en modell kan bygga och redigera kalkylblad för verkliga finans- och redovisningsuppgifter. De siffrorna kommer från Mistrals diagram och har inte reproducerats någon annanstans.

Juridik

Juridik ser mycket bättre ut på papper. På Harvey's Legal Agent Benchmark rankas ML4 som 6:a av 75 och först bland 31 modeller med öppna vikter. Dess poäng är 15,83%.

Läs den siffran två gånger. Sjätte plats i världen på autonomt juridiskt arbete innebär att slutföra ungefär en uppgift av sex. Benchmarken är svår och rankingen är verklig, men ingen bör tolka detta som att "ML4 kan göra juridiskt arbete utan övervakning." Ingen modell kan det än.

Vision och visuell förankring

Vision är motsatt fall, djärva påståenden, inga oberoende data än. Huvudpåståendet gäller visuell förankring, vilket innebär att lokalisera specifika objekt eller regioner i en bild utifrån en textbeskrivning, som "hitta den spruckna svetsen i den här ritningen" snarare än "beskriv den här bilden." Mistral rapporterar 42% på Dense 200, strax före GPT-6 Astra på 41%. Jag skulle inte basera ett köpbeslut på en poängs skillnad.

Mistral säger att ML4 också presterar väl på ChartQA Pro och GDP.pdf, ett dokumentresonemangs-benchmark. Inga av visionsresultaten har ännu reproducerats oberoende. Användningsfallen Mistral lyfter fram är mestadels industriella, från satellitbilder för katastrofinsatser till inspektion av tekniska ritningar och skanning av stora geospatiala bilder.

Hur bra är Mistral Large 4 för kodning?

Tillbaka till kodning, eftersom det är vad de flesta läsare faktiskt kommer att använda ML4 till. Den är konkurrenskraftig bland modeller med öppna vikter, men inte den bästa kodningsmodellen som finns, och inte ens den bästa öppna på Mistrals eget diagram. Jag upprepar inte siffrorna. Så här översätts de till arbete du skulle ge den:

  • Åtgärda fel i en verklig kodbas (agentisk mjukvaruingenjörskonst): användbar, men Kimi K3 ser starkare ut.
  • Förstå ett stort kodförråd: lovande, även om det vilar på en privat körd poäng.
  • Långa, fler­timmars agentkörningar: Mistrals RL-setup är byggd för långa trajektorier, men ingen har testat det oberoende än.
  • Terminaltungt arbete: den svagaste oberoende signalen hittills.

Jag skulle vänta på ML4:s post på AA:s offentliga Coding Agent Index, förväntat efter att vikterna släpps, innan jag kallar den mer än ett trovärdigt alternativ med öppna vikter.

Vad öppna vikter tillför här har inget med poängen att göra. Ett företag kan köra ML4 i sin egen infrastruktur och aldrig skicka proprietär källkod till ett externt API. För kodningsagenter på konfidentiella kodbaser kan det ensamt avgöra valet.

Mistral Large 4 för cybersäkerhet

Detta är Mistrals djärvaste påstående. På Artificial Analysis Cyber Index, AA:s oberoende utvärdering av hur väl modeller hittar, reproducerar och patchar sårbarheter i verklig programvara, får ML4 50%. Det placerar den i topp fem av de 18 modeller som testats. Endast Grok 4.7, MiMo-V2.6-Pro och GPT-6 Luna ligger högre, och GLM-5.3 Flash delar placering. Mistral säger att ML4 "leder modeller med öppna vikter utvecklade utanför Kina med bred marginal," och AA:s diagram är förenligt med det.

Det som sticker ut är CyberGym-E2E, en av indexets tre komponenter. Den ber en modell reproducera en verklig sårbarhet i öppen källkod (en "CVE", vilket betyder en offentligt katalogiserad säkerhetsbrist) och sedan patcha den. ML4 får 82%, först av de 18 modeller AA testade. Mistral rapporterar också 93% på Cybench, en uppsättning med 40 säkerhetstävlingsutmaningar, även om ingen har reproducerat det resultatet.

Avslagsdatan är också intressant. På CyberGym-E2E visar AA:s diagram att Claude Opus 5.5 blockerades av säkerhetsskäl för ungefär 96% av uppgifterna, och GPT-6 Astra för 100%. De modellerna får nära noll eftersom uppgiften nekas, så deras poäng säger inget om vad de faktiskt skulle kunna göra. Om avslag är rätt policy är en separat diskussion.

Och det är Mistrals kärnerbjudande. Defensivt säkerhetsarbete börjar ofta med att reproducera en brist för att bevisa att den finns, och säkerhetsteam behöver göra det i volym, skanna stora kodbaser och triagera hundratals fynd. En modell som vägrar större delen av det arbetet, eller vars leverantör kan ändra modereringsregler mitt i en incident, är en belastning. Mistrals uttalade argument är att köra ML4 i din egen infrastruktur sätter dess beteende under din kontroll. Den bredare debatten om att AI-skydd blockerar legitimt defensivt arbete har pågått ett tag.

Nu den dåliga delen: När vikterna blir offentliga får angripare samma förmåga. AA:s index är medvetet defensivt (modeller arbetar från källkod och ombeds aldrig bygga en fungerande exploit), så en reproduktionspoäng på 82% är inte 82% offensiv kapacitet. Ändå är avståndet från "reproducera en krasch" till "vapenisera den" inte oändligt. Mistral ägnar de tre veckorna före release åt att rödlagstesta modellen, det vill säga medvetet försöka få den att missköta sig, tillsammans med "ledande aktörer inom cybersäkerhet, granskade partners och statliga myndigheter."

Varför öppna vikter är viktiga för Mistral Large 4

Cybersäkerhetsfallet är egentligen ett argument för öppna vikter, och det sträcker sig långt bortom säkerhet. "Du kan ladda ner modellen" undersäljer det.

En bank som kör ML4 på egna servrar skickar aldrig kunddata till Mistral. En myndighet kontrollerar hela driftsmiljön. Ett säkerhetsteam kan justera modellbeteendet utan att invänta en leverantörs modereringspolicy, vilket, efter föregående avsnitt, inte är en hypotetisk oro. Och om en leverantör går ner eller pensionerar en modellversion fortsätter självhostade driftsättningar att köra.

Öppna vikter gör också anpassning praktisk. Jag gick igenom Mistral Forge i april, och Mistral säger att ML4 "använder samma miljö för träning, anpassning och RL" som de erbjuder företagskunder via Forge. För organisationer som vill finjustera ML4 på sin egen data är Forge det självklara spåret.

Ett snabbt ord om termer. Öppna vikter betyder att de tränade modellparametrarna är offentligt tillgängliga. Det betyder inte att träningsdata, träningskod eller något annat släpps under en open-source-licens. Mistrals modellsida beskriver ML4 som med öppna vikter men har inte publicerat licensvillkoren. Tills de gör det är kommersiell användning, rättigheter för finjustering och vidaredistribution öppna frågor. Jag tycker det är lite frustrerande att skriva "kontrollera licensen" om en modell vars hela erbjudande är kontroll, men där står vi.

Mistral Large 4 och Europas satsning på AI-suveränitet

Kontroll står också i centrum för Mistrals politiska budskap. Frankrikes president Macron har beskrivit Mistrals angreppssätt som "en tredje väg inom AI". De två första vägarna är amerikanska stängda modeller, kapabla men underkastade amerikansk lag och leverantörspolicy, och kinesiska öppna modeller, ofta kapabla men ett bekymmer kring data­lokalisering och geopolitik för europeiska institutioner. Mistrals erbjudande är öppna vikter, europeisk infrastruktur och europeisk lag.

Det inkluderar en europeisk driftsättning som Mistral säger att de driver "end-to-end, oberoende av andra digitala tjänsteleverantörer och under europeisk lag." Om du omfattas av GDPR eller sektorsvisa regler för datalokalisering, stäm av det påståendet mot Mistrals personuppgiftsbiträdesavtal innan du förlitar dig på det.

Mistral har också pengarna att backa upp erbjudandet. Mistral kallar ML4 "den första milstolpen på färdplanen som finansierats av vår Serie D på 3 miljarder €", en runda ledd av Samsung på en värdering om 21 miljarder €, som Mistral beskriver som den största kapitalrundan som någonsin tagits in av ett europeiskt teknikbolag. Det mesta går till europeisk datacenterkapacitet.

Så kan Europa producera modeller på gränsen av det möjliga samtidigt som organisationer får mer kontroll över var och hur modellerna körs? ML4 är en stark datapunkt för kontrollhalvan. På frontier-halvan säger 32:a av 44 på Vals Index att Europa inte är där än.

Mistral Large 4 jämfört med andra modeller med öppna vikter

Om Europa inte är där än är det rimligt att fråga vem som är det, och hur ML4 står sig mot dem. Jag lägger inte alla modellers poäng i en tabell, eftersom de kommer från olika setup:er och en kombinerad tabell skulle antyda att de är jämförbara. Antalet parametrar är inte heller en proxy för kapabilitet. Tabellen nedan placerar bara var och en:er. Tabellen nedan placerar bara var och en:

Modell

Arkitektur

Vikter tillgängliga

Styrka

Ursprung

Mistral Large 4

MoE, 1T totalt / 49B aktiva

27 oktober (planerat)

Cybersäkerhet, juridik (oberoende stöd)

Frankrike

GLM-5.3

Ej avslöjat

Ja

Kodning, STEM

Kina

DeepSeek V4 Pro

MoE

Ja

Kodning, matematik

Kina

Reflection Beam

Ej avslöjat

Ja

Allmänt resonemang

USA

Qwen3.8 Max

Ej avslöjat

Inte bekräftat

Flerspråkig, kodning

Kina

Mistral Large 4 vs. GLM-5.3

Jämförelsen som betyder mest, eftersom GLM-5.3 är en av de starkaste kinesiska öppna modellerna. Som täcks i kodningsavsnittet skiljer de en poäng på Mistrals diagram, de mänskliga utvärderingarna delar på sig, och GLM-5.3 når 69% på live-topplistan där ML4 ännu inte har testats. Kalla det oavgjort tills oberoende topplistor inkluderar båda.

Mistral Large 4 vs. DeepSeek V4 Pro

ML4 vinner varje jämförelse Mistral publicerat (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), men inget är oberoende bekräftat, och DeepSeek V4 Pro når 63% på live-topplistan för DeepSWE, över ML4:s 62%. Det finns ingen publicerad head-to-head inom finans.

Mistral Large 4 vs. Reflection Beam

Reflection Beam är den andra västerländska utmanaren med öppna vikter, vilket gör den till det mest direkta testet av Mistrals påstående "bäst utanför Kina". Datan är tunn. Mistrals DeepSWE-diagram listar Beam på 44%, nästan 18 poäng under ML4, men det är en självrapporterad siffra ställd mot en AA-körd poäng, så jag skulle inte luta mig mot gapet. Reflection har inte avslöjat Beams storlek, så en jämförelse i skala är inte möjlig heller. ML4 har däremot bredare multimodal inmatning och betydligt starkare publicerade bevis inom cybersäkerhet.

När kan du använda Mistral Large 4?

Du behöver inte vänta på att de jämförelserna ska landa innan du provar ML4 själv. Här är utrullningen hittills:

  1. 6 oktober: den offentliga förhandsvisningen började. Vem som helst kan anropa mistral-large-4 via Mistral Studio.
  2. Under förhandsvisningen: ledare inom cybersäkerhet, granskade partners och statliga myndigheter får en version med "reducerad moderering och utökade cyberförmågor" för rödlagstestning. Pierre Stock berättade för TechCrunch att Mistral kommer att "arbeta med betrodda partners och regeringar för att säkerställa att de open source-vikter kan användas för att försvara, men inte för att utföra illvilliga attacker." Under tiden fortsätter RL-träningen, så API-modellen förändras löpande.
  3. 27 oktober: vikterna är planerade att släppas tillsammans med fullständiga arkitekturdetaljer, fler benchmark och Mistrals metod för efterträning.

Jag uppdaterar det här avsnittet när vikterna släpps.

Vad vi fortfarande inte vet om Mistral Large 4

Tills dess är mycket fortfarande öppet. Jag skriver detta på lanseringsdagen, så listan är lång:

  • Slutlig benchmarkprestanda: RL pågår fortfarande, så varje siffra ovan kan ändras. Mistral förväntar sig "stora och snabba förbättringar", men ingen har mätt det än.
  • Oberoende resultat för kodning, vision och kunskapsarbete: bortom AA Cyber Index och vals.ai har inget reproducerats.
  • Prissättning: tillkännagivandet och dokumentsidan motsäger varandra, och förhandsvisningspriser kan ändras.
  • Licensvillkor: du kan inte bygga en produkt på "öppna vikter" utan en licens.
  • Hårdvarukrav för självhystering: inte publicerade.
  • Fullständig arkitektur: utlovas med vikterna, vilket också kan förklara diskrepansen 49B kontra 52B aktiva parametrar.
  • Kontextfönster: 1M token enligt Mistrals dokumentation, 512K enligt vals.ai.
  • Slutlig säkerhetsutvärdering: rödlagstestning pågår genom oktober.

Slutsats

Mistral Large 4 är en gles modell med 1 biljon parametrar, 49 miljarder aktiva parametrar, multimodal inmatning och öppna vikter på väg. På lanseringsdagen ser vi att den är bästa modellen med öppna vikter på Harveys juridiska benchmark, men 32:a av 44 på Vals Index och bakom Kimi K3 på Mistrals eget kodningsdiagram.

Jag tror inte att benchmarkledarskap är Mistrals verkliga satsning ändå. Satsningen är att kapabla öppna vikter och självhystering är vad företag och myndigheter bryr sig mest om. Avslagsdatan inom cybersäkerhet är det tydligaste beviset hittills på att det här paketet löser ett problem som säkerhetsteam redan har.

27 oktober är datumet att hålla ögonen på. Då släpps vikterna, oberoende forskare kan köra den slutliga checkpointen själva, och Artificial Analysis och vals.ai kan testa modellen Mistral faktiskt släpper istället för en förhandsvisning som fortfarande tränas. Le Chonk lever upp till sitt lanseringsinlägg då, eller så gör den det inte.

För bakgrund om koncepten bakom MoE-modeller täcker vår kurs Introduktion till stora språkmodeller grunderna. För mer om Mistrals produkter, se vår bevakning av Mistral Forge, Mistral Large 3, Mistral Le Chat och Mistral Vibe 2.0, deras terminalbaserade kodningsagent.

FAQs

What is Mistral Large 4 (Le Chonk)?

Det är Mistrals nya flaggskepp, lanserat i offentlig förhandsvisning den 6 oktober 2026: en Mixture-of-Experts-modell med omkring 1 biljon totala parametrar och 49 miljarder aktiva per token. Den tar text och bilder, producerar text och har öppna vikter planerade till 27 oktober.

Why is it called Le Chonk?

Det är en blinkning till "Le Chaton Fat", en fiktiv modell med 24 biljoner parametrar som Mistral skämtsamt annonserade, och sedan raderade, i juni 2026. Skämtet spreds över AI-sociala medier, och när en verklig modell med en biljon parametrar kom följde namnet med.

What is Mistral Large 4 best at?

Dess starkaste oberoende resultat finns inom cybersäkerhet och juridiskt arbete. Den rankas bland de fem bästa av 18 modeller på Artificial Analysis Cyber Index och sexa av 75 på Harvey's Legal Agent Benchmark, först bland modeller med öppna vikter (båda per 6 oktober). På det breda Vals Index rankas den 32:a av 44, så vertikal styrka och övergripande prestanda berättar olika historier.

Is Mistral Large 4 open source?

Nej. Den har öppna vikter, vilket är något annat. Öppna vikter betyder att modellparametrarna är offentligt tillgängliga, men inte nödvändigtvis träningsdata, träningskod eller andra komponenter. Mistral har ännu inte publicerat licensvillkoren, så kontrollera dem innan du bygger en produkt på modellen.

When can I download Mistral Large 4 weights?

27 oktober 2026, enligt Axios. API:et är tillgängligt nu via Mistral Studio, men förhandsvisningen är fortfarande i förstärkningsinlärning, så de släppta vikterna kommer att skilja sig från det API:et levererar idag.

Ämnen
Artificiell intelligens

Lär dig med DataCamp

Kurs

Förstå artificiell intelligens

2 tim
427.3K
Lär dig grundläggande begrepp inom Artificial Intelligence, som machine learning, deep learning, NLP, generative AI och mer.
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow