Sari la conținutul principal

Mistral Large 4 (Le Chonk): Tot ce știm

Modelul open-weight cu un trilion de parametri al Mistral conduce la benchmark-urile de cybersecurity și juridic.
Actualizat 9 oct. 2026  · 15 min. citește

Descoperă cu AI

ChatGPTClaudePerplexity

Pe 6 octombrie 2026, Mistral a lansat o previzualizare publică pentru Mistral Large 4 (ML4), un model cu 1 trilion de parametri și 49 de miliarde activi, cu input text și imagine, și cu greutăți deschise promise până la finalul lunii. Este cel mai mare model construit vreodată de Mistral și a fost antrenat de la zero pe 3.800 de GPU-uri Nvidia Grace Blackwell în centrele de date europene proprii ale Mistral.

În cea mai mare parte a ultimului an, cele mai puternice modele open-weight au venit din laboratoare chineze (GLM, DeepSeek, Kimi, Qwen), în timp ce cele mai puternice modele, în general, au rămas închise în spatele API-urilor din SUA. Mistral vrea o a treia opțiune. Anunțul spune că ML4 „deja atinge o performanță competitivă cu cele mai puternice modele open-source la nivel global, depășind semnificativ orice model open-weight dezvoltat în SUA sau Europa.”

Tabloul este mai complicat decât lasă să se înțeleagă postarea de lansare. Mai jos acopăr arhitectura, benchmark-urile (separând ce a fost reprodus independent de ce nu), coding, viziune, cybersecurity, greutăți deschise și ce rămâne necunoscut. Dacă ai timp doar pentru o secțiune, alege cybersecurity.

Răspunsul pe scurt

Mistral Large 4 (Le Chonk) este un model open-weight cu 1 trilion de parametri, pe care Mistral îl prezintă drept cel mai puternic construit în afara Chinei, mai ales pentru cybersecurity, finanțe, juridic și grounding vizual. Evaluările independente susțin afirmațiile pe cybersecurity și juridic, plasează finanțele la mijlocul plutonului și clasează ML4 pe locul 32 din 44 de modele pe un indice agregat larg. API-ul este deja live, iar greutățile sunt programate pentru 27 octombrie.

Ce este Mistral Large 4 (Le Chonk)?

Varianta scurtă omite multe, așa că începem cu elementele de bază. ML4 este noul flagship Mistral și, în cuvintele Mistral, „cel mai mare și mai capabil model de până acum”. Le Chonk este porecla, deși textul de lansare Mistral inversează aranjamentul obișnuit: „Neoficial ML4, foarte oficial: le Chonk.”

Este un model Mixture-of-Experts (MoE) nativ multimodal. Cifrele headline sunt 1 trilion de parametri în total și 49 de miliarde activi per token, deși documentația modelului a Mistral listează cifre ușor diferite (1,05T total, 52B activi). Nicio sursă nu explică diferența. (De ce contează „activi” acoperim în secțiunea următoare.)

Mistral vizează ML4 pentru munca în enterprise: coding, cybersecurity, finanțe, juridic, producție și inginerie, și sarcini vizuale precum citirea desenelor tehnice sau a imaginilor satelitare.

Specificație

Detaliu

Parametri totali

1 trilion conform anunțului, 1,05T conform documentației

Parametri activi

49B conform anunțului, 52B conform documentației

Arhitectură

Mixture-of-Experts, hibrid instruct și reasoning

Input

Text și imagini

Output

Doar text

Fereastră de context

1M tokeni conform documentației, 512K conform vals.ai (nerezolvat)

Două rânduri contează cel mai mult pentru oricine planifică un deployment, și ambele sunt neclare: fereastra de context și licența. Înainte de a intra în cum funcționează modelul, însă, numele merită o explicație rapidă.

De ce se numește Le Chonk?

În iunie 2026, Mistral a postat un anunț satiric pentru „Le Chaton Fat”, un model fictiv cu 24 de trilioane de parametri, apoi l-a șters. Internetul a mers mai departe oricum, umflând specificațiile la sute de trilioane. Patru luni mai târziu, Mistral a livrat un model real cu un trilion de parametri, iar numele s-a ales cam singur. Asta e toată povestea. Să revenim la model.

Cum funcționează Mistral Large 4

Mistral nu a publicat încă detaliile arhitecturale complete (sunt promise odată cu greutățile), așa că această secțiune se limitează la ce a fost dezvăluit.

1 trilion de parametri, 49 de miliarde activi

Un model cu 1 trilion de parametri nu folosește toți cei 1 trilion de parametri pentru fiecare token. Modelele MoE direcționează fiecare token printr-un mic subset de subrețele „experți”, astfel încât calculul de inferență urmărește cei 49 de miliarde de parametri activi. Asta îl aduce mai aproape de un model dens de ~50B parametri decât de unul de 1T.

Ieftin de servit? Nu. Toți cei 1 trilion de parametri tot trebuie să stea undeva în memorie, deci găzduirea ML4 in-house cere infrastructură serioasă multi-GPU. Modelele MoE sunt de asemenea mai greu de servit cu latență mică decât modelele dense cu același număr de parametri activi. Mistral nu a publicat cerințele hardware, și m-ar mira ca multe echipe din afara marilor enterprise-uri și guvernelor să ruleze ele însele modelul complet.

Input multimodal

Acei parametri activi gestionează mai mult decât text. ML4 acceptă și imagini, deși returnează doar text. Mistral spune că „raționează puternic pe documente complexe, grafice și imagini naturale” și vizează industrii unde percepția vizuală contează, precum inginerie, producție și observație a Pământului. Demo-urile sunt toate industriale: inspectarea pieselor mecanice în desene tehnice, extragerea probelor din PDF-uri, scanarea imaginilor satelitare gigapixel pentru obiecte greu de găsit.

Peste 160 de limbi

Aceiași clienți industriali lucrează adesea peste granițe, aici intră în joc limbile. Mistral spune că o „parte semnificativă” a datelor de antrenament a fost multilingvă, acoperind peste 160 de limbi și fiecare limbă oficială a UE. Pentru o companie europeană care curtează guvernele europene, asta e o mare parte din pitch.

Infrastructura de antrenare

Pentru un pitch european, contează și unde a avut loc antrenarea. Potrivit Mistral, ML4 a fost antrenat de la zero pe 3.800 de GPU-uri Nvidia Grace Blackwell în propriile sale centre de date europene. Pierre Stock, VP of Science la Mistral, a oferit pentru TechCrunch o cifră rotunjită de 4.000 și a spus că asta e „de două până la trei ori mai puțin decât competitorii noștri chinezi.” Nimeni nu a verificat acea comparație.

Construcția de compute din spatele acestuia este publică de ceva vreme. În martie 2026, Mistral a strâns 830 de milioane $ datorie pentru a cumpăra 13.800 de GPU-uri Nvidia GB300 pentru un centru de date lângă Paris. Mistral nu spune dacă ML4 a fost antrenat pe acel cluster în mod specific, așa că nu voi lega cele două.

Un detaliu schimbă cum ar trebui citit fiecare benchmark din acest articol. Rularea de reinforcement learning (RL) este încă în desfășurare. RL este etapa post-antrenament în care modelul se îmbunătățește fiind punctat pe propriile încercări la sarcini, iar Mistral spune că runda sa folosește în prezent aproximativ 3.000 de GPU-uri, generează circa 33 de miliarde de tokeni pe zi și „nu dă semne de saturație”. Deci modelul la care poți apela prin API astăzi nu va fi modelul ale cărui greutăți se livrează pe 27 octombrie.

Benchmark-urile Mistral Large 4

Acea rulare RL neterminată este primul motiv să tratezi tot din această secțiune drept preliminar. Al doilea este că majoritatea cifrelor Mistral nu au fost reproduse independent, iar cele care au fost nu se potrivesc întotdeauna.

Evaluarea independentă la lansare intră în trei categorii:

  • Reprodus independent: Artificial Analysis (AA) Cyber Index, inclusiv componenta sa CyberGym-E2E, și cinci evaluări vals.ai, inclusiv Terminal-Bench 4.0.
  • Rulat de AA, dar încă nepublic: o notă de subsol pe graficele de coding ale Mistral spune că scorurile DeepSWE, Terminal-Bench și SWE-Atlas „folosesc cifre evaluate privat de Artificial Analysis înainte de lansarea publică a harness-ului.” Vor apărea pe Coding Agent Index al AA odată ce acel harness este lansat. Până atunci, nimeni în afară de AA și Mistral nu le poate verifica.
  • Doar Mistral: restul.

Acordă cea mai mare atenție ultimei coloane din tabel. Un benchmark poate fi construit de un grup independent, în timp ce scorul ML4 pe el rămâne doar o afirmație a Mistral.

Rezumat benchmark

Benchmark

Rezultat ML4

Competiție

Ce măsoară

DeepSWE v1.1

61,7%, rulat privat de AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (auto-raportat)

Software engineering pe orizont lung

Terminal-Bench 4.0

28,3% conform Mistral, 22,73% conform vals.ai

Locul 20 din 44 pe vals.ai

Fluxuri complexe în terminal

SWE-Atlas-QnA

59,4%, rulat privat de AA

Nepublicat

Înțelegerea unui repository

Coding Agent Index

49,8%, rulat privat de AA

În fața DeepSeek V4 Pro 0813 și Qwen3.8 Max

Compus din cele trei benchmark-uri de coding de mai sus

AutomationBench

59,9% conform Mistral

În fața Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 fluxuri de lucru în aplicații ca Gmail, Slack și Salesforce

AA-Briefcase

1.393 Elo, citat de Mistral ca AA

În fața DeepSeek V4 Pro

Muncă de cunoaștere pe orizont lung

Dense 200

42% conform Mistral

GPT-6 Astra 41%

Grounding vizual

AA Cyber Index

50%, top 5 din 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Găsirea și remedierea defectelor în software real

CyberGym-E2E

82%, #1 din 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Reproducerea și patch-uirea unei vulnerabilități reale

Cybench

93% conform Mistral

„Printre cele mai mari” pentru open weights, conform Mistral

40 de provocări din competiții de securitate

Finance Agent v2

54,68%

Locul 22 din 75, locul 7 din 32 open-weight

Sarcini pentru agenți financiari

Harvey's Legal Agent

15,83%, #6 din 75

#1 din 31 open-weight

Sarcini juridice autonome

KORA Benchmark

1,691 din 2 conform Mistral

Cel mai înalt dintre modelele deschise testate de Mistral

Comportament AI responsabil

B3 Attack Resistance

93,3% conform Mistral

„Nicio scoruri mai mari la competitori”, conform Mistral

Rezistență la prompt injection

Vals Index

48,05%, locul 32 din 44

Locul 9 din 16 open-weight

Agregat larg pe sarcini

Clasările la benchmark pentru Mistral 4

Citește ultimul rând în raport cu afirmația headline a Mistral. Pe indexul larg al vals.ai, ML4 ajunge pe locul 32 din 44 la general și pe 9 din 16 doar între modelele open-weight. E greu de împăcat cu „competitiv cu cele mai puternice modele open-source la nivel global”, cel puțin în agregat. Rezultatele pe verticale ale Mistral arată mult mai bine și nu sunt greșite. Doar că măsoară ceva mai îngust. Dacă decizi pe ce să construiești, verticala care te interesează contează mai mult decât orice headline.

Coding

Coding este locul unde apare prima oară diferența dintre headline și detaliu. Cifrele Mistral arată bine la prima vedere. Uită-te însă la graficul DeepSWE și vei vedea ceva ce textul nu menționează. Bara cea mai înaltă este Kimi K3, la 69%, cu șapte puncte peste ML4. ML4 îl depășește pe GLM-5.3 (62% versus 61%), dar un punct intră lejer în zgomotul alegerii de harness. Un „harness” este schela care învelește modelul în timpul unui benchmark agentic, adică uneltele, prompturile și de câte încercări dispune, iar pe graficul Mistral fiecare competitor a rulat într-un altul. Pe clasamentul live DeepSWE al Datacurve, care rulează fiecare model în același setup, GLM-5.3 și Kimi K3 ating ambele 69%, iar DeepSeek V4 Pro atinge 63%. ML4 nu este listat încă.

Terminal-Bench arată același efect din direcția opusă. Mistral raportează 28,3%, rularea independentă a vals.ai a obținut 22,73%. Nu citesc asta ca pe o umflare a cifrelor de către cineva, ci ca pe un reminder că un singur număr dintr-un singur setup nu e un clasament.

Evaluările umane sunt mai interesante. Într-o evaluare „în orb” comandată de Mistral la Surge AI, analiști profesioniști au notat output-urile de coding de la 1 la 5. ML4 s-a clasat al doilea din cinci (3,74), înaintea GLM-5.3 (3,60), Kimi K3 (3,59) și GLM-5.2 (3,40), și mult în spatele lui Claude Opus 5 (4,22). Observă Kimi K3: cu șapte puncte peste ML4 la DeepSWE, dar în spatele lui la preferința umană. A trece teste și a scrie cod pe placul oamenilor nu sunt aceeași abilitate. (Și acesta e Opus 5, nu mai noul 5.5, deci diferența față de cel mai bun model închis e probabil mai mare.)

O a doua evaluare internă Mistral tulbură și mai mult apele. A constatat că ML4 este „pe picior de egalitate sau aproape” de GLM-5.3 la coding și finanțe, fiind preferat doar în CAD și STEM. Aș spune că cele două sunt cam la egalitate.

Finanțe

Finanțele sunt mai simple, mai ales pentru că există un număr independent de referință. ML4 obține 54,68% pe Finance Agent v2 pe vals.ai, ceea ce îl clasează pe locul 22 din 75 la general și pe 7 din 32 între modelele open-weight. Solid la mijloc. Afirmația Mistral e de fapt mai îngustă: că ML4 îl depășește pe GPT-6 Astra la acest benchmark.

Mistral raportează de asemenea rezultate puternice pe FinWorkBench, care testează dacă un model poate construi și edita foi de calcul pentru sarcini reale de finanțe și contabilitate. Aceste cifre vin din graficele Mistral și nu au fost reproduse în altă parte.

Juridic

Juridicul arată mult mai bine pe hârtie. Pe Harvey's Legal Agent Benchmark, ML4 se clasează pe locul 6 din 75 și pe primul loc dintre 31 de modele open-weight. Scorul său este 15,83%.

Citește acel număr de două ori. Locul șase în lume la muncă juridică autonomă înseamnă finalizarea cu succes a aproximativ unei sarcini din șase. Benchmark-ul e greu, iar clasarea e reală, dar nimeni nu ar trebui să înțeleagă asta ca „ML4 poate face muncă juridică nesupravegheată.” Niciun model nu poate încă.

Viziune și grounding vizual

Viziunea e cazul opus: afirmații îndrăznețe, fără date independente încă. Afirmația headline este despre grounding vizual, adică localizarea unor obiecte sau regiuni specifice într-o imagine pornind de la o descriere text, gen „găsește sudura crăpată în acest desen” mai degrabă decât „descrie această imagine”. Mistral raportează 42% pe Dense 200, puțin în fața lui GPT-6 Astra la 41%. Nu mi-aș baza o decizie de achiziție pe un punct.

Mistral spune că ML4 performează bine și pe ChartQA Pro și GDP.pdf, un benchmark de raționare pe documente. Niciunul dintre rezultatele de viziune nu a fost încă reprodus independent. Cazurile de utilizare evidențiate de Mistral sunt în mare parte industriale, de la imagini satelitare pentru răspuns la dezastre la inspectarea desenelor tehnice și scanarea imaginilor geospațiale mari.

Cât de bun este Mistral Large 4 pentru coding?

Revenim la coding, deoarece asta va folosi majoritatea cititorilor. Este competitiv între modelele open-weight, dar nu cel mai bun model de coding disponibil și nici măcar cel mai bun model deschis de pe propriul grafic al Mistral. Nu repet cifrele. Așa se traduc ele în munca pe care i-ai da-o:

  • Remedierea problemelor într-un codebase real (software engineering agentic): utilizabil, dar Kimi K3 pare mai puternic.
  • Înțelegerea unui repository mare: promițător, deși se bazează pe un singur scor rulat privat.
  • Rulări agentice lungi, de mai multe ore: setup-ul de RL al Mistral e construit pentru traiectorii lungi, dar nimeni nu a testat asta independent încă.
  • Muncă intensă în terminal: cel mai slab semnal independent de până acum.

Aș aștepta intrarea ML4 pe Coding Agent Index public al AA, așteptată după livrarea greutăților, înainte de a-l numi mai mult decât o opțiune open-weight credibilă.

Ce adaugă greutățile deschise aici nu are legătură cu scorurile. O companie poate rula ML4 pe propria infrastructură și să nu trimită niciodată cod sursă proprietar către un API extern. Pentru agenți de coding pe codebase-uri confidențiale, doar asta poate decide alegerea.

Mistral Large 4 pentru cybersecurity

Aceasta este cea mai îndrăzneață afirmație a Mistral. Pe Artificial Analysis Cyber Index, evaluarea independentă AA a cât de bine găsesc, reproduc și repară modelele vulnerabilități în software real, ML4 obține 50%. Asta îl plasează în top 5 dintre cele 18 modele testate. Doar Grok 4.7, MiMo-V2.6-Pro și GPT-6 Luna au scoruri mai mari, iar GLM-5.3 Flash îl egalează. Mistral spune că ML4 „conduce modelele open-weight dezvoltate în afara Chinei la mare distanță”, iar graficul AA este în concordanță cu asta.

Elementul de vârf este CyberGym-E2E, una dintre cele trei componente ale indexului. Cere modelului să reproducă o vulnerabilitate reală în software open-source (un „CVE”, adică o defecțiune de securitate catalogată public) și apoi să o repare. ML4 obține 82%, primul dintre cele 18 modele testate de AA. Mistral mai raportează 93% pe Cybench, un set de 40 de provocări din competiții de securitate, deși nimeni nu a reprodus acel scor.

Datele despre refuzuri sunt de asemenea interesante. Pe CyberGym-E2E, graficul AA arată că Claude Opus 5.5 a fost blocat din motive de siguranță pentru aproximativ 96% dintre sarcini, iar GPT-6 Astra a fost blocat pentru 100%. Aceste modele au scoruri aproape de zero pentru că sarcina este refuzată, deci scorurile lor nu spun nimic despre ce ar putea face de fapt. Dacă refuzul este politica corectă e o discuție separată.

Și acesta este pitch-ul central al Mistral. Munca de securitate defensivă începe adesea cu reproducerea unei defecțiuni pentru a dovedi că există, iar echipele de securitate trebuie să facă asta la volum, scanând codebase-uri mari și triind sute de constatări. Un model care refuză mare parte din acea încărcătură, sau al cărui furnizor poate schimba regulile de moderare în plin incident, e o vulnerabilitate. Argumentul declarat al Mistral este că rularea ML4 pe propria infrastructură îți pune comportamentul sub controlul tău. Dezbaterea mai largă despre măsurile de siguranță AI care blochează munca defensivă legitimă este în curs de ceva vreme.

Acum partea proastă: Odată ce greutățile devin publice, atacatorii obțin aceeași capabilitate. Indexul AA este în mod deliberat defensiv (modelele lucrează pe cod sursă și nu li se cere niciodată să construiască un exploit funcțional), deci un scor de 82% la reproducere nu înseamnă 82% capabilitate ofensivă. Totuși, distanța de la „reproduce un crash” la „armează-l” nu este infinită. Mistral petrece cele trei săptămâni dinainte de lansare pentru red-teaming-ul modelului, adică încearcă să-l facă să se poarte greșit intenționat, împreună cu „lideri în cybersecurity, parteneri verificați și autorități de stat.”

De ce contează open weights pentru Mistral Large 4

Cazul pentru cybersecurity este de fapt un argument pentru open weights și merge mult dincolo de securitate. „Poți descărca modelul” este prea puțin spus.

O bancă ce rulează ML4 pe propriile servere nu trimite niciodată date de clienți către Mistral. O agenție guvernamentală controlează întregul mediu de deployment. O echipă de securitate poate ajusta comportamentul modelului fără a aștepta politica de moderare a unui furnizor, ceea ce, după secțiunea anterioară, nu e o preocupare ipotetică. Iar dacă un furnizor cade sau retrage o versiune de model, deployment-urile self-hosted continuă să ruleze.

Open weights fac și personalizarea practică. Am acoperit Mistral Forge în aprilie, iar Mistral spune că ML4 „folosește același mediu de antrenare, personalizare și RL” pe care îl oferă clienților enterprise prin Forge. Pentru organizațiile care vor să fine-tune ML4 pe propriile date, Forge este ruta evidentă.

Un cuvânt rapid despre termeni. Open-weight înseamnă că parametrii antrenați ai modelului sunt disponibili public. Nu înseamnă că datele de antrenament, codul de antrenament sau altceva sunt publicate sub o licență open-source. Pagina modelului a Mistral descrie ML4 ca open-weight, dar nu a publicat termenii licenței. Până atunci, utilizarea comercială, drepturile de fine-tuning și redistribuirea sunt întrebări deschise. Mă frustrează puțin să scriu „verifică licența” despre un model al cărui pitch este controlul, dar aici ne aflăm.

Mistral Large 4 și efortul Europei pentru suveranitate în AI

Controlul este de asemenea central în pitch-ul politic al Mistral. Președintele francez Macron a descris abordarea Mistral drept „a treia cale în AI”. Primele două căi sunt modelele închise din SUA, capabile dar supuse legii americane și politicilor furnizorului, și modelele deschise din China, adesea capabile, dar o grijă privind rezidența datelor și geopolitica pentru instituțiile europene. Oferta Mistral este greutăți deschise, infrastructură europeană și lege europeană.

Asta include un deployment european pe care Mistral spune că îl operează „cap-coadă, independent de alți furnizori de servicii digitale și sub legea europeană.” Dacă ești sub GDPR sau reguli sectoriale de rezidență a datelor, verifică afirmația în raport cu acordurile de prelucrare a datelor ale Mistral înainte de a te baza pe ea.

Mistral are și banii pentru a susține pitch-ul. Mistral numește ML4 „primul reper pe foaia de parcurs finanțată de runda noastră de Seria D de 3 miliarde €”, o rundă condusă de Samsung la o evaluare de 21 miliarde €, pe care Mistral o descrie drept cea mai mare rundă de equity strânsă vreodată de o companie europeană de tehnologie. Majoritatea merge în capacitate de centre de date europene.

Deci poate Europa produce modele de frontieră oferind organizațiilor mai mult control asupra locului și modului în care rulează acele modele? ML4 este un punct de date puternic pentru jumătatea cu controlul. Pentru jumătatea de frontieră, locul 32 din 44 pe Vals Index spune că Europa nu a ajuns încă acolo.

Mistral Large 4 vs. alte modele open-weight

Dacă Europa nu e acolo încă, e corect să întrebi cine este și cum se compară ML4 cu aceștia. Nu pun scorurile fiecărui model într-un singur tabel, deoarece vin din setup-uri diferite și un tabel combinat ar sugera că sunt comparabile. Nici numărul de parametri nu e un proxy pentru capabilitate.er. Tabelul de mai jos doar le poziționează:

Model

Arhitectură

Greutăți disponibile

Punct forte

Origine

Mistral Large 4

MoE, 1T total / 49B activi

27 octombrie (planificat)

Cybersecurity, juridic (susținute independent)

Franța

GLM-5.3

Nedezvăluit

Da

Coding, STEM

China

DeepSeek V4 Pro

MoE

Da

Coding, matematică

China

Reflection Beam

Nedezvăluit

Da

Raționament general

SUA

Qwen3.8 Max

Nedezvăluit

Neconfirmat

Multilingv, coding

China

Mistral Large 4 vs. GLM-5.3

Comparația care contează cel mai mult, deoarece GLM-5.3 este unul dintre cele mai puternice modele deschise chineze. După cum am acoperit la coding, sunt la un punct distanță pe graficul Mistral, evaluările umane sunt împărțite, iar GLM-5.3 atinge 69% pe clasamentul live unde ML4 nu a fost testat. Spune-i remiză până când clasamentele independente le includ pe ambele.

Mistral Large 4 vs. DeepSeek V4 Pro

ML4 câștigă fiecare comparație publicată de Mistral (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), dar niciuna nu e confirmată independent, iar DeepSeek V4 Pro atinge 63% pe clasamentul live DeepSWE, peste 62% al ML4. Nu există un head-to-head publicat pe finanțe.

Mistral Large 4 vs. Reflection Beam

Reflection Beam este celălalt pretendent open-weight occidental, ceea ce îl face testul cel mai direct al afirmației Mistral „cel mai bun în afara Chinei”. Datele sunt puține. Graficul DeepSWE al Mistral listează Beam la 44%, aproape 18 puncte sub ML4, dar acesta e un număr auto-raportat pus lângă un scor rulat de AA, așa că nu m-aș baza pe diferență. Reflection nu a dezvăluit dimensiunea lui Beam, deci nici comparația de scară nu e posibilă. ML4 are totuși input multimodal mai larg și dovezi publicate mult mai puternice pe cybersecurity.

Când poți folosi Mistral Large 4?

Nu trebuie să aștepți ca aceste comparații să se așeze înainte să încerci ML4. Iată rollout-ul de până acum:

  1. 6 octombrie: a început previzualizarea publică. Oricine poate apela mistral-large-4 prin Mistral Studio.
  2. În timpul previzualizării: lideri în cybersecurity, parteneri verificați și autorități de stat primesc o versiune cu „moderare redusă și capabilități cyber extinse” pentru red-teaming. Pierre Stock a spus pentru TechCrunch că Mistral va „lucra cu parteneri de încredere și guverne pentru a se asigura că greutățile open source pot fi folosite pentru a apăra, dar nu pentru a [desfășura] atacuri malițioase.” Între timp, antrenarea RL continuă, astfel încât modelul din API se schimbă în permanență.
  3. 27 octombrie: greutățile sunt programate să fie livrate împreună cu detalii arhitecturale complete, mai multe benchmark-uri și metodologia de post-antrenament a Mistral.

Voi actualiza această secțiune când se livrează greutățile.

Ce încă nu știm despre Mistral Large 4

Până atunci, multe rămân deschise. Scriu asta în ziua lansării, așa că lista e lungă:

  • Performanța finală la benchmark: RL încă rulează, deci orice scor de mai sus se poate schimba. Mistral se așteaptă la „îmbunătățiri mari și rapide”, dar nimeni nu a măsurat asta încă.
  • Rezultate independente la coding, viziune și muncă de cunoaștere: dincolo de AA Cyber Index și vals.ai, nu s-a reprodus nimic.
  • Prețuri: anunțul și pagina de documentație nu se potrivesc, iar tarifele din preview s-ar putea să nu rămână.
  • Termenii licenței: nu poți construi un produs pe „open-weight” fără o licență.
  • Cerințe hardware pentru self-hosting: nepublicate.
  • Arhitectura completă: promisă odată cu greutățile, ceea ce ar putea explica și discrepanța 49B vs 52B parametri activi.
  • Fereastra de context: 1M tokeni conform documentației Mistral, 512K conform vals.ai.
  • Evaluarea finală de siguranță: red-teaming-ul rulează până în octombrie.

Concluzie

Mistral Large 4 este un model rarifiat cu 1 trilion de parametri, cu 49 de miliarde activi, input multimodal și greutăți deschise pe drum. În ziua lansării vedem că este cel mai bun model open-weight pe benchmark-ul juridic al lui Harvey, dar pe locul 32 din 44 pe Vals Index și în urma lui Kimi K3 pe graficul de coding al Mistral.

Nu cred că leadership-ul pe benchmark-uri este pariul real al Mistral. Pariul este că greutățile deschise capabile și self-hosting-ul sunt ceea ce contează cel mai mult pentru enterprise-uri și guverne. Datele despre refuzuri în cybersecurity sunt cea mai clară dovadă de până acum că acest pachet rezolvă o problemă pe care echipele de securitate o au deja.

27 octombrie este data de urmărit. Atunci se livrează greutățile, cercetătorii independenți pot rula singuri checkpoint-ul final, iar Artificial Analysis și vals.ai pot testa modelul pe care Mistral chiar îl lansează, în locul unei previzualizări care încă se antrenează. Le Chonk fie își confirmă postarea de lansare atunci, fie nu.

Pentru context despre conceptele din spatele modelelor MoE, cursul nostru Introduction to Large Language Models acoperă elementele de bază. Pentru mai multe despre produsele Mistral, vezi materialele noastre despre Mistral Forge, Mistral Large 3, Mistral Le Chat și Mistral Vibe 2.0, agentul său de coding în terminal.

Întrebări frecvente

Ce este Mistral Large 4 (Le Chonk)?

Este noul flagship al Mistral, lansat în previzualizare publică pe 6 octombrie 2026: un model Mixture-of-Experts cu aproximativ 1 trilion de parametri în total și 49 de miliarde activi per token. Primește text și imagini, produce text și are greutăți deschise planificate pentru 27 octombrie.

De ce se numește Le Chonk?

Este o trimitere la „Le Chaton Fat”, un model fictiv cu 24 de trilioane de parametri pe care Mistral l-a anunțat în glumă, apoi l-a șters, în iunie 2026. Gluma s-a răspândit în social media AI, iar când a apărut un model real cu un trilion de parametri, numele a urmat.

La ce este cel mai bun Mistral Large 4?

Cele mai solide rezultate independente sunt în cybersecurity și muncă juridică. Se clasează în top 5 din 18 modele pe Artificial Analysis Cyber Index și pe locul 6 din 75 pe Harvey's Legal Agent Benchmark, primul dintre modelele open-weight (ambele la 6 octombrie). Pe Vals Index, se clasează pe locul 32 din 44, așa că punctele forte pe verticale și performanța generală spun povești diferite.

Este Mistral Large 4 open source?

Nu. Este open-weight, ceea ce e diferit. Open-weight înseamnă că parametrii modelului sunt disponibili public, dar nu neapărat datele de antrenament, codul de antrenament sau alte componente. Mistral nu a publicat încă termenii licenței, așa că verifică-i înainte de a construi un produs pe model.

Când pot descărca greutățile Mistral Large 4?

27 octombrie 2026, potrivit Axios. API-ul este disponibil acum prin Mistral Studio, dar previzualizarea este încă în reinforcement learning, așa că greutățile lansate vor diferi de ceea ce servește API-ul astăzi.

Subiecte
Inteligență artificială

Învață cu DataCamp

Curs

Înțelegerea Inteligenței Artificiale

2 ore
427.3K
Învață conceptele de bază ale Inteligenței Artificiale, precum machine learning, deep learning, NLP, generative AI și altele.
Vezi detaliiRight Arrow
Începe Cursul
Afișează mai multRight Arrow