Vai al contenuto principale

Mistral Large 4 (Le Chonk): tutto quello che sappiamo

Il modello open-weight da un trilione di parametri di Mistral è in testa nei benchmark di cybersecurity e legale.
Aggiornato 9 ott 2026  · 15 min leggi

Scopri con l'IA

ChatGPTClaudePerplexity

Il 6 ottobre 2026, Mistral ha lanciato una preview pubblica di Mistral Large 4 (ML4), un modello da 1 trilione di parametri con 49 miliardi di parametri attivi, input di testo e immagini e pesi aperti promessi entro la fine del mese. È il modello più grande che Mistral abbia mai costruito, addestrato da zero su 3.800 GPU Nvidia Grace Blackwell nei data center europei di Mistral.

Per gran parte dell'ultimo anno, i modelli open-weight più forti sono usciti da laboratori cinesi (GLM, DeepSeek, Kimi, Qwen), mentre i modelli complessivamente più forti sono rimasti chiusi dietro API statunitensi. Mistral punta a una terza via. Nel suo annuncio afferma che ML4 "raggiunge già prestazioni competitive con i modelli open-source più forti a livello globale, superando nettamente qualsiasi modello open-weight sviluppato negli Stati Uniti o in Europa".

Il quadro è più complesso di quanto lasci intendere il post di lancio. Qui sotto, tratto architettura, benchmark (separando ciò che è stato riprodotto indipendentemente da ciò che non lo è), coding, visione, cybersecurity, open weights e ciò che resta ancora ignoto. Se hai tempo per una sola sezione, leggi quella sulla cybersecurity.

La risposta breve

Mistral Large 4 (Le Chonk) è un modello open-weight da 1 trilione di parametri che Mistral presenta come il più forte sviluppato fuori dalla Cina, in particolare per cybersecurity, finanza, ambito legale e visual grounding. Valutazioni indipendenti confermano le affermazioni su cybersecurity e legale, collocano la finanza a metà classifica e posizionano ML4 al 32° posto su 44 modelli in un indice aggregato ampio. L'API è già attiva e i pesi sono attesi per il 27 ottobre.

Che cos'è Mistral Large 4 (Le Chonk)?

Questa versione breve lascia fuori molto, quindi partiamo dalle basi. ML4 è il nuovo flagship di Mistral e, nelle parole di Mistral, il suo "modello più grande e capace di sempre". Le Chonk è il soprannome, anche se il testo di lancio di Mistral ribalta il solito schema: "Ufficiosamente ML4, molto ufficialmente: le Chonk".

È un modello Mixture-of-Experts (MoE) nativamente multimodale. I numeri in evidenza sono 1 trilione di parametri totali e 49 miliardi attivi per token, anche se la stessa documentazione del modello di Mistral riporta cifre leggermente diverse (1,05T totali, 52B attivi). Nessuna delle due fonti spiega la discrepanza. (Perché "attivi" conta lo vediamo nella sezione successiva.)

Mistral punta ML4 al lavoro enterprise: coding, cybersecurity, finanza, legale, manifattura e ingegneria, e compiti visivi come la lettura di disegni tecnici o immagini satellitari.

Specifiche

Dettagli

Parametri totali

1 trilione secondo l'annuncio, 1,05T secondo la docs

Parametri attivi

49B secondo l'annuncio, 52B secondo la docs

Architettura

Mixture-of-Experts, ibrido instruct e reasoning

Input

Testo e immagini

Output

Solo testo

Finestra di contesto

1M token secondo la docs, 512K secondo vals.ai (da chiarire)

Due righe contano più di tutte per chi pianifica un deployment, e entrambe sono in sospeso: la finestra di contesto e la licenza. Prima di entrare in come funziona il modello, però, il nome merita una breve spiegazione.

Perché si chiama Le Chonk?

A giugno 2026, Mistral ha pubblicato un annuncio satirico per "Le Chaton Fat", un modello fittizio da 24 trilioni di parametri, poi lo ha cancellato. Internet ha continuato comunque, gonfiando le specifiche a centinaia di trilioni. Quattro mesi dopo, Mistral ha spedito un vero modello da un trilione di parametri, e il nome si è praticamente scelto da solo. Tutto qui. Torniamo al modello.

Come funziona Mistral Large 4

Mistral non ha ancora pubblicato i dettagli architetturali completi (promessi insieme ai pesi), quindi questa sezione si limita a quanto divulgato.

1 trilione di parametri, 49 miliardi attivi

Un modello da 1 trilione di parametri non usa tutti e 1 trilione di parametri su ogni token. I modelli MoE instradano ciascun token attraverso un piccolo sottoinsieme di sotto-reti "esperte", quindi il calcolo in inferenza segue i 49 miliardi di parametri attivi. Questo lo avvicina più a un modello denso da ~50B parametri che a uno da 1T.

Economico da servire, dunque? No. Tutti e 1 trilione di parametri devono comunque risiedere in memoria da qualche parte, quindi l'auto-hosting di ML4 richiede un'infrastruttura multi-GPU seria. I modelli MoE sono anche più difficili da servire a bassa latenza rispetto ai modelli densi con lo stesso numero di parametri attivi. Mistral non ha pubblicato i requisiti hardware, e mi sorprenderebbe se molti team al di fuori di grandi imprese e governi eseguissero il modello completo in proprio.

Input multimodale

Quei parametri attivi gestiscono più del testo. ML4 accetta anche immagini, anche se restituisce solo testo. Mistral afferma che "ragiona potentemente su documenti complessi, grafici e immagini naturali" e punta a settori in cui la percezione visiva conta, come ingegneria, manifattura e osservazione della Terra. Le demo sono tutte industriali: ispezione di parti meccaniche in disegni tecnici, estrazione di evidenze da PDF, scansione di immagini satellitari gigapixel per oggetti difficili da individuare.

Oltre 160 lingue

Gli stessi clienti industriali spesso lavorano oltre confine, ed è qui che entra in gioco la lingua. Mistral afferma che una "quota significativa" dei dati di training era multilingue, coprendo più di 160 lingue e tutte le lingue ufficiali dell'UE. Per un'azienda europea che corteggia governi europei, è una parte importante dell'argomentazione.

Infrastruttura di training

Per un messaggio europeo, conta anche dove è avvenuto l'addestramento. Secondo Mistral, ML4 è stato addestrato da zero su 3.800 GPU Nvidia Grace Blackwell nei propri data center europei. Pierre Stock, VP of Science di Mistral, ha dato a TechCrunch una cifra arrotondata di 4.000 e ha detto che sono "due o tre volte meno rispetto ai nostri concorrenti cinesi". Nessuno ha verificato quel confronto.

La costruzione dell'infrastruttura di calcolo dietro a questo è pubblica da un po'. A marzo 2026, Mistral ha raccolto 830 milioni di dollari di debito per acquistare 13.800 GPU Nvidia GB300 per un data center vicino a Parigi. Mistral non dice se ML4 sia stato addestrato su quel cluster specifico, quindi non collegherò le due cose.

Un dettaglio cambia come dovresti leggere ogni benchmark in questo articolo. La corsa di reinforcement learning (RL) è ancora in corso. L'RL è la fase post-training in cui il modello migliora venendo valutato sui propri tentativi ai compiti, e Mistral afferma che la sua corsa attualmente usa circa 3.000 GPU, genera circa 33 miliardi di token al giorno e "non mostra segni di saturazione". Quindi il modello chiamabile via API oggi non sarà il modello i cui pesi verranno rilasciati il 27 ottobre.

Benchmark di Mistral Large 4

Quella corsa RL incompiuta è il primo motivo per trattare tutto in questa sezione come preliminare. Il secondo è che la maggior parte dei numeri di Mistral non è stata riprodotta indipendentemente, e quelli che lo sono non sempre coincidono.

La valutazione indipendente al lancio rientra in tre categorie:

  • Riprodotti indipendentemente: l'AA Cyber Index di Artificial Analysis (AA), incluso il componente CyberGym-E2E, e cinque valutazioni di vals.ai, tra cui Terminal-Bench 4.0.
  • Eseguiti da AA, ma non ancora pubblici: una nota a piè di pagina nei grafici di coding di Mistral dice che i punteggi DeepSWE, Terminal-Bench e SWE-Atlas "usano i numeri valutati privatamente da Artificial Analysis prima del lancio pubblico dell'harness". Appariranno sul Coding Agent Index di AA una volta rilasciato quell'harness. Fino ad allora, nessuno al di fuori di AA e Mistral può verificarli.
  • Solo Mistral: tutto il resto.

Presta più attenzione all'ultima colonna della tabella. Un benchmark può essere costruito da un gruppo indipendente mentre il punteggio di ML4 su di esso è ancora solo un'affermazione di Mistral.

Riepilogo benchmark

Benchmark

Risultato ML4

Competitor

Che cosa misura

DeepSWE v1.1

61,7%, eseguito privatamente da AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (autoriportato)

Software engineering a lungo orizzonte

Terminal-Bench 4.0

28,3% secondo Mistral, 22,73% secondo vals.ai

20° su 44 su vals.ai

Workflow complessi da terminale

SWE-Atlas-QnA

59,4%, eseguito privatamente da AA

Non pubblicato

Comprensione di repository

Coding Agent Index

49,8%, eseguito privatamente da AA

Davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max

Composito dei tre benchmark di coding sopra

AutomationBench

59,9% secondo Mistral

Davanti a Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 workflow business in app come Gmail, Slack e Salesforce

AA-Briefcase

1.393 Elo, citato da Mistral come AA

Davanti a DeepSeek V4 Pro

Knowledge work a lungo orizzonte

Dense 200

42% secondo Mistral

GPT-6 Astra 41%

Visual grounding

AA Cyber Index

50%, top 5 su 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Trovare e correggere falle in software reale

CyberGym-E2E

82%, #1 su 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Riprodurre e patchare una vulnerabilità reale

Cybench

93% secondo Mistral

"Tra i più alti" per open weights, secondo Mistral

40 challenge di competizioni di sicurezza

Finance Agent v2

54,68%

22° su 75, 7° su 32 open-weight

Compiti di agenti finanziari

Harvey's Legal Agent

15,83%, #6 su 75

#1 su 31 open-weight

Compiti legali autonomi

KORA Benchmark

1,691 su 2 secondo Mistral

Il più alto tra i modelli open testati da Mistral

Comportamento di AI responsabile

B3 Attack Resistance

93,3% secondo Mistral

"Nessun punteggio più alto tra i competitor", secondo Mistral

Resistenza a prompt injection

Vals Index

48,05%, 32° su 44

9° su 16 open-weight

Ampio aggregato su vari compiti

Classifiche dei benchmark di Mistral 4

Leggi l'ultima riga insieme all'affermazione principale di Mistral. Nell'indice ampio di vals.ai, ML4 si piazza 32° su 44 in totale e 9° su 16 tra i soli modelli open-weight. Difficile conciliarlo con "competitivo con i modelli open-source più forti a livello globale", almeno in aggregato. I risultati verticali di Mistral sono molto migliori, e non sono sbagliati. Semplicemente misurano qualcosa di più ristretto. Se stai decidendo se costruire su ML4, il verticale che ti interessa conta più di entrambi i titoli.

Coding

Il coding è dove il divario tra titolo e dettaglio emerge per primo. I numeri di Mistral sembrano buoni a colpo d'occhio. Guarda però il grafico di DeepSWE e vedrai qualcosa che il testo non menziona mai. La barra più alta è Kimi K3, al 69%, sette punti avanti a ML4. ML4 supera di poco GLM-5.3 (62% contro 61%), ma un punto rientra ampiamente nel rumore dovuto alla scelta dell'harness. Un "harness" è l'impalcatura che avvolge un modello durante un benchmark agentico, ossia gli strumenti, i prompt e quante prove ottiene, e nel grafico di Mistral ogni concorrente è stato eseguito in un harness diverso. Nella classifica live di DeepSWE di Datacurve, che esegue ogni modello nello stesso setup, GLM-5.3 e Kimi K3 raggiungono entrambi il 69% e DeepSeek V4 Pro raggiunge il 63%. ML4 non è ancora elencato.

Terminal-Bench mostra lo stesso effetto dalla direzione opposta. Mistral riporta 28,3%, l'esecuzione indipendente di vals.ai ha ottenuto 22,73%. Non lo leggo come un'inflazione da parte di qualcuno, solo come promemoria che un numero da un solo setup non fa classifica.

Le valutazioni umane sono più interessanti. In una valutazione alla cieca commissionata da Mistral a Surge AI, annotatori professionisti hanno valutato output di coding da 1 a 5: ML4 è arrivato secondo su cinque (3,74), davanti a GLM-5.3 (3,60), Kimi K3 (3,59) e GLM-5.2 (3,40), e nettamente dietro Claude Opus 5 (4,22). Nota Kimi K3: sette punti avanti a ML4 su DeepSWE, dietro di esso sulla preferenza umana. Superare test e scrivere codice che piace leggere non sono la stessa abilità. (E quello è Opus 5, non il più recente 5.5, quindi il divario dal miglior modello closed probabilmente è più ampio.)

Una seconda valutazione interna di Mistral complica ulteriormente: ha rilevato ML4 "alla pari o vicino" a GLM-5.3 in coding e finanza, e preferito solo in CAD e STEM. Le considererei più o meno alla pari.

Finanza

La finanza è più semplice, soprattutto perché c'è un numero indipendente a cui ancorarsi. ML4 ottiene il 54,68% su Finance Agent v2 su vals.ai, che lo classifica 22° su 75 in totale e 7° su 32 tra i modelli open-weight. Solidamente a metà classifica. L'affermazione effettiva di Mistral è più ristretta: che ML4 batte GPT-6 Astra su questo benchmark.

Mistral riporta anche risultati solidi su FinWorkBench, che testa se un modello sa creare e modificare fogli di calcolo per compiti reali di finanza e contabilità. Quei numeri provengono dai grafici di Mistral e non sono stati riprodotti altrove.

Legale

Il legale appare molto meglio sulla carta. Sul benchmark Legal Agent di Harvey, ML4 è 6° su 75 e primo tra 31 modelli open-weight. Il suo punteggio è 15,83%.

Leggi quel numero due volte. Il sesto posto al mondo nel lavoro legale autonomo significa completare circa un compito su sei. Il benchmark è difficile e la classifica è reale, ma nessuno dovrebbe interpretarlo come "ML4 può svolgere lavoro legale senza supervisione". Nessun modello può, per ora.

Visione e visual grounding

La visione è il caso opposto: affermazioni audaci, nessun dato indipendente per ora. L'affermazione principale riguarda il visual grounding, cioè localizzare oggetti o regioni specifiche in un'immagine a partire da una descrizione testuale, tipo "trova la saldatura crepata in questo disegno" invece di "descrivi questa immagine". Mistral riporta 42% su Dense 200, appena sopra GPT-6 Astra al 41%. Non baserei una decisione d'acquisto su un punto.

Mistral dice che ML4 si comporta bene anche su ChartQA Pro e GDP.pdf, un benchmark di ragionamento su documenti. Nessuno dei risultati di visione è stato ancora riprodotto indipendentemente. I casi d'uso che Mistral evidenzia sono per lo più industriali, dalle immagini satellitari per la risposta ai disastri all'ispezione di disegni tecnici e alla scansione di grandi immagini geospaziali.

Quanto è valido Mistral Large 4 per il coding?

Torniamo al coding, dato che è ciò per cui la maggior parte dei lettori userà effettivamente ML4. È competitivo tra i modelli open-weight, ma non è il miglior modello di coding disponibile, e nemmeno il miglior open sul grafico di Mistral. Non ripeterò i numeri. Ecco come si traducono nel lavoro che gli affideresti:

  • Correzione di problemi in un codebase reale (software engineering agentico): utilizzabile, ma Kimi K3 sembra più forte.
  • Comprensione di un repository ampio: promettente, anche se si basa su un solo punteggio eseguito privatamente.
  • Run agentici lunghi, di più ore: il setup RL di Mistral è costruito per traiettorie lunghe, ma nessuno lo ha ancora testato indipendentemente.
  • Lavoro intensivo da terminale: il segnale indipendente più debole finora.

Aspetterei l'ingresso di ML4 nel Coding Agent Index pubblico di AA, previsto dopo il rilascio dei pesi, prima di definirlo più di un'opzione open-weight credibile.

Quello che gli open weights aggiungono qui non ha nulla a che fare con i punteggi. Un'azienda può eseguire ML4 sulla propria infrastruttura senza mai inviare codice proprietario a un'API esterna. Per agenti di coding su codebase riservati, questo da solo può determinare la scelta.

Mistral Large 4 per la cybersecurity

Questa è l'affermazione più audace di Mistral. Sull' Artificial Analysis Cyber Index, la valutazione indipendente di AA su quanto bene i modelli trovino, riproducano e patchino vulnerabilità in software reale, ML4 ottiene il 50%. Questo lo colloca nella top 5 dei 18 modelli testati. Solo Grok 4.7, MiMo-V2.6-Pro e GPT-6 Luna ottengono punteggi più alti, e GLM-5.3 Flash è a pari. Mistral afferma che ML4 "guida i modelli open-weight sviluppati fuori dalla Cina con un ampio margine", e il grafico di AA è coerente con ciò.

Il dato di spicco è CyberGym-E2E, uno dei tre componenti dell'indice. Chiede a un modello di riprodurre una vulnerabilità reale in software open-source (una "CVE", cioè una falla di sicurezza catalogata pubblicamente) e poi patcharla. ML4 ottiene l'82%, primo dei 18 modelli testati da AA. Mistral riporta anche il 93% su Cybench, un set di 40 challenge di gare di sicurezza, anche se nessuno ha riprodotto quel punteggio.

Interessanti anche i dati sulle refusal. Su CyberGym-E2E, il grafico di AA mostra Claude Opus 5.5 bloccato per motivi di sicurezza in circa il 96% dei task e GPT-6 Astra bloccato al 100%. Quei modelli ottengono quasi zero perché il compito viene rifiutato, quindi i loro punteggi non dicono nulla su ciò che potrebbero effettivamente fare. Se rifiutare sia la policy giusta è un altro discorso.

Ed è questo il fulcro dell'argomentazione di Mistral. Il lavoro di sicurezza difensiva spesso inizia riproducendo una falla per dimostrarne l'esistenza, e i team di sicurezza devono farlo in volume, scansionando grandi codebase e triaggiando centinaia di segnalazioni. Un modello che rifiuta la maggior parte di quel carico, o il cui provider può cambiare le regole di moderazione in pieno incidente, è una responsabilità. L'argomentazione dichiarata di Mistral è che eseguire ML4 sulla tua infrastruttura pone il suo comportamento sotto il tuo controllo. Il dibattito più ampio sulle salvaguardie dell'AI che bloccano il lavoro difensivo legittimo va avanti da un po'.

Ora la parte negativa: una volta che i pesi sono pubblici, gli aggressori ottengono la stessa capacità. L'indice di AA è deliberatamente difensivo (i modelli lavorano sul codice sorgente e non viene mai chiesto loro di costruire un exploit funzionante), quindi un punteggio di riproduzione dell'82% non è l'82% di capacità offensiva. Detto ciò, la distanza tra "riprodurre un crash" e "armificarlo" non è infinita. Mistral sta spendendo le tre settimane prima del rilascio in red-teaming del modello, cioè provando intenzionalmente a farlo comportare male, con "leader della cybersecurity, partner verificati e autorità statali".

Perché gli open weights contano per Mistral Large 4

Il caso della cybersecurity è in realtà un argomento per gli open weights, e va ben oltre la sicurezza. "Puoi scaricare il modello" è riduttivo.

Una banca che esegue ML4 sui propri server non invia mai dati dei clienti a Mistral. Un'agenzia governativa controlla l'intero ambiente di deployment. Un team di sicurezza può regolare il comportamento del modello senza attendere la policy di moderazione di un provider che, dopo la sezione precedente, non è una preoccupazione ipotetica. E se un provider va giù o ritira una versione del modello, i deployment self-hosted continuano a funzionare.

Gli open weights rendono anche pratica la personalizzazione. Ho trattato Mistral Forge ad aprile, e Mistral afferma che ML4 "usa lo stesso ambiente di training, personalizzazione e RL" che offre ai clienti enterprise tramite Forge. Per le organizzazioni che vogliono fine-tunare ML4 sui propri dati, Forge è la via più ovvia.

Una rapida nota sui termini. Open-weight significa che i parametri del modello addestrato sono pubblicamente disponibili. Non significa che i dati di training, il codice di training o altro siano rilasciati con licenza open-source. La pagina del modello di Mistral descrive ML4 come open-weight ma non ha ancora pubblicato i termini di licenza. Finché non lo farà, uso commerciale, diritti di fine-tuning e ridistribuzione restano interrogativi aperti. Trovo un po' frustrante scrivere "controlla la licenza" su un modello il cui punto di forza è il controllo, ma è la situazione attuale.

Mistral Large 4 e la spinta europea alla sovranità sull'AI

Il controllo è anche al centro del messaggio politico di Mistral. Il presidente francese Macron ha descritto l'approccio di Mistral come "una terza via nell'AI". Le prime due vie sono i modelli chiusi statunitensi, capaci ma soggetti alla legge americana e alle policy dei provider, e i modelli aperti cinesi, spesso capaci ma un problema di residenza dei dati e geopolitico per le istituzioni europee. L'offerta di Mistral è pesi aperti, infrastruttura europea e diritto europeo.

Questo include un deployment europeo che Mistral afferma di operare "end-to-end, in modo indipendente da altri provider di servizi digitali e sotto la legge europea." Se sei soggetto al GDPR o a norme settoriali sulla residenza dei dati, verifica tale affermazione rispetto ai data processing agreement di Mistral prima di farci affidamento.

Mistral ha anche le risorse per sostenere la proposta. Mistral definisce ML4 "la prima pietra miliare della roadmap finanziata dal nostro round Series D da 3 miliardi di euro", un round guidato da Samsung a una valutazione di 21 miliardi di euro, che Mistral descrive come il più grande round di equity mai raccolto da un'azienda tecnologica europea. La maggior parte andrà ad aumentare la capacità dei data center in Europa.

Quindi, l'Europa può produrre modelli di frontiera dando alle organizzazioni maggiore controllo su dove e come questi modelli girano? ML4 è un forte dato a favore della metà del controllo. Sulla metà della frontiera, il 32° posto su 44 nel Vals Index dice che l'Europa non ci è ancora arrivata.

Mistral Large 4 rispetto ad altri modelli open-weight

Se l'Europa non ci è ancora, è lecito chiedersi chi ci sia e come ML4 si confronti. Non metto i punteggi di ogni modello in un'unica tabella, perché provengono da setup diversi e una tabella combinata implicherebbe che siano comparabili. Nemmeno il numero di parametri è un proxy per la capacitàe. La tabella qui sotto li colloca soltanto:

Modello

Architettura

Pesi disponibili

Punti di forza

Origine

Mistral Large 4

MoE, 1T totali / 49B attivi

27 ottobre (previsto)

Cybersecurity, legale (supportati indipendentemente)

Francia

GLM-5.3

Non divulgata

Sì

Coding, STEM

Cina

DeepSeek V4 Pro

MoE

Sì

Coding, matematica

Cina

Reflection Beam

Non divulgata

Sì

Ragionamento generale

USA

Qwen3.8 Max

Non divulgata

Non confermato

Multilingue, coding

Cina

Mistral Large 4 vs. GLM-5.3

Il confronto che conta di più, dato che GLM-5.3 è uno dei modelli open cinesi più forti. Come visto nella sezione coding, sono separati da un punto nel grafico di Mistral, le valutazioni umane sono divise e GLM-5.3 raggiunge il 69% nella classifica live dove ML4 non è ancora testato. Diciamo pari finché le classifiche indipendenti non includeranno entrambi.

Mistral Large 4 vs. DeepSeek V4 Pro

ML4 vince ogni confronto pubblicato da Mistral (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), ma nessuno è confermato indipendentemente, e DeepSeek V4 Pro raggiunge il 63% nella classifica live di DeepSWE, sopra il 62% di ML4. Non c'è un testa a testa pubblicato sulla finanza.

Mistral Large 4 vs. Reflection Beam

Reflection Beam è l'altro contendente open-weight occidentale, il che lo rende il test più diretto dell'affermazione di Mistral "il migliore fuori dalla Cina". I dati sono pochi. Il grafico DeepSWE di Mistral riporta Beam al 44%, quasi 18 punti sotto ML4, ma è un numero autoriportato messo a confronto con un punteggio eseguito da AA, quindi non farei affidamento sul divario. Reflection non ha divulgato la dimensione di Beam, quindi non è possibile nemmeno un confronto di scala. ML4 ha input multimodali più ampi e prove pubblicate di cybersecurity molto più solide.

Quando puoi usare Mistral Large 4?

Non devi aspettare che questi confronti si assestino prima di provare ML4 in prima persona. Ecco il rollout finora:

  1. 6 ottobre: inizia la preview pubblica. Chiunque può chiamare mistral-large-4 tramite Mistral Studio.
  2. Durante la preview: leader della cybersecurity, partner verificati e autorità statali ottengono una versione con "moderazione ridotta e capacità cyber estese" per il red-teaming. Pierre Stock ha detto a TechCrunch che Mistral "lavorerà con partner fidati e governi per assicurarsi che i pesi open source possano essere usati per difendersi, ma non per [compiere] attacchi malevoli". Nel frattempo, l'addestramento RL continua, quindi il modello dell'API continua a cambiare.
  3. 27 ottobre: i pesi dovrebbero essere rilasciati insieme ai dettagli architetturali completi, più benchmark e la metodologia di post-training di Mistral.

Aggiornerò questa sezione quando i pesi verranno rilasciati.

Cosa non sappiamo ancora su Mistral Large 4

Fino ad allora, molto è ancora aperto. Sto scrivendo nel giorno del lancio, quindi la lista è lunga:

  • Prestazioni finali ai benchmark: l'RL è ancora in esecuzione, quindi ogni punteggio sopra potrebbe cambiare. Mistral si aspetta "miglioramenti ampi e rapidi", ma nessuno li ha ancora misurati.
  • Risultati indipendenti su coding, visione e knowledge work: oltre all'AA Cyber Index e a vals.ai, nulla è stato riprodotto.
  • Prezzi: annuncio e pagina di documentazione non coincidono, e le tariffe della preview potrebbero non restare.
  • Termini di licenza: non puoi costruire un prodotto su "open-weight" senza una licenza.
  • Requisiti hardware per l'auto-hosting: non pubblicati.
  • Architettura completa: promessa con i pesi, che potrebbe anche spiegare la discrepanza tra 49B e 52B parametri attivi.
  • Finestra di contesto: 1M token secondo la documentazione di Mistral, 512K secondo vals.ai.
  • Valutazione di sicurezza finale: il red-teaming prosegue fino a ottobre.

Conclusione

Mistral Large 4 è un modello sparso da 1 trilione di parametri con 49 miliardi di parametri attivi, input multimodale e open weights in arrivo. Al day one, vediamo che è il miglior modello open-weight sul benchmark legale di Harvey, ma 32° su 44 nel Vals Index e dietro Kimi K3 nel grafico di coding di Mistral.

Non credo che la leadership nei benchmark sia la vera scommessa di Mistral comunque. La scommessa è che pesi aperti capaci e self-hosting siano ciò che più interessa a imprese e governi. I dati sulle refusal in cybersecurity sono la prova più chiara finora che questo pacchetto risolve un problema che i team di sicurezza hanno già.

Il 27 ottobre è la data da tenere d'occhio. È quando verranno rilasciati i pesi, i ricercatori indipendenti potranno eseguire l'ultimo checkpoint e Artificial Analysis e vals.ai potranno testare il modello che Mistral rilascia effettivamente invece di una preview ancora in training. Le Chonk allora sarà all'altezza del post di lancio, oppure no.

Per approfondire i concetti dietro i modelli MoE, il nostro corso Introduzione ai Large Language Models copre le basi. Per saperne di più sui prodotti Mistral, vedi i nostri articoli su Mistral Forge, Mistral Large 3, Mistral Le Chat e Mistral Vibe 2.0, il suo agente di coding da terminale.


Oluseye Jeremiah's photo
Author
Oluseye Jeremiah
LinkedIn

Technical writer specializzato in AI, ML e data science: rende idee complesse chiare e accessibili.

FAQs

What is Mistral Large 4 (Le Chonk)?

È il nuovo flagship di Mistral, lanciato in preview pubblica il 6 ottobre 2026: un modello Mixture-of-Experts con circa 1 trilione di parametri totali e 49 miliardi attivi per token. Accetta testo e immagini, produce testo e ha pesi aperti previsti per il 27 ottobre.

Why is it called Le Chonk?

È un richiamo a "Le Chaton Fat", un modello fittizio da 24 trilioni di parametri che Mistral annunciò scherzosamente, poi cancellò, a giugno 2026. La battuta si diffuse sui social dell'AI e, quando arrivò un vero modello da un trilione di parametri, il nome seguì.

What is Mistral Large 4 best at?

I suoi risultati indipendenti più forti sono in cybersecurity e nel lavoro legale. È nella top 5 su 18 modelli nell' Artificial Analysis Cyber Index e sesto su 75 su Harvey's Legal Agent Benchmark, primo tra i modelli open-weight (entrambi al 6 ottobre). Nell'ampio Vals Index, è 32° su 44, quindi la forza verticale e la performance complessiva raccontano storie diverse.

Is Mistral Large 4 open source?

No. È open-weight, che è diverso. Open-weight significa che i parametri del modello sono pubblicamente disponibili, ma non necessariamente i dati di training, il codice di training o altri componenti. Mistral non ha ancora pubblicato i termini di licenza, quindi verificali prima di costruire un prodotto sul modello.

When can I download Mistral Large 4 weights?

27 ottobre 2026, secondo Axios. L'API è disponibile ora tramite Mistral Studio, ma la preview è ancora in reinforcement learning, quindi i pesi rilasciati differiranno da ciò che l'API serve oggi.

Argomenti
Intelligenza artificiale

Impara con DataCamp

Corso

Comprendere l'intelligenza artificiale

2 ore
427.3K
Impara i concetti di base dell'Intelligenza Artificiale, come l'apprendimento automatico, l'apprendimento profondo, l'NLP, l'IA generativa e altro ancora.
Vedi i dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

Mostra AltroMostra Altro