Cours
Le 6 octobre 2026, Mistral a lancé une préversion publique de Mistral Large 4 (ML4), un modèle de 1 000 milliards de paramètres avec 49 milliards de paramètres actifs, entrée texte et image, et des poids ouverts annoncés pour la fin du mois. C’est le plus grand modèle jamais construit par Mistral, entraîné from scratch sur 3 800 GPU Nvidia Grace Blackwell dans ses propres data centers européens.
La plupart de l’année passée, les modèles open-weight les plus performants provenaient de laboratoires chinois (GLM, DeepSeek, Kimi, Qwen), tandis que les modèles les plus puissants dans l’ensemble restaient fermés derrière des API américaines. Mistral vise une troisième voie. Son annonce affirme que ML4 « atteint déjà des performances compétitives avec les meilleurs modèles open source au niveau mondial, tout en surpassant nettement tout modèle open-weight développé aux États-Unis ou en Europe ».
Le tableau est plus nuancé que ne le laisse entendre le billet de lancement. Ci-dessous, j’aborde l’architecture, les benchmarks (en distinguant ce qui a été reproduit indépendamment de ce qui ne l’a pas été), le codage, la vision, la cybersécurité, les poids ouverts et ce qui reste inconnu. Si vous ne lisez qu’une section, choisissez la cybersécurité.
La réponse en bref
Mistral Large 4 (Le Chonk) est un modèle open-weight de 1 000 milliards de paramètres que Mistral présente comme le plus performant construit hors de Chine, notamment pour la cybersécurité, la finance, le droit et la perception visuelle. Des évaluations indépendantes confirment les atouts en cybersécurité et en droit, placent la finance dans la moyenne, et classent ML4 32e sur 44 modèles sur un indice agrégé large. L’API est disponible dès maintenant, et les poids sont attendus le 27 octobre.
Qu’est-ce que Mistral Large 4 (Le Chonk) ?
Ce résumé laisse beaucoup de choses de côté, repartons donc des bases. ML4 est le nouveau vaisseau amiral de Mistral et, selon l’entreprise, son « modèle le plus grand et le plus performant à ce jour ». Le Chonk est son surnom, même si Mistral a inversé la formule habituelle dans son lancement : « Officieusement ML4, très officiellement : le Chonk ».
C’est un modèle Mixture-of-Experts (MoE) multimodal natif. Les chiffres clés : 1 000 milliards de paramètres au total et 49 milliards actifs par token, même si la documentation du modèle de Mistral donne des nombres légèrement différents (1,05 T au total, 52 B actifs). Aucune source n’explique l’écart. (Pourquoi « actifs » compte est expliqué dans la section suivante.)
Mistral destine ML4 aux usages en entreprise : codage, cybersécurité, finance, juridique, industrie et ingénierie, ainsi que des tâches visuelles comme la lecture de plans techniques ou d’images satellites.
|
Spécification |
Détail |
|
Paramètres totaux |
|
|
Paramètres actifs |
|
|
Architecture |
Mixture-of-Experts, hybride instruct et reasoning |
|
Entrée |
|
|
Sortie |
Texte uniquement |
|
Fenêtre de contexte |
1 M de tokens selon la doc, 512 K selon vals.ai (à clarifier) |
Deux lignes comptent particulièrement pour qui prévoit un déploiement, et toutes deux restent incertaines : la fenêtre de contexte et la licence. Avant d’expliquer le fonctionnement du modèle, un mot sur son nom.
Pourquoi s’appelle-t-il Le Chonk ?
En juin 2026, Mistral a publié une annonce satirique pour « Le Chaton Fat », un modèle fictif de 24 billions de paramètres, puis l’a supprimée. Internet s’en est emparé, faisant grimper les specs à des centaines de billions. Quatre mois plus tard, Mistral lançait un véritable modèle à un billion de paramètres, et le nom s’est imposé de lui-même. Fin de l’histoire. Revenons au modèle.
Comment fonctionne Mistral Large 4
Mistral n’a pas encore publié tous les détails d’architecture (ils sont annoncés en même temps que les poids), donc restons sur l’information divulguée.
1 billion de paramètres, 49 milliards actifs
Un modèle à 1 billion de paramètres ne mobilise pas l’ensemble sur chaque token. Les modèles MoE routent chaque token vers un petit sous-ensemble de sous-réseaux « experts », de sorte que le calcul d’inférence dépend des 49 milliards de paramètres actifs. En pratique, c’est plus proche d’un modèle dense d’environ 50 B qu’un 1 T.
Peu coûteux à servir, alors ? Non. Les 1 billion de paramètres doivent quand même résider en mémoire quelque part, donc l’auto‑hébergement de ML4 exige une infrastructure multi‑GPU sérieuse. Les MoE sont aussi plus difficiles à servir avec une faible latence que des modèles denses de même volume actif. Mistral n’a pas publié les prérequis matériels, et il serait étonnant que beaucoup d’équipes en dehors des grands groupes et des gouvernements fassent tourner le modèle complet elles‑mêmes.
Entrée multimodale
Ces paramètres actifs traitent plus que du texte. ML4 accepte aussi des images, même s’il ne renvoie que du texte. Mistral affirme qu’il « raisonne efficacement sur des documents complexes, des graphiques et des images naturelles » et vise des secteurs où la perception visuelle est clé, comme l’ingénierie, la production et l’observation de la Terre. Les démos sont toutes industrielles : inspection de pièces mécaniques sur plans techniques, extraction de preuves depuis des PDF, balayage d’images satellites gigapixels à la recherche d’objets difficiles à repérer.
160+ langues
Ces clients industriels opèrent souvent à l’international, d’où l’enjeu linguistique. Mistral indique qu’une « part significative » des données d’entraînement est multilingue, couvrant plus de 160 langues et toutes les langues officielles de l’UE. Pour une entreprise européenne qui vise des gouvernements européens, c’est un argument commercial majeur.
Infrastructures d’entraînement
Pour un positionnement européen, le lieu d’entraînement compte aussi. Selon Mistral, ML4 a été entraîné from scratch sur 3 800 GPU Nvidia Grace Blackwell dans ses propres data centers européens. Pierre Stock, VP Science, a donné à TechCrunch un chiffre arrondi de 4 000 et précisé que c’est « deux à trois fois moins que nos concurrents chinois ». Personne n’a vérifié cette comparaison.
Le déploiement compute derrière tout cela est public depuis un moment. En mars 2026, Mistral a levé 830 millions de dollars de dette pour acquérir 13 800 GPU Nvidia GB300 pour un data center près de Paris. Mistral ne précise pas si ML4 a été entraîné spécifiquement sur ce cluster, donc pas de conclusion hâtive.
Un détail change la lecture de chaque benchmark de cet article. La phase de reinforcement learning (RL) est toujours en cours. Le RL est la phase post-entraînement où le modèle s’améliore en étant noté sur ses propres tentatives, et Mistral indique que cette phase mobilise environ 3 000 GPU, génère près de 33 milliards de tokens par jour et « ne montre aucun signe de saturation ». Le modèle accessible via l’API aujourd’hui ne sera donc pas exactement celui dont les poids seront publiés le 27 octobre.
Benchmarks de Mistral Large 4
Ce RL inachevé est une première raison de considérer tout ce qui suit comme provisoire. La seconde, c’est que la plupart des chiffres de Mistral n’ont pas été reproduits indépendamment, et que ceux qui l’ont été ne coïncident pas toujours.
Les évaluations indépendantes au lancement se répartissent en trois catégories :
- Reproduites de façon indépendante : l’Artificial Analysis (AA) Cyber Index, incluant son composant CyberGym‑E2E, et cinq évaluations vals.ai, dont Terminal‑Bench 4.0.
- Exécutées par AA mais pas encore publiques : une note sur les graphiques de codage de Mistral indique que les scores DeepSWE, Terminal‑Bench et SWE‑Atlas « utilisent des résultats évalués en privé par Artificial Analysis avant la sortie publique du harness ». Ils figureront sur l’ index des agents de codage d’AA une fois le harness publié. D’ici là, personne en dehors d’AA et Mistral ne peut les vérifier.
- Mistral uniquement : le reste.
Faites surtout attention à la dernière colonne du tableau. Un benchmark peut être conçu par un groupe indépendant, tout en ne disposant que du score revendiqué par Mistral pour ML4.
Résumé des benchmarks
|
Benchmark |
Résultat ML4 |
Concurrents |
Ce que ça mesure |
|
DeepSWE v1.1 |
61,7 % évalué en privé par AA |
Kimi K3 69 %, GLM‑5.3 61 %, DeepSeek V4 Pro 57 %, Qwen3.8 Max 51 %, Reflection Beam 44 % (autodéclaré) |
Génie logiciel à long horizon |
|
Terminal‑Bench 4.0 |
28,3 % selon Mistral, 22,73 % selon vals.ai |
20e sur 44 sur vals.ai |
Workflows complexes en terminal |
|
SWE‑Atlas‑QnA |
59,4 % évalué en privé par AA |
Non publié |
Compréhension de dépôt |
|
Coding Agent Index |
49,8 % évalué en privé par AA |
Devant DeepSeek V4 Pro 0813 et Qwen3.8 Max |
Composite des trois benchmarks de codage ci‑dessus |
|
AutomationBench |
59,9 % selon Mistral |
Devant Kimi K3, MiMo‑V2.6‑Pro, DeepSeek V4 Pro |
657 workflows métier sur des apps comme Gmail, Slack et Salesforce |
|
AA‑Briefcase |
1 393 Elo, cité par Mistral comme AA |
Devant DeepSeek V4 Pro |
Travail de connaissance à long horizon |
|
Dense 200 |
42 % selon Mistral |
GPT‑6 Astra 41 % |
Ancrage visuel |
|
AA Cyber Index |
Grok 4.7 56 %, MiMo‑V2.6‑Pro 56 %, GPT‑6 Luna 53 % |
Détection et correction de failles sur des logiciels réels |
|
|
CyberGym‑E2E |
MiMo‑V2.6‑Pro 79 %, GPT‑6 Luna 78 % |
Reproduction et patch d’une vulnérabilité réelle |
|
|
93 % selon Mistral |
« Parmi les plus élevés » pour des poids ouverts, selon Mistral |
40 challenges de compétitions sécurité |
|
|
Finance Agent v2 |
22e sur 75, 7e sur 32 open‑weight |
Tâches d’agent financier |
|
|
Harvey’s Legal Agent |
n° 1 sur 31 open‑weight |
Tâches juridiques autonomes |
|
|
1,691 sur 2 selon Mistral |
Plus haut parmi les modèles ouverts testés par Mistral |
Comportement IA responsable |
|
|
93,3 % selon Mistral |
« Aucun score concurrent supérieur », selon Mistral |
Résistance à l’injection de prompts |
|
|
Indice Vals |
9e sur 16 open‑weight |
Agrégat large de tâches |
Classements de Mistral 4 aux benchmarks
Lisez la dernière ligne à côté de l’affirmation phare de Mistral. Sur l’indice large de vals.ai, ML4 se place 32e sur 44 au global et 9e sur 16 parmi les modèles open‑weight uniquement. Difficile à concilier avec « compétitif avec les meilleurs modèles open source au monde », du moins en agrégé. Les résultats sectoriels de Mistral sont bien meilleurs, et c’est vrai. Ils mesurent juste quelque chose de plus étroit. Si vous devez décider de bâtir sur ML4, votre vertical métier compte plus que n’importe quel titre.
Codage
Le décalage entre slogan et détails apparaît d’abord en codage. Les chiffres de Mistral sont flatteurs au premier regard. Sur son graphique DeepSWE toutefois, on voit un point que le texte ne mentionne jamais : la plus haute barre est Kimi K3, à 69 %, sept points devant ML4. ML4 devance GLM‑5.3 (62 % contre 61 %), mais un point est largement dans le bruit lié au choix du harness. Un « harness » est l’ossature qui encadre un modèle pendant un benchmark agentique (outils, prompts, nombre d’essais). Sur le classement DeepSWE en direct de Datacurve, qui fait tourner tous les modèles dans le même setup, GLM‑5.3 et Kimi K3 atteignent 69 % et DeepSeek V4 Pro 63 %. ML4 n’y figure pas encore.
Terminal‑Bench montre le même effet dans l’autre sens. Mistral annonce 28,3 %, vals.ai obtient 22,73 %. Je n’y vois pas de gonflage, juste le rappel qu’un chiffre dans un setup ne fait pas un classement.
Les évaluations humaines sont plus parlantes. Dans une évaluation en aveugle commandée à Surge AI, des annotateurs professionnels ont noté des sorties de code de 1 à 5. ML4 se classe 2e sur 5 (3,74), devant GLM‑5.3 (3,60), Kimi K3 (3,59) et GLM‑5.2 (3,40), et loin derrière Claude Opus 5 (4,22). Remarquez Kimi K3 : sept points devant ML4 sur DeepSWE, derrière en préférence humaine. Réussir des tests et écrire du code agréable à lire ne sont pas la même compétence. (Et c’est Opus 5, pas le plus récent 5.5, donc l’écart avec le meilleur modèle fermé est probablement plus large.)
Une seconde évaluation interne Mistral brouille encore les cartes. Elle trouve ML4 « à parité ou proche » de GLM‑5.3 en codage et finance, et préféré seulement en CAO et STEM. Appelons‑les ex aequo.
Finance
La finance est plus simple, surtout grâce à un score indépendant de référence. ML4 obtient 54,68 % sur Finance Agent v2 sur vals.ai, le classant 22e sur 75 au global et 7e sur 32 parmi les modèles open‑weight. Franc milieu de tableau. L’affirmation de Mistral est plus étroite : ML4 bat GPT‑6 Astra sur ce benchmark.
Mistral rapporte aussi de bons résultats sur FinWorkBench, qui teste la capacité d’un modèle à construire et modifier des feuilles de calcul pour des tâches financières et comptables réelles. Ces chiffres proviennent des graphiques de Mistral et n’ont pas été reproduits ailleurs.
Juridique
Le droit est plus flatteur sur le papier. Sur Harvey’s Legal Agent Benchmark, ML4 est 6e sur 75 et premier parmi 31 modèles open‑weight. Son score est de 15,83 %.
Relisez ce chiffre. Sixième mondial en tâches juridiques autonomes signifie réussir environ une tâche sur six. Le benchmark est difficile et le classement réel, mais personne ne doit en déduire que « ML4 peut travailler en juridique sans supervision ». Aucun modèle ne le peut encore.
Vision et ancrage visuel
La vision est le cas inverse : affirmations ambitieuses, pas encore de données indépendantes. L’affirmation phare concerne l’ancrage visuel, c’est‑à‑dire localiser des objets ou zones précis dans une image à partir d’une description textuelle, comme « trouvez la soudure fissurée sur ce plan » plutôt que « décrivez cette image ». Mistral annonce 42 % sur Dense 200, juste devant GPT‑6 Astra à 41 %. Je n’achèterais pas sur un point d’écart.
Mistral indique aussi de bonnes performances sur ChartQA Pro et GDP.pdf, un benchmark de raisonnement sur documents. Aucun résultat vision n’a encore été reproduit. Les cas d’usage mis en avant sont surtout industriels, de l’imagerie satellite pour la réponse aux catastrophes à l’inspection de plans techniques en passant par l’analyse d’images géospatiales de grande taille.
Quelle est la valeur de Mistral Large 4 pour le codage ?
Revenons au codage, car c’est l’usage le plus probable pour ML4. Il est compétitif parmi les modèles open‑weight, mais ce n’est pas le meilleur modèle de codage disponible, et même pas le meilleur ouvert sur le propre graphique de Mistral. Inutile de répéter les chiffres. Voici ce que cela veut dire pour le travail à lui confier :
- Corriger des problèmes dans un vrai codebase (ingénierie logicielle agentique) : exploitable, mais Kimi K3 semble plus solide.
- Comprendre un large dépôt : prometteur, même si cela repose sur un score exécuté en privé.
- Exécutions agentiques longues, sur plusieurs heures : le setup RL de Mistral est conçu pour de longues trajectoires, mais personne ne l’a encore testé indépendamment.
- Travail très orienté terminal : signal indépendant le plus faible à ce stade.
J’attendrais l’entrée de ML4 sur l’index public des agents de codage d’AA, prévue après la publication des poids, avant de le considérer comme plus qu’une option open‑weight crédible.
L’intérêt des poids ouverts ici ne tient pas aux scores. Une entreprise peut exécuter ML4 sur sa propre infrastructure et ne jamais envoyer de code propriétaire à une API externe. Pour des agents de codage sur des bases de code confidentielles, cela peut suffire à trancher.
Mistral Large 4 pour la cybersécurité
C’est l’affirmation la plus audacieuse de Mistral. Sur l’ Artificial Analysis Cyber Index, l’évaluation indépendante d’AA de la capacité des modèles à trouver, reproduire et corriger des vulnérabilités dans des logiciels réels, ML4 obtient 50 %. Cela le place dans le top 5 des 18 modèles testés. Seuls Grok 4.7, MiMo‑V2.6‑Pro et GPT‑6 Luna font mieux, et GLM‑5.3 Flash est à égalité. Mistral affirme que ML4 « est largement en tête des modèles open‑weight développés hors de Chine », et le graphique d’AA est cohérent avec cela.
La performance la plus marquante est sur CyberGym‑E2E, l’un des trois composants de l’index. Il demande au modèle de reproduire une vulnérabilité réelle dans un logiciel open source (une « CVE », faille répertoriée publiquement) puis de la corriger. ML4 atteint 82 %, premier des 18 modèles testés par AA. Mistral annonce aussi 93 % sur Cybench, un ensemble de 40 défis de compétitions sécurité, mais ce score n’a pas été reproduit.
Les données de refus sont aussi intéressantes. Sur CyberGym‑E2E, le graphique d’AA montre Claude Opus 5.5 bloqué pour des raisons de sécurité sur environ 96 % des tâches, et GPT‑6 Astra bloqué sur 100 %. Ces modèles scorent presque zéro parce que la tâche est refusée, donc leurs scores ne disent rien de ce qu’ils pourraient faire. Savoir si refuser est la bonne politique est un autre débat.
Et c’est le cœur de l’argumentaire de Mistral. Le travail défensif en sécurité commence souvent par la reproduction d’une faille pour prouver son existence, et les équipes doivent le faire à grande échelle, en scannant de vastes codebases et en triant des centaines de signalements. Un modèle qui refuse l’essentiel de cette charge, ou dont le fournisseur peut changer les règles de modération en pleine gestion d’incident, devient un risque. L’argument déclaré de Mistral est qu’en exécutant ML4 sur votre propre infrastructure, vous gardez le contrôle du comportement. Le débat plus large sur des garde‑fous IA qui bloquent des usages défensifs légitimes n’est pas nouveau.
La mauvaise nouvelle : une fois les poids publics, les attaquants accèdent aux mêmes capacités. L’index d’AA est volontairement défensif (les modèles travaillent à partir du code source et ne sont jamais invités à produire un exploit opérationnel), donc un score de 82 % en reproduction n’est pas 82 % de capacité offensive. Reste que la distance entre « reproduire un crash » et « l’armer » n’est pas infinie. Mistral consacre les trois semaines précédant la sortie à du red teaming du modèle, c’est‑à‑dire à provoquer délibérément des écarts de comportement, avec « des leaders cybersécurité, des partenaires certifiés et des autorités publiques ».
Pourquoi les poids ouverts comptent pour Mistral Large 4
L’argument cybersécurité est en réalité un plaidoyer pour les poids ouverts, et il dépasse largement la sécurité. « Vous pouvez télécharger le modèle » est réducteur.
Une banque qui exécute ML4 sur ses propres serveurs n’envoie jamais de données clients à Mistral. Une agence gouvernementale maîtrise tout l’environnement de déploiement. Une équipe sécurité peut ajuster le comportement du modèle sans attendre la politique de modération d’un fournisseur, ce qui, au vu de la section précédente, n’a rien de théorique. Et si un fournisseur tombe en panne ou retire une version, les déploiements auto‑hébergés continuent de tourner.
Les poids ouverts rendent aussi la personnalisation vraiment praticable. J’ai présenté Mistral Forge en avril, et Mistral indique que ML4 « utilise le même environnement d’entraînement, de personnalisation et de RL » qu’il propose aux clients entreprise via Forge. Pour les organisations souhaitant affiner ML4 sur leurs données, Forge est la voie naturelle.
Petit point de terminologie. Open‑weight signifie que les paramètres entraînés du modèle sont publiquement disponibles. Cela ne veut pas dire que les données d’entraînement, le code d’entraînement, ou d’autres éléments sont diffusés sous licence open source. La page du modèle de Mistral décrit ML4 comme open‑weight mais n’a pas publié les termes de licence. Tant que ce n’est pas fait, l’usage commercial, les droits de fine‑tuning et la redistribution restent ouverts. C’est un peu frustrant d’écrire « vérifiez la licence » pour un modèle dont l’argument est justement le contrôle, mais c’est la situation actuelle.
Mistral Large 4 et l’ambition européenne de souveraineté en IA
Le contrôle est aussi au centre du discours politique de Mistral. Le président Macron a décrit l’approche de Mistral comme « une troisième voie en IA ». Les deux premières : des modèles américains fermés, performants mais soumis au droit américain et aux politiques éditeurs, et des modèles chinois ouverts, souvent performants mais problématiques en résidence des données et sur le plan géopolitique pour les institutions européennes. L’offre de Mistral : des poids ouverts, une infrastructure européenne et le droit européen.
Cela inclut un déploiement européen que Mistral affirme opérer « de bout en bout, indépendamment d’autres fournisseurs de services numériques et sous droit européen ». Si vous êtes soumis au RGPD ou à des règles sectorielles de résidence des données, confrontez cette affirmation aux accords de traitement des données de Mistral avant de vous y fier.
Mistral a aussi les moyens financiers. L’entreprise présente ML4 comme « la première étape sur la feuille de route financée par notre série D de 3 milliards € », un tour mené par Samsung à une valorisation de 21 milliards €, que Mistral décrit comme la plus grande levée de fonds en equity jamais réalisée par une entreprise technologique européenne. L’essentiel est fléché vers des capacités de data centers en Europe.
L’Europe peut‑elle produire des modèles de frontière tout en donnant davantage de contrôle aux organisations sur le lieu et la manière d’exécution ? ML4 est un signal fort sur le volet contrôle. Côté frontière, la 32e place sur 44 à l’indice Vals indique que l’Europe n’y est pas encore.
Mistral Large 4 face aux autres modèles open‑weight
Si l’Europe n’y est pas encore, la question est de savoir qui y est et comment ML4 se compare. Je n’aligne pas tous les scores dans un seul tableau, car ils proviennent de setups différents et un tableau unique suggérerait une comparabilité illusoire. Le nombre de paramètres n’est pas non plus un proxy fiable de capacité. Le tableau ci‑dessous se limite à situer chaque modèle :
|
Modèle |
Architecture |
Poids disponibles |
Forces |
Origine |
|
Mistral Large 4 |
MoE, 1 T total / 49 B actifs |
27 octobre (prévu) |
Cybersécurité, juridique (confirmé indépendamment) |
France |
|
GLM‑5.3 |
Non divulguée |
Oui |
Codage, STEM |
Chine |
|
DeepSeek V4 Pro |
MoE |
Oui |
Codage, math |
Chine |
|
Reflection Beam |
Non divulguée |
Oui |
Raisonnement général |
États‑Unis |
|
Qwen3.8 Max |
Non divulguée |
Non confirmé |
Multilingue, codage |
Chine |
Mistral Large 4 vs GLM‑5.3
La comparaison la plus pertinente, GLM‑5.3 étant un des meilleurs modèles ouverts chinois. Comme vu en codage, ils se tiennent à un point sur le graphique de Mistral, les évaluations humaines divergent, et GLM‑5.3 atteint 69 % sur le leaderboard live où ML4 n’a pas encore été testé. Match nul jusqu’à ce que des classements indépendants incluent les deux.
Mistral Large 4 vs DeepSeek V4 Pro
ML4 l’emporte sur chaque comparaison publiée par Mistral (DeepSWE, Coding Agent Index, AutomationBench, AA‑Briefcase), mais aucune n’est confirmée indépendamment, et DeepSeek V4 Pro atteint 63 % sur le leaderboard DeepSWE live, au‑dessus des 62 % de ML4. Pas de face‑à‑face publié en finance.
Mistral Large 4 vs Reflection Beam
Reflection Beam est l’autre prétendant occidental open‑weight, ce qui en fait le test le plus direct de la revendication de Mistral « meilleur hors Chine ». Les données sont maigres. Le graphique DeepSWE de Mistral place Beam à 44 %, près de 18 points sous ML4, mais c’est un score autodéclaré face à un score évalué par AA : ne surinterprétez pas l’écart. Reflection n’a pas divulgué la taille de Beam, donc pas de comparaison d’échelle. ML4 a en revanche une entrée multimodale plus large et des preuves publiées nettement plus solides en cybersécurité.
Quand pouvez‑vous utiliser Mistral Large 4 ?
Pas besoin d’attendre que ces comparaisons se stabilisent pour essayer ML4 vous‑même. Déploiement à date :
- 6 octobre : début de la préversion publique. Tout le monde peut appeler mistral-large-4 via Mistral Studio.
- Pendant la préversion : des leaders cybersécurité, partenaires approuvés et autorités publiques accèdent à une version avec « modération réduite et capacités cyber étendues » pour le red teaming. Pierre Stock a indiqué à TechCrunch que Mistral « travaillera avec des partenaires de confiance et des gouvernements pour s’assurer que les poids open source puissent être utilisés pour se défendre, mais pas pour des attaques malveillantes ». En parallèle, le RL continue, donc le modèle de l’API évolue.
- 27 octobre : publication des poids avec les détails d’architecture, plus de benchmarks et la méthodologie de post‑entraînement de Mistral.
Je mettrai cette section à jour à la sortie des poids.
Ce que nous ne savons pas encore sur Mistral Large 4
D’ici là, beaucoup de points restent ouverts. J’écris le jour du lancement, la liste est donc longue :
- Performances finales aux benchmarks : le RL est en cours, tous les scores ci‑dessus peuvent évoluer. Mistral attend des « améliorations rapides et substantielles », mais personne ne les a encore mesurées.
- Résultats indépendants en codage, vision et travail de connaissance : au‑delà de l’AA Cyber Index et de vals.ai, rien n’a été reproduit.
- Tarification : l’annonce et la page doc divergent, et les tarifs de préversion peuvent changer.
- Termes de licence : on ne peut pas bâtir un produit sur « open‑weight » sans licence.
- Exigences matérielles pour l’auto‑hébergement : non publiées.
- Architecture complète : promise avec les poids, qui pourraient aussi expliquer l’écart 49 B vs 52 B.
- Fenêtre de contexte : 1 M de tokens selon la doc de Mistral, 512 K selon vals.ai.
- Évaluation finale de sécurité : le red teaming court jusqu’à fin octobre.
Conclusion
Mistral Large 4 est un modèle parcimonieux à 1 billion de paramètres, avec 49 milliards actifs, une entrée multimodale et des poids ouverts en approche. Au jour du lancement, on voit un meilleur modèle open‑weight sur le benchmark juridique d’Harvey, mais 32e sur 44 sur l’indice Vals et derrière Kimi K3 sur le graphique de codage de Mistral.
Je ne pense pas que la pole position aux benchmarks soit le vrai pari de Mistral. Le pari, c’est que des poids ouverts performants et l’auto‑hébergement sont ce qui compte le plus pour les entreprises et les gouvernements. Les données de refus en cybersécurité sont la preuve la plus nette à ce jour que ce package résout un problème déjà vécu par les équipes sécurité.
Le 27 octobre sera la date à suivre. C’est là que les poids sortent, que les chercheurs indépendants peuvent faire tourner le checkpoint final, et qu’Artificial Analysis et vals.ai pourront tester le modèle réellement publié par Mistral, et non une préversion encore en entraînement. Le Chonk confirmera alors son lancement, ou pas.
Pour les concepts derrière les modèles MoE, notre cours Introduction to Large Language Models couvre les fondamentaux. Pour en savoir plus sur les produits Mistral, voir notre couverture de Mistral Forge, Mistral Large 3, Mistral Le Chat et Mistral Vibe 2.0, son agent de codage en terminal.
Rédacteur technique spécialisé dans l'IA, la ML et la science des données, rendant les idées complexes claires et accessibles.
FAQs
Qu’est-ce que Mistral Large 4 (Le Chonk) ?
C’est le nouveau modèle phare de Mistral, lancé en préversion publique le 6 octobre 2026 : un modèle Mixture‑of‑Experts avec environ 1 billion de paramètres au total et 49 milliards actifs par token. Il accepte du texte et des images, produit du texte, et des poids ouverts sont prévus pour le 27 octobre.
Pourquoi s’appelle-t-il Le Chonk ?
C’est un clin d’œil à « Le Chaton Fat », un modèle fictif de 24 billions de paramètres que Mistral avait annoncé sur le ton de la plaisanterie puis supprimé en juin 2026. La blague s’est répandue sur les réseaux IA, et quand un vrai modèle à un billion est arrivé, le nom a suivi.
Dans quoi Mistral Large 4 excelle-t-il ?
Ses meilleurs résultats indépendants sont en cybersécurité et en juridique. Il figure dans le top 5 sur 18 modèles de l’ Artificial Analysis Cyber Index et 6e sur 75 sur le Harvey’s Legal Agent Benchmark, premier parmi les modèles open‑weight (au 6 octobre). Sur l’ indice Vals large, il est 32e sur 44 : la force sectorielle et la performance globale racontent des histoires différentes.
Mistral Large 4 est‑il open source ?
Non. Il est open‑weight, ce qui est différent. Open‑weight signifie que les paramètres du modèle sont publiquement disponibles, mais pas nécessairement les données ou le code d’entraînement ni d’autres composants. Mistral n’a pas encore publié les termes de licence, vérifiez‑les avant de bâtir un produit sur le modèle.
Quand pourrai‑je télécharger les poids de Mistral Large 4 ?
Le 27 octobre 2026, selon Axios. L’API est disponible dès maintenant via Mistral Studio, mais la préversion est toujours en reinforcement learning, donc les poids publiés différeront du modèle servi aujourd’hui par l’API.


