Kurs
Am 6. Oktober 2026 hat Mistral eine Public Preview von Mistral Large 4 (ML4) gestartet: ein Modell mit 1 Billion Parametern und 49 Milliarden aktiven Parametern, Text- und Bildinput sowie zugesagten offenen Gewichten bis Ende des Monats. Es ist das größte Modell, das Mistral je gebaut hat, trainiert von Grund auf auf 3.800 Nvidia Grace Blackwell GPUs in Mistrals eigenen europäischen Rechenzentren.
Über weite Strecken des letzten Jahres kamen die stärksten Open-Weight-Modelle aus China (GLM, DeepSeek, Kimi, Qwen), während die insgesamt stärksten Modelle hinter US-APIs geschlossen blieben. Mistral will eine dritte Position. In der Ankündigung heißt es, ML4 "erreicht bereits eine Leistung, die mit den stärksten Open-Source-Modellen weltweit konkurriert, und übertrifft dabei jedes Open-Weight-Modell aus den USA oder Europa deutlich."
Das Bild ist unordentlicher, als der Launch-Post vermuten lässt. Im Folgenden gehe ich auf Architektur, Benchmarks (getrennt nach unabhängig reproduziert und nicht), Coding, Vision, Cybersicherheit, offene Gewichte und die noch offenen Punkte ein. Wenn du nur Zeit für einen Abschnitt hast, lies den zur Cybersicherheit.
Die Kurzfassung
Mistral Large 4 (Le Chonk) ist ein Open-Weight-Modell mit 1 Billion Parametern, das Mistral als das stärkste außerhalb Chinas positioniert – besonders für Cybersicherheit, Finanzen, Recht und visuelle Grounding-Aufgaben. Unabhängige Auswertungen stützen die Aussagen für Cybersecurity und Recht, sehen Finanzen im Mittelfeld und ordnen ML4 im breiten Vals-Index auf Platz 32 von 44 ein. Die API ist live, die Gewichte sollen am 27. Oktober kommen.
Was ist Mistral Large 4 (Le Chonk)?
Die Kurzfassung lässt vieles aus, also zu den Basics. ML4 ist Mistrals neues Flaggschiff und laut Mistral sein "größtes und leistungsfähigstes Modell bisher". Le Chonk ist der Spitzname, wobei Mistral im Launch-Text die übliche Reihenfolge umdreht: "Inoffiziell ML4, ganz offiziell: le Chonk."
Es ist ein nativ multimodales Mixture-of-Experts-(MoE)-Modell. Die Leitwerte sind 1 Billion Gesamtparameter und 49 Milliarden aktive pro Token, obwohl Mistrals eigene Modelldocs leicht andere Zahlen nennen (1,05T gesamt, 52B aktiv). Keine der Quellen erklärt die Abweichung. (Warum "aktiv" wichtig ist, folgt im nächsten Abschnitt.)
Mistral zielt mit ML4 auf Enterprise-Workflows: Coding, Cybersicherheit, Finanzen, Recht, Fertigung und Engineering sowie visuelle Aufgaben wie das Lesen technischer Zeichnungen oder Satellitenbilder.
|
Spezifikation |
Detail |
|
Gesamtparameter |
1 Billion laut Ankündigung, 1,05T laut Docs |
|
Aktive Parameter |
49B laut Ankündigung, 52B laut Docs |
|
Architektur |
Mixture-of-Experts, Hybrid aus Instruct und Reasoning |
|
Input |
|
|
Output |
Nur Text |
|
Kontextfenster |
Zwei Zeilen sind für eine geplante Implementierung am wichtigsten und beide sind ungeklärt: das Kontextfenster und die Lizenz. Bevor wir in die Funktionsweise einsteigen, verdient der Name eine kurze Erklärung.
Warum heißt es Le Chonk?
Im Juni 2026 veröffentlichte Mistral eine satirische Ankündigung zu "Le Chaton Fat", einem fiktiven Modell mit 24 Billionen Parametern, und löschte sie wieder. Das Internet machte trotzdem weiter und blähte die Specs in die Hunderte Billionen auf. Vier Monate später lieferte Mistral ein echtes Modell mit einer Billion Parametern – der Name ergab sich quasi von selbst. Das ist die ganze Geschichte. Zurück zum Modell.
So funktioniert Mistral Large 4
Mistral hat noch keine vollständigen Architekturdetails veröffentlicht (sie sind mit den Gewichten angekündigt), daher bleibt dieser Abschnitt bei dem, was bekannt ist.
1 Billion Parameter, 49 Milliarden aktiv
Ein Modell mit 1 Billion Parametern nutzt nicht bei jedem Token alle Parameter. MoE-Modelle leiten jeden Token durch eine kleine Untermenge von "Experten"-Subnetzen, daher folgt der Inferenzaufwand den 49 Milliarden aktiven Parametern. Das rückt es näher an ein ~50B-dichtes Modell als an ein 1T-Modell.
Günstig zu betreiben? Nein. Alle 1 Billion Parameter müssen dennoch irgendwo in den Speicher passen, also erfordert Self-Hosting von ML4 ernsthafte Multi-GPU-Infrastruktur. MoE-Modelle sind zudem schwieriger mit geringer Latenz zu serven als dichte Modelle mit gleicher aktiver Parameterzahl. Mistral hat keine Hardware-Anforderungen veröffentlicht, und ich wäre überrascht, wenn viele Teams außerhalb großer Unternehmen und Behörden das Vollmodell selbst betreiben.
Multimodaler Input
Diese aktiven Parameter verarbeiten mehr als nur Text. ML4 akzeptiert auch Bilder, liefert jedoch nur Text zurück. Mistral sagt, es "argumentiert stark über komplexe Dokumente, Diagramme und natürliche Bilder" und zielt auf Branchen, in denen visuelle Wahrnehmung zählt – etwa Engineering, Fertigung und Erdbeobachtung. Die Demos sind durchweg industriell: Bauteile in technischen Zeichnungen prüfen, Belege aus PDFs ziehen, Gigapixel-Satellitenbilder nach schwer auffindbaren Objekten scannen.
160+ Sprachen
Die gleichen Industriekunden arbeiten oft grenzüberschreitend – hier kommt Sprache ins Spiel. Mistral sagt, ein "erheblicher Anteil" der Trainingsdaten sei mehrsprachig gewesen, mit über 160 Sprachen und allen offiziellen EU-Sprachen. Für ein europäisches Unternehmen, das europäische Regierungen anspricht, ist das ein großer Teil des Angebots.
Trainingsinfrastruktur
Für das europäische Angebot zählt auch, wo das Training stattfand. Laut Mistral wurde ML4 von Grund auf auf 3.800 Nvidia Grace Blackwell GPUs trainiert – in Mistrals eigenen europäischen Rechenzentren. Mistrals VP Science Pierre Stock nannte gegenüber TechCrunch eine rundere Zahl von 4.000 und sagte, das sei "zwei- bis dreimal weniger als bei unseren chinesischen Wettbewerbern". Diese Aussage ist nicht verifiziert.
Der Compute-Ausbau dahinter ist seit Längerem bekannt. Im März 2026 hat Mistral 830 Mio. US-Dollar an Fremdkapital aufgenommen, um 13.800 Nvidia GB300 GPUs für ein Rechenzentrum bei Paris zu kaufen. Mistral sagt nicht, ob ML4 genau auf diesem Cluster trainiert wurde, daher stelle ich keinen direkten Zusammenhang her.
Ein Detail verändert, wie du jeden Benchmark in diesem Artikel lesen solltest. Der Reinforcement-Learning-(RL)-Lauf läuft noch. RL ist die Phase nach dem Grundtraining, in der das Modell anhand der Bewertung seiner eigenen Lösungsversuche verbessert wird. Laut Mistral laufen derzeit etwa 3.000 GPUs, es werden rund 33 Milliarden Tokens pro Tag generiert und es gibt "keine Anzeichen für Sättigung". Das heißt: Das Modell, das du heute per API aufrufst, ist nicht identisch mit dem, dessen Gewichte am 27. Oktober veröffentlicht werden.
Mistral Large 4 Benchmarks
Dieser laufende RL-Lauf ist der erste Grund, alles in diesem Abschnitt als vorläufig zu betrachten. Der zweite: Die meisten Zahlen von Mistral wurden noch nicht unabhängig reproduziert – und dort, wo es passierte, stimmen sie nicht immer überein.
Unabhängige Auswertungen zum Launch fallen in drei Gruppen:
- Unabhängig reproduziert: der Artificial Analysis (AA) Cyber Index inklusive CyberGym-E2E sowie fünf vals.ai-Auswertungen, darunter Terminal-Bench 4.0.
- Von AA durchgeführt, aber noch nicht öffentlich: Eine Fußnote zu Mistrals Coding-Charts sagt, dass die DeepSWE-, Terminal-Bench- und SWE-Atlas-Scores "die privat von Artificial Analysis vor dem öffentlichen Start des Harness evaluierten Zahlen" nutzen. Sie erscheinen auf AAs Coding Agent Index, sobald dieser Harness veröffentlicht ist. Bis dahin kann es niemand außerhalb von AA und Mistral überprüfen.
- Nur Mistral: alles andere.
Schau am genauesten auf die letzte Spalte der Tabelle. Ein Benchmark kann von einer unabhängigen Gruppe stammen, während der ML4-Score darauf trotzdem nur Mistrals eigener Wert ist.
Benchmark-Überblick
|
Benchmark |
ML4-Ergebnis |
Wettbewerber |
Was gemessen wird |
|
DeepSWE v1.1 |
61,7%, privat von AA gelaufen |
Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (selbst berichtet) |
Langfristige Softwareentwicklung |
|
Terminal-Bench 4.0 |
28,3% laut Mistral, 22,73% laut vals.ai |
Platz 20 von 44 auf vals.ai |
Komplexe Terminal-Workflows |
|
SWE-Atlas-QnA |
59,4%, privat von AA gelaufen |
Nicht veröffentlicht |
Repository-Verständnis |
|
Coding Agent Index |
49,8%, privat von AA gelaufen |
Vor DeepSeek V4 Pro 0813 und Qwen3.8 Max |
Kombinat aus den drei Coding-Benchmarks oben |
|
AutomationBench |
59,9% laut Mistral |
Vor Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro |
657 Business-Workflows über Apps wie Gmail, Slack und Salesforce |
|
AA-Briefcase |
1.393 Elo, von Mistral als AA zitiert |
Vor DeepSeek V4 Pro |
Langfristige Wissensarbeit |
|
Dense 200 |
42% laut Mistral |
GPT-6 Astra 41% |
Visuelles Grounding |
|
AA Cyber Index |
Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53% |
Fehler in echter Software finden und beheben |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%, GPT-6 Luna 78% |
Eine echte Schwachstelle reproduzieren und patchen |
|
|
93% laut Mistral |
"Einer der höchsten" Werte für Open Weights, laut Mistral |
40 Security-Wettbewerbsaufgaben |
|
|
Finance Agent v2 |
Platz 22 von 75, Platz 7 von 32 Open-Weight |
Finanz-Agentenaufgaben |
|
|
Harvey's Legal Agent |
#1 von 31 Open-Weight |
Autonome juristische Aufgaben |
|
|
1,691 von 2 laut Mistral |
Höchster Wert unter den von Mistral getesteten offenen Modellen |
Verantwortungsvolles KI-Verhalten |
|
|
93,3% laut Mistral |
"Keine höheren Werte bei Wettbewerbern", laut Mistral |
Widerstand gegen Prompt-Injection |
|
|
Vals Index |
Platz 9 von 16 Open-Weight |
Breiter Aggregatindex über Aufgaben |
Mistral-4-Benchmark-Rankings
Lies die letzte Zeile im Kontext von Mistrals Headline-Claim. Auf dem breiten Index von vals.ai landet ML4 insgesamt auf Platz 32 von 44 und auf Platz 9 von 16 unter den Open-Weight-Modellen. Das ist schwer mit "auf Augenhöhe mit den stärksten Open-Source-Modellen weltweit" zu vereinbaren – zumindest im Aggregat. Mistrals vertikale Ergebnisse sehen deutlich besser aus, und sie sind valide. Sie messen nur etwas Engeres. Wenn du entscheidest, ob du auf ML4 aufbaust, zählt die für dich relevante Domäne mehr als jede Headline.
Coding
Beim Coding zeigt sich die Lücke zwischen Schlagzeile und Detail zuerst. Mistrals Zahlen sehen auf den ersten Blick gut aus. Schau dir aber das DeepSWE-Diagramm an, und du siehst etwas, das im Text nicht erwähnt wird. Der höchste Balken ist Kimi K3 mit 69%, sieben Punkte vor ML4. ML4 liegt knapp vor GLM-5.3 (62% vs. 61%), aber ein Punkt liegt locker im Rauschen der Harness-Wahl. Ein "Harness" ist das Gerüst, das ein Modell in agentischen Benchmarks umgibt – Tools, Prompts und Anzahl der Versuche –, und in Mistrals Chart lief jeder Wettbewerber in einem anderen. Auf Datacurves eigener Live-DeepSWE-Rangliste, die jedes Modell im gleichen Setup laufen lässt, erreichen GLM-5.3 und Kimi K3 jeweils 69% und DeepSeek V4 Pro 63%. ML4 ist dort noch nicht gelistet.
Terminal-Bench zeigt den gleichen Effekt aus der anderen Richtung. Mistral meldet 28,3%, vals.ai hat unabhängig 22,73% gemessen. Ich lese das nicht als bewusste Aufblähung, sondern als Erinnerung: Eine Zahl aus einem Setup ist noch kein Ranking.
Spannender sind die Human-Evals. In einer von Mistral beauftragten Blindbewertung durch Surge AI bewerteten Profi-Annotatoren Coding-Ausgaben von 1 bis 5. ML4 landete auf Platz 2 von 5 (3,74), vor GLM-5.3 (3,60), Kimi K3 (3,59) und GLM-5.2 (3,40) und deutlich hinter Claude Opus 5 (4,22). Beachte Kimi K3: Sieben Punkte vor ML4 auf DeepSWE, dahinter bei der menschlichen Präferenz. Tests bestehen und Code schreiben, den Menschen gerne lesen, sind nicht dasselbe. (Und das ist Opus 5, nicht das neuere 5.5 – die Lücke zum besten geschlossenen Modell ist also wahrscheinlich größer.)
Eine zweite, interne Mistral-Evaluation macht es noch trüber. Sie fand ML4 beim Coding und in Finanzen "gleichauf oder nahe" bei GLM-5.3 und bevorzugt nur in CAD und MINT. Ich würde die beiden etwa gleich stark einschätzen.
Finanzen
Finanzen ist einfacher, vor allem weil es eine unabhängige Zahl als Anker gibt. ML4 erreicht 54,68% auf Finance Agent v2 bei vals.ai – Platz 22 von 75 insgesamt und Platz 7 von 32 unter Open-Weight-Modellen. Solides Mittelfeld. Mistrals eigentlicher Claim ist enger: dass ML4 GPT-6 Astra auf diesem Benchmark schlägt.
Mistral berichtet außerdem starke Ergebnisse auf dem FinWorkBench, der prüft, ob ein Modell Tabellen für echte Finanz- und Buchhaltungsaufgaben erstellen und bearbeiten kann. Diese Zahlen stammen aus Mistrals Charts und wurden noch nicht anderswo reproduziert.
Recht
Recht sieht auf dem Papier deutlich besser aus. Auf dem Harvey's Legal Agent Benchmark belegt ML4 Platz 6 von 75 und Rang 1 unter 31 Open-Weight-Modellen. Der Score liegt bei 15,83%.
Lies die Zahl zweimal. Platz sechs weltweit bei autonomer Rechtsarbeit heißt: ungefähr jede sechste Aufgabe wird erledigt. Der Benchmark ist schwer, und das Ranking ist real, aber niemand sollte das als "ML4 kann Rechtsarbeit unbeaufsichtigt" verstehen. Das kann noch kein Modell.
Vision und visuelles Grounding
Bei Vision ist es umgekehrt: kühne Aussagen, noch keine unabhängigen Daten. Der Headline-Claim betrifft visuelles Grounding, also das Auffinden bestimmter Objekte oder Regionen in einem Bild anhand einer Textbeschreibung – eher "finde die gebrochene Schweißnaht in dieser Zeichnung" als "beschreibe dieses Bild". Mistral meldet 42% auf Dense 200, knapp vor GPT-6 Astra mit 41%. Auf Basis eines Punktes würde ich keine Kaufentscheidung treffen.
Mistral sagt außerdem, ML4 performe gut auf ChartQA Pro und GDP.pdf, einem Benchmark für Dokumentenverständnis. Keines der Vision-Ergebnisse wurde bislang unabhängig reproduziert. Die hervorgehobenen Use Cases sind überwiegend industriell – von Satellitenbildern für Katastrophenhilfe über die Prüfung technischer Zeichnungen bis zum Scannen großer Geodatenbilder.
Wie gut ist Mistral Large 4 für Coding?
Zurück zum Coding – der häufigste Einsatz für ML4. Es ist unter Open-Weight-Modellen konkurrenzfähig, aber nicht das beste verfügbare Coding-Modell – und nicht einmal das beste offene auf Mistrals eigener Grafik. Die Zahlen spare ich mir, so übersetze ich sie in Arbeitspraxis:
- Fehler in echten Codebasen beheben (agentische Softwareentwicklung): nutzbar, aber Kimi K3 wirkt stärker.
- Große Repositories verstehen: vielversprechend, beruht aber auf einem privat gelaufenen Score.
- Lange, mehrstündige Agentenläufe: Mistrals RL-Setup ist für lange Trajektorien gebaut, aber niemand hat das unabhängig getestet.
- Terminal-lastige Arbeit: bislang das schwächste unabhängige Signal.
Ich würde auf ML4s Eintrag im öffentlichen Coding Agent Index von AA warten – erwartet nach Veröffentlichung der Gewichte –, bevor ich es über "glaubwürdige Open-Weight-Option" hinaus einstufe.
Was offene Gewichte hier zusätzlich bringen, hat nichts mit Scores zu tun. Ein Unternehmen kann ML4 auf eigener Infrastruktur betreiben und muss nie proprietären Quellcode an eine externe API senden. Für Coding-Agenten auf vertraulichen Codebasen kann das allein entscheidend sein.
Mistral Large 4 für Cybersicherheit
Das ist Mistrals kühnste Aussage. Auf dem Artificial Analysis Cyber Index, AAs unabhängiger Bewertung dafür, wie gut Modelle Schwachstellen in echter Software finden, reproduzieren und patchen, erzielt ML4 50%. Das bringt es in die Top 5 der 18 getesteten Modelle. Nur Grok 4.7, MiMo-V2.6-Pro und GPT-6 Luna liegen höher, GLM-5.3 Flash liegt gleichauf. Mistral sagt, ML4 "führt Open-Weight-Modelle außerhalb Chinas mit großem Abstand an", und AAs Chart stützt das.
Herausragend ist CyberGym-E2E, eine von drei Komponenten des Index. Es fordert ein Modell auf, eine echte Schwachstelle in Open-Source-Software (eine "CVE", also eine öffentlich katalogisierte Sicherheitslücke) zu reproduzieren und anschließend zu patchen. ML4 erzielt 82% – Platz 1 der 18 von AA getesteten Modelle. Mistral meldet zudem 93% auf Cybench, einem Set von 40 Security-Wettbewerbsaufgaben – bisher ohne unabhängige Reproduktion.
Auch die Ablehnungsdaten sind interessant. Bei CyberGym-E2E zeigt AAs Chart, dass Claude Opus 5.5 aus Sicherheitsgründen rund 96% der Aufgaben blockt und GPT-6 Astra 100%. Diese Modelle erzielen nahezu null Punkte, weil sie die Aufgabe verweigern – ihre Scores sagen also nichts über ihre tatsächliche Leistungsfähigkeit aus. Ob die Verweigerung die richtige Policy ist, ist eine andere Debatte.
Und genau hier setzt Mistrals Kernargument an. Defensive Security-Arbeit beginnt oft damit, einen Fehler zu reproduzieren, um seine Existenz zu belegen – und Security-Teams müssen das in großer Zahl tun, große Codebasen scannen und Hunderte Findings triagieren. Ein Modell, das den Großteil dieser Arbeit verweigert oder dessen Anbieter Moderationsregeln mitten im Incident ändert, ist ein Risiko. Mistrals Argument lautet: Wenn du ML4 auf eigener Infrastruktur betreibst, liegt sein Verhalten unter deiner Kontrolle. Die breitere Debatte darüber, dass KI-Schutzmaßnahmen legitime defensive Arbeit blockieren, läuft seit Längerem.
Nun zum heiklen Teil: Sobald die Gewichte öffentlich sind, erhalten Angreifer dieselben Fähigkeiten. AAs Index ist bewusst defensiv (Modelle arbeiten mit Quellcode und sollen nie einen funktionierenden Exploit bauen), daher sind 82% Reproduktion nicht 82% offensive Fähigkeit. Dennoch ist der Weg von "Crash reproduzieren" zu "weaponizen" nicht endlos. Mistral nutzt die drei Wochen vor dem Release für intensives Red-Teaming – gemeinsam mit "Security-Leadern, geprüften Partnern und staatlichen Stellen".
Warum offene Gewichte bei Mistral Large 4 wichtig sind
Der Cybersecurity-Case ist eigentlich ein Plädoyer für offene Gewichte – und er reicht weit über Security hinaus. "Du kannst das Modell herunterladen" greift zu kurz.
Eine Bank, die ML4 auf eigenen Servern betreibt, sendet keine Kundendaten an Mistral. Eine Behörde kontrolliert die gesamte Umgebung. Ein Security-Team kann das Modellverhalten anpassen, ohne auf die Moderationspolicy eines Anbieters zu warten – nach dem letzten Abschnitt kein hypothetisches Problem. Und wenn ein Anbieter ausfällt oder eine Modellversion zurückzieht, laufen Self-Hosted-Deployments weiter.
Offene Gewichte machen auch Anpassungen praktikabel. Ich habe Mistral Forge im April behandelt, und Mistral sagt, ML4 "nutzt dieselbe Trainings-, Anpassungs- und RL-Umgebung", die es Unternehmenskunden über Forge anbietet. Für Organisationen, die ML4 auf eigenen Daten feinabstimmen wollen, ist Forge der naheliegende Weg.
Ein Wort zur Begrifflichkeit. Open-Weight bedeutet, dass die trainierten Modellparameter öffentlich verfügbar sind. Das heißt nicht, dass Trainingsdaten, Trainingscode oder anderes unter einer Open-Source-Lizenz veröffentlicht werden. Mistrals Modellseite beschreibt ML4 als Open-Weight, hat aber die Lizenzbedingungen noch nicht veröffentlicht. Bis dahin sind kommerzielle Nutzung, Fine-Tuning-Rechte und Weiterverteilung offen. Es ist etwas frustrierend, bei einem Modell, dessen Pitch auf Kontrolle basiert, "prüfe die Lizenz" schreiben zu müssen – aber so ist der Stand.
Mistral Large 4 und Europas Streben nach KI-Souveränität
Kontrolle steht auch im Zentrum von Mistrals politischem Angebot. Frankreichs Präsident Macron beschrieb Mistrals Ansatz als "einen dritten Weg in der KI". Die ersten beiden Wege sind US-Closed-Modelle – leistungsfähig, aber US-Recht und Anbieterpolicy unterworfen – und chinesische offene Modelle – oft leistungsfähig, aber mit Bedenken zu Datenresidenz und Geopolitik für europäische Institutionen. Mistrals Angebot: offene Gewichte, europäische Infrastruktur, europäisches Recht.
Dazu gehört ein europäischer Betrieb, den Mistral "End-to-End, unabhängig von anderen digitalen Diensteanbietern und unter europäischem Recht" betreibt. Wenn du unter die DSGVO oder sektorale Datenresidenzregeln fällst, verifiziere das anhand von Mistrals Auftragsverarbeitungsverträgen, bevor du dich darauf verlässt.
Mistral hat auch das Kapital, um das zu untermauern. Mistral nennt ML4 "den ersten Meilenstein auf dem Lernplan, finanziert durch unsere Serie D über 3 Mrd. €" – eine Runde unter Führung von Samsung bei einer Bewertung von 21 Mrd. €, die Mistral als die größte Eigenkapitalrunde bezeichnet, die je von einem europäischen Tech-Unternehmen aufgenommen wurde. Der Großteil fließt in europäische Rechenzentrumskapazitäten.
Kann Europa also Frontier-Modelle bauen und Organisationen gleichzeitig mehr Kontrolle darüber geben, wo und wie sie laufen? ML4 ist ein starkes Datenpunkt für den Kontrollteil. Beim Frontier-Teil sagt Platz 32 von 44 im Vals Index: Noch nicht.
Mistral Large 4 vs. andere Open-Weight-Modelle
Wenn Europa noch nicht soweit ist, ist die Frage fair: Wer ist es – und wie schneidet ML4 im Vergleich ab? Ich stelle nicht alle Modelscores in eine Tabelle, da sie aus unterschiedlichen Setups stammen und eine kombinierte Tabelle Vergleichbarkeit suggerieren würde. Parameterzahlen sind ebenfalls kein Proxy für Leistungsfähigkeit.er. Die Tabelle unten verortet sie nur:
|
Modell |
Architektur |
Gewichte verfügbar |
Stärken |
Herkunft |
|
Mistral Large 4 |
MoE, 1T gesamt / 49B aktiv |
27. Oktober (geplant) |
Cybersicherheit, Recht (unabhängig gestützt) |
Frankreich |
|
GLM-5.3 |
Nicht offengelegt |
Ja |
Coding, MINT |
China |
|
DeepSeek V4 Pro |
MoE |
Ja |
Coding, Mathematik |
China |
|
Reflection Beam |
Nicht offengelegt |
Ja |
Allgemeines Reasoning |
USA |
|
Qwen3.8 Max |
Nicht offengelegt |
Nicht bestätigt |
Mehrsprachigkeit, Coding |
China |
Mistral Large 4 vs. GLM-5.3
Der wichtigste Vergleich, da GLM-5.3 zu den stärksten chinesischen Open-Modellen zählt. Wie im Coding-Abschnitt beschrieben, liegen sie in Mistrals Chart einen Punkt auseinander, die Human-Evals sind gemischt, und GLM-5.3 erreicht 69% auf der Live-Rangliste, auf der ML4 noch fehlt. Nenn es ein Remis, bis unabhängige Leaderboards beide führen.
Mistral Large 4 vs. DeepSeek V4 Pro
ML4 gewinnt alle von Mistral veröffentlichten Vergleiche (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), aber keiner ist unabhängig bestätigt, und DeepSeek V4 Pro erreicht 63% auf der Live-DeepSWE-Rangliste – über ML4s 62%. Für Finanzen gibt es keinen veröffentlichten Direktvergleich.
Mistral Large 4 vs. Reflection Beam
Reflection Beam ist der andere westliche Open-Weight-Kandidat und damit der direkteste Test für Mistrals Claim "bestes außerhalb Chinas". Die Datenlage ist dünn. Mistrals DeepSWE-Chart listet Beam mit 44% – fast 18 Punkte unter ML4 –, aber das ist ein selbst gemeldeter Wert im Vergleich zu einem AA-gelaufenen Score, also würde ich die Lücke nicht überbewerten. Reflection hat Beams Größe nicht offengelegt, ein Größenvergleich ist daher nicht möglich. ML4 bietet jedoch breiteren multimodalen Input und deutlich stärkere veröffentlichte Evidenz in der Cybersicherheit.
Ab wann kannst du Mistral Large 4 nutzen?
Du musst nicht warten, bis alle Vergleiche settled sind, um ML4 selbst zu testen. Bisheriger Rollout:
- 6. Oktober: Die Public Preview startete. Jeder kann mistral-large-4 über Mistral Studio aufrufen.
- Während der Preview: Security-Leads, geprüfte Partner und staatliche Stellen erhalten eine Version mit "reduzierter Moderation und erweiterten Cyber-Fähigkeiten" fürs Red-Teaming. Pierre Stock sagte zu TechCrunch, Mistral werde "mit vertrauenswürdigen Partnern und Regierungen zusammenarbeiten, um sicherzustellen, dass die Open-Source-Gewichte zur Verteidigung, nicht für böswillige Angriffe genutzt werden". Parallel läuft das RL-Training weiter – das API-Modell verändert sich also fortlaufend.
- 27. Oktober: Die Gewichte sollen veröffentlicht werden – zusammen mit vollständigen Architekturdetails, weiteren Benchmarks und Mistrals Post-Training-Methodik.
Ich aktualisiere diesen Abschnitt, sobald die Gewichte veröffentlicht sind.
Was wir über Mistral Large 4 noch nicht wissen
Bis dahin bleibt vieles offen. Ich schreibe am Launch-Tag, die Liste ist lang:
- Finale Benchmark-Leistung: RL läuft noch, alle obigen Werte können sich ändern. Mistral erwartet "große und schnelle Verbesserungen", gemessen hat das noch niemand.
- Unabhängige Ergebnisse zu Coding, Vision und Wissensarbeit: jenseits des AA Cyber Index und vals.ai ist noch nichts reproduziert.
- Preise: Ankündigung und Docs-Seite widersprechen sich, und Preview-Konditionen gelten womöglich nicht fort.
- Lizenzbedingungen: Auf "Open-Weight" allein lässt sich kein Produkt bauen.
- Hardware-Anforderungen fürs Self-Hosting: nicht veröffentlicht.
- Volle Architektur: mit den Gewichten versprochen – möglicherweise auch die Erklärung für die Diskrepanz 49B vs. 52B aktive Parameter.
- Kontextfenster: 1 Mio. Tokens laut Mistrals Docs, 512K laut vals.ai.
- Abschließende Sicherheitsbewertung: Red-Teaming läuft bis Oktober.
Fazit
Mistral Large 4 ist ein spärliches Modell mit 1 Billion Parametern, 49 Milliarden aktiven Parametern, multimodalem Input und bald verfügbaren offenen Gewichten. Zum Launch-Tag sehen wir: Bestes Open-Weight-Modell auf Harveys Legal-Benchmark, aber Platz 32 von 44 im Vals Index und hinter Kimi K3 auf Mistrals eigener Coding-Grafik.
Ich glaube ohnehin nicht, dass Benchmark-Führerschaft Mistrals eigentliche Wette ist. Die Wette lautet: Leistungsfähige offene Gewichte plus Self-Hosting sind das, worauf Unternehmen und Behörden am meisten Wert legen. Die Ablehnungsdaten aus der Cybersicherheit sind der bislang deutlichste Beleg, dass dieses Paket ein reales Problem in Security-Teams löst.
Der 27. Oktober ist der Termin, auf den es ankommt. Dann kommen die Gewichte, unabhängige Forschende können den finalen Checkpoint selbst laufen lassen, und Artificial Analysis und vals.ai testen das tatsächlich veröffentlichte Modell statt einer noch trainierenden Preview. Le Chonk wird seinem Launch-Post dann gerecht – oder nicht.
Die Grundlagen zu MoE-Modellen findest du in unserem Kurs Introduction to Large Language Models. Mehr zu Mistrals Produkten: unsere Beiträge zu Mistral Forge, Mistral Large 3, Mistral Le Chat und Mistral Vibe 2.0, dem terminalbasierten Coding-Agenten.
Technischer Redakteur, der sich auf KI, ML und Datenwissenschaft spezialisiert hat und komplexe Ideen verständlich und nachvollziehbar macht.
FAQs
Was ist Mistral Large 4 (Le Chonk)?
Es ist Mistrals neues Flaggschiff, am 6. Oktober 2026 in einer Public Preview gestartet: ein Mixture-of-Experts-Modell mit rund 1 Billion Gesamtparametern und 49 Milliarden aktiven pro Token. Es nimmt Text und Bilder entgegen, erzeugt Text und hat offene Gewichte für den 27. Oktober in Aussicht.
Warum heißt es Le Chonk?
Es ist ein Verweis auf "Le Chaton Fat", ein fiktives 24-Billionen-Parameter-Modell, das Mistral im Juni 2026 scherzhaft ankündigte und dann löschte. Der Witz verbreitete sich in der KI-Community, und als ein echtes Billionen-Modell kam, blieb der Name hängen.
Worin ist Mistral Large 4 am besten?
Die stärksten unabhängigen Ergebnisse liegen in Cybersicherheit und Rechtsarbeit. Es gehört zu den Top 5 von 18 Modellen im Artificial Analysis Cyber Index und belegt Platz 6 von 75 auf dem Harvey's Legal Agent Benchmark – jeweils Rang 1 unter Open-Weight-Modellen (Stand: 6. Oktober). Auf dem breiten Vals Index rangiert es auf Platz 32 von 44 – vertikale Stärke und Gesamtleistung erzählen also unterschiedliche Geschichten.
Ist Mistral Large 4 Open Source?
Nein. Es ist Open-Weight – das ist etwas anderes. Open-Weight bedeutet, dass die Modellparameter öffentlich verfügbar sind, aber nicht zwingend Trainingsdaten, Trainingscode oder andere Komponenten. Mistral hat die Lizenzbedingungen noch nicht veröffentlicht – prüfe sie, bevor du ein Produkt darauf aufbaust.
Wann kann ich die Gewichte von Mistral Large 4 herunterladen?
Am 27. Oktober 2026, laut Axios. Die API ist bereits über Mistral Studio verfügbar, aber die Preview befindet sich noch im Reinforcement Learning – die veröffentlichten Gewichte werden sich daher vom aktuellen API-Modell unterscheiden.
