Przejdź do głównej treści

Mistral Large 4 (Le Chonk): wszystko, co wiemy

Bilionowy model Mistrala z otwartymi wagami prowadzi w benchmarkach cyberbezpieczeństwa i prawa.
Zaktualizowano 9 paź 2026  · 15 min przeczytaj

Odkryj z AI

ChatGPTClaudePerplexity

6 października 2026 r. Mistral uruchomił publiczny podgląd Mistral Large 4 (ML4) — modelu o 1 bilionie parametrów, z 49 miliardami aktywnych parametrów, wejściem tekstowo-obrazowym i obietnicą udostępnienia wag do końca miesiąca. To największy model, jaki Mistral kiedykolwiek zbudował, wytrenowany od zera na 3 800 GPU Nvidia Grace Blackwell w europejskich centrach danych Mistrala.

Przez większość ostatniego roku najmocniejsze modele z otwartymi wagami pochodziły z chińskich laboratoriów (GLM, DeepSeek, Kimi, Qwen), podczas gdy najmocniejsze modele w ogóle pozostawały zamknięte za amerykańskimi API. Mistral celuje w trzecią ścieżkę. W ogłoszeniu czytamy, że ML4 „już osiąga wydajność konkurencyjną względem najsilniejszych modeli open-source na świecie, znacząco przewyższając każdy model z otwartymi wagami opracowany w USA lub Europie”.

Obraz jest jednak bardziej złożony, niż sugeruje wpis premierowy. Poniżej omawiam architekturę, benchmarki (oddzielając to, co niezależnie odtworzono, od tego, czego nie), kodowanie, wizję, cyberbezpieczeństwo, otwarte wagi i to, czego wciąż nie wiadomo. Jeśli masz czas tylko na jedną sekcję, wybierz cyberbezpieczeństwo.

Szybka odpowiedź

Mistral Large 4 (Le Chonk) to model z otwartymi wagami o 1 bilionie parametrów, który Mistral przedstawia jako najsilniejszy zbudowany poza Chinami — zwłaszcza do cyberbezpieczeństwa, finansów, prawa i wizualnego grounding’u. Niezależne oceny potwierdzają wyniki w cyberbezpieczeństwie i prawie, lokują finanse w środku stawki i klasyfikują ML4 na 32. miejscu spośród 44 modeli w szerokim indeksie zbiorczym. API działa już teraz, a wagi mają się ukazać 27 października.

Czym jest Mistral Large 4 (Le Chonk)?

Krótka wersja pomija sporo szczegółów, więc zacznijmy od podstaw. ML4 to nowy flagowiec Mistrala i — jak mówi Mistral — jego „największy i najbardziej zaawansowany model do tej pory”. Le Chonk to pseudonim, choć w materiałach premierowych Mistral odwraca zwyczajową kolejność: „Nieoficjalnie ML4, bardzo oficjalnie: le Chonk”.

To natywnie multimodalny model typu Mixture-of-Experts (MoE). Kluczowe liczby to 1 bilion parametrów łącznie i 49 miliardów aktywnych na token, choć w dokumentacji modelu Mistrala widnieją nieco inne wartości (1,05 bln łącznie, 52 mld aktywnych). Żadne ze źródeł nie wyjaśnia rozbieżności. (Dlaczego „aktywne” ma znaczenie — w kolejnej sekcji.)

Mistral kieruje ML4 do zastosowań korporacyjnych: kodowanie, cyberbezpieczeństwo, finanse, prawo, produkcja i inżynieria oraz zadania wizualne, takie jak odczyt rysunków technicznych czy obrazów satelitarnych.

Specyfikacja

Szczegóły

Łączna liczba parametrów

1 bilion wg ogłoszenia, 1,05 bln wg dokumentacji

Aktywne parametry

49 mld wg ogłoszenia, 52 mld wg dokumentacji

Architektura

Mixture-of-Experts, hybryda instrukcji i rozumowania

Wejście

Tekst i obrazy

Wyjście

Tylko tekst

Okno kontekstu

1 mln tokenów wg dokumentacji, 512 tys. wg vals.ai (nierozstrzygnięte)

Dwie pozycje są kluczowe dla planujących wdrożenie i obie pozostają nierozstrzygnięte: okno kontekstu i licencja. Zanim przejdziemy do działania modelu, warto krótko wyjaśnić nazwę.

Skąd nazwa Le Chonk?

W czerwcu 2026 r. Mistral opublikował satyryczne ogłoszenie „Le Chaton Fat” — fikcyjnego modelu o 24 bilionach parametrów — po czym je usunął. Internet żył jednak dalej, pompując specyfikacje w setki bilionów. Cztery miesiące później Mistral dostarczył rzeczywisty model bilionowy i nazwa niejako narzuciła się sama. To cała historia. Wracamy do modelu.

Jak działa Mistral Large 4

Mistral nie opublikował jeszcze pełnych szczegółów architektury (mają się pojawić wraz z wagami), więc tu trzymam się ujawnionych informacji.

1 bilion parametrów, 49 miliardów aktywnych

Model o 1 bilionie parametrów nie używa wszystkich 1 bln na każdym tokenie. Modele MoE kierują każdy token przez mały podzbiór „eksperckich” pod-sieci, więc koszt wnioskowania odpowiada 49 mld aktywnych parametrów. To plasuje go bliżej ~50-milardowego modelu gęstego niż 1-bln.

Tani w serwowaniu? Nie. Wszystkie 1 bln parametrów muszą i tak zmieścić się w pamięci, więc samodzielne hostowanie ML4 wymaga poważnej infrastruktury multi-GPU. Modele MoE są też trudniejsze do serwowania z niskimi opóźnieniami niż modele gęste o tej samej liczbie aktywnych parametrów. Mistral nie opublikował wymagań sprzętowych i zdziwiłbym się, gdyby wiele zespołów spoza dużych przedsiębiorstw i administracji uruchamiało pełny model u siebie.

Multimodalne wejście

Te aktywne parametry obsługują więcej niż tekst. ML4 przyjmuje też obrazy, choć zwraca wyłącznie tekst. Mistral twierdzi, że „mocno rozumuje na złożonych dokumentach, wykresach i obrazach naturalnych” i celuje w branże, gdzie liczy się percepcja wizualna, jak inżynieria, produkcja czy obserwacja Ziemi. Dema są wybitnie przemysłowe: inspekcja części mechanicznych na rysunkach technicznych, wydobywanie dowodów z PDF-ów, skanowanie gigapikselowych obrazów satelitarnych w poszukiwaniu trudnych do wykrycia obiektów.

Ponad 160 języków

Ci sami klienci przemysłowi często działają ponad granicami — stąd języki. Mistral mówi, że „znacząca część” danych treningowych była wielojęzyczna, obejmując ponad 160 języków i wszystkie oficjalne języki UE. Dla europejskiej firmy zabiegającej o europejskie rządy to ważny element oferty.

Infrastruktura treningowa

W europejskiej narracji liczy się też, gdzie odbywał się trening. Według Mistrala ML4 został wytrenowany od zera na 3 800 GPU Nvidia Grace Blackwell we własnych europejskich centrach danych. Wiceprezes ds. nauki Mistrala, Pierre Stock, podał TechCrunch zaokrągloną liczbę 4 000 i stwierdził, że to „dwa do trzech razy mniej niż u naszych chińskich konkurentów”. Nikt nie zweryfikował tego porównania.

Rozbudowa mocy obliczeniowych stoi za tym od dawna. W marcu 2026 r. Mistral pozyskał 830 mln dol. długu na zakup 13 800 GPU Nvidia GB300 dla centrum danych pod Paryżem. Mistral nie mówi, czy ML4 trenowano konkretnie na tym klastrze, więc nie będę łączył tych faktów.

Jeden szczegół zmienia sposób odczytu wszystkich benchmarków w tym artykule. Etap reinforcement learning (RL) wciąż trwa. RL to faza potreningowa, w której model poprawia się, oceniając własne próby rozwiązywania zadań; Mistral mówi, że obecnie używa ok. 3 000 GPU, generuje ok. 33 mld tokenów dziennie i „nie widać oznak nasycenia”. Zatem model dostępny dziś przez API nie będzie tym samym, którego wagi trafią 27 października.

Benchmarki Mistral Large 4

Trwający RL to pierwszy powód, by traktować wszystko w tej sekcji jako wstępne. Drugi to fakt, że większość liczb Mistrala nie została niezależnie odtworzona, a te, które tak — nie zawsze się pokrywają.

Niezależna ewaluacja na starcie mieści się w trzech koszykach:

  • Niezależnie odtworzone: Artificial Analysis (AA) Cyber Index, w tym CyberGym-E2E, oraz pięć ewaluacji vals.ai, w tym Terminal-Bench 4.0.
  • Uruchomione przez AA, ale jeszcze niepubliczne: przypis na wykresach kodowania Mistrala mówi, że wyniki DeepSWE, Terminal-Bench i SWE-Atlas „używają liczb ocenionych prywatnie przez Artificial Analysis przed publicznym wydaniem harnessu”. Pojawią się w Coding Agent Index AA po jego wydaniu. Do tego czasu nikt poza AA i Mistralem nie może ich sprawdzić.
  • Wyłącznie Mistral: cała reszta.

Największą uwagę zwróć na ostatnią kolumnę tabeli. Benchmark może być zbudowany przez niezależną grupę, ale wynik ML4 może pochodzić wyłącznie z deklaracji Mistrala.

Podsumowanie benchmarków

Benchmark

Wynik ML4

Konkurenci

Co mierzy

DeepSWE v1.1

61,7%, uruchomiony prywatnie przez AA

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (samodzielnie raportowane)

Długohoryzontalne inżynieria oprogramowania

Terminal-Bench 4.0

28,3% wg Mistrala, 22,73% wg vals.ai

20. miejsce z 44 na vals.ai

Złożone przepływy pracy w terminalu

SWE-Atlas-QnA

59,4%, uruchomiony prywatnie przez AA

Nieopublikowane

Zrozumienie repozytorium

Coding Agent Index

49,8%, uruchomiony prywatnie przez AA

Przed DeepSeek V4 Pro 0813 i Qwen3.8 Max

Złożenie trzech powyższych benchmarków kodowania

AutomationBench

59,9% wg Mistrala

Przed Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 przepływów pracy w aplikacjach typu Gmail, Slack, Salesforce

AA-Briefcase

1 393 Elo, cytowane przez Mistrala jako AA

Przed DeepSeek V4 Pro

Długohoryzontalna praca wiedzy

Dense 200

42% wg Mistrala

GPT-6 Astra 41%

Wizualny grounding

AA Cyber Index

50%, top 5 z 18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Wyszukiwanie i naprawa błędów w prawdziwym oprogramowaniu

CyberGym-E2E

82%, #1 z 18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Odtworzenie i załatanie realnej podatności

Cybench

93% wg Mistrala

„Jedne z najwyższych” dla otwartych wag, wg Mistrala

40 zadań z konkursów bezpieczeństwa

Finance Agent v2

54,68%

22. z 75, 7. z 32 z otwartymi wagami

Zadania agenta finansowego

Harvey's Legal Agent

15,83%, #6 z 75

#1 z 31 z otwartymi wagami

Autonomiczne zadania prawnicze

Benchmark KORA

1,691 z 2 wg Mistrala

Najwyższy wśród otwartych modeli testowanych przez Mistrala

Odpowiedzialne zachowanie AI

B3 Attack Resistance

93,3% wg Mistrala

„Brak wyższych wyników u konkurencji”, wg Mistrala

Odporność na injection promptów

Vals Index

48,05%, 32. z 44

9. z 16 z otwartymi wagami

Szeroki agregat zadań

Rankingi benchmarków Mistral 4

Przeczytaj ostatni wiersz obok głównego hasła Mistrala. W szerokim indeksie vals.ai ML4 zajmuje 32. miejsce z 44 ogółem i 9. z 16 wśród samych modeli z otwartymi wagami. Trudno to pogodzić z „konkurencyjny względem najsilniejszych modeli open-source globalnie”, przynajmniej w agregacie. Wyniki wertykalne Mistrala wyglądają dużo lepiej i nie są błędne — po prostu mierzą węższy obszar. Jeśli decydujesz, czy budować na ML4, ważniejsza jest akurat ta wertykala, na której ci zależy, niż którykolwiek z nagłówków.

Kodowanie

Kodowanie to pierwsze miejsce, gdzie widać różnicę między hasłem a szczegółami. Liczby Mistrala wyglądają dobrze na pierwszy rzut oka. Spójrz jednak na jego wykres DeepSWE — zobaczysz coś, czego tekst nie wspomina. Najwyższy słupek to Kimi K3 z 69%, siedem punktów przed ML4. ML4 minimalnie wyprzedza GLM-5.3 (62% vs 61%), ale jeden punkt mieści się w szumie doboru harnessu. „Harness” to rusztowanie, które opakowuje model w benchmarku agencyjnym: narzędzia, prompty i liczba prób — a na wykresie Mistrala każdy konkurent był uruchamiany w innym. Na żywej tablicy DeepSWE Datacurve, gdzie każdy model działa w tym samym setupie, GLM-5.3 i Kimi K3 osiągają po 69%, a DeepSeek V4 Pro — 63%. ML4 na razie nie widnieje.

Terminal-Bench pokazuje podobny efekt w drugą stronę. Mistral raportuje 28,3%, niezależny bieg vals.ai uzyskał 22,73%. Nie czytam tego jako zawyżania — to przypomnienie, że jedna liczba z jednego setupu to nie ranking.

Ciekawsze są ewaluacje ludzkie. W ślepej ocenie zleconej przez Mistral firmie Surge AI, profesjonalni adnotatorzy oceniali wyniki kodowania od 1 do 5. ML4 zajął 2. miejsce z 5 (3,74), przed GLM-5.3 (3,60), Kimi K3 (3,59) i GLM-5.2 (3,40), daleko za Claude Opus 5 (4,22). Zwróć uwagę na Kimi K3: siedem punktów przed ML4 w DeepSWE, za nim w preferencjach ludzi. Zdawanie testów i pisanie kodu, który dobrze się czyta, to nie ta sama umiejętność. (I to Opus 5, nie nowszy 5.5, więc dystans do najlepszego modelu zamkniętego może być większy.)

Druga, wewnętrzna ewaluacja Mistrala dodatkowo miesza obraz. Wykazała, że ML4 jest „na poziomie lub blisko” GLM-5.3 w kodowaniu i finansach, a preferowany jedynie w CAD i STEM. Nazwałbym je mniej więcej remisem.

Finanse

Finanse są prostsze — głównie dlatego, że jest niezależna liczba kotwicząca. ML4 uzyskuje 54,68% w Finance Agent v2 na vals.ai, co daje 22. miejsce z 75 ogółem i 7. z 32 wśród modeli z otwartymi wagami. Solidny środek stawki. Faktyczna teza Mistrala jest węższa: że ML4 wyprzedza GPT-6 Astra na tym benchmarku.

Mistral raportuje też mocne wyniki w FinWorkBench, który sprawdza, czy model potrafi budować i edytować arkusze kalkulacyjne dla realnych zadań finansowo-księgowych. Te liczby pochodzą z wykresów Mistrala i nie zostały gdzie indziej odtworzone.

Prawo

Prawo wygląda na papierze znacznie lepiej. W Harvey's Legal Agent Benchmark ML4 zajmuje 6. miejsce z 75 i pierwsze wśród 31 modeli z otwartymi wagami. Jego wynik to 15,83%.

Przeczytaj tę liczbę dwa razy. Szóste miejsce na świecie w autonomicznej pracy prawniczej oznacza ukończenie około jednego zadania na sześć. Benchmark jest trudny i ranking realny, ale nikt nie powinien z tego wyciągać „ML4 zrobi pracę prawną bez nadzoru”. Żaden model jeszcze nie potrafi.

Wizja i wizualny grounding

Wizja to przypadek odwrotny: śmiałe deklaracje, brak niezależnych danych. Główne twierdzenie dotyczy wizualnego groundingu — lokalizowania konkretnych obiektów lub obszarów na obrazie na podstawie opisu tekstowego, np. „znajdź pęknięty spaw na tym rysunku”, a nie „opisz ten obrazek”. Mistral raportuje 42% na Dense 200, nieco przed GPT-6 Astra z 41%. Nie opierałbym decyzji zakupowej na jednym punkcie.

Mistral twierdzi też, że ML4 dobrze wypada w ChartQA Pro i GDP.pdf, benchmarku rozumowania nad dokumentami. Żaden z wyników w obszarze wizji nie został jeszcze niezależnie odtworzony. Wyróżnione przypadki użycia są głównie przemysłowe — od obrazów satelitarnych na potrzeby reagowania kryzysowego po inspekcję rysunków technicznych i skanowanie dużych obrazów geoprzestrzennych.

Jak dobry jest Mistral Large 4 w kodowaniu?

Wracając do kodowania — bo do tego większość czytelników faktycznie użyje ML4. Jest konkurencyjny wśród modeli z otwartymi wagami, ale nie jest najlepszym dostępnym modelem do kodowania — i nie jest nawet najlepszym otwartym na wykresie Mistrala. Nie będę powtarzać liczb. Oto jak przekładają się na pracę, którą byś mu zlecił:

  • Naprawa problemów w prawdziwej bazie kodu (agencja inżynierii oprogramowania): używalny, ale Kimi K3 wygląda mocniej.
  • Zrozumienie dużego repozytorium: obiecujące, choć opiera się na jednym prywatnie uruchomionym wyniku.
  • Długie, wielogodzinne przebiegi agentów: setup RL Mistrala jest zbudowany pod długie trajektorie, ale nikt tego niezależnie jeszcze nie sprawdził.
  • Praca mocno terminalowa: najsłabszy jak dotąd niezależny sygnał.

Poczekałbym na wpis ML4 w publicznym Coding Agent Index AA — spodziewany po udostępnieniu wag — zanim nazwę go czymś więcej niż wiarygodną otwartą opcją.

To, co dodają otwarte wagi, nie ma tu nic wspólnego z wynikami. Firma może uruchomić ML4 na własnej infrastrukturze i nigdy nie wysyłać zastrzeżonego kodu źródłowego do zewnętrznego API. Dla agentów kodujących na poufnych bazach kodu to samo w sobie może rozstrzygać wybór.

Mistral Large 4 w cyberbezpieczeństwie

To najśmielsze twierdzenie Mistrala. W Artificial Analysis Cyber Index — niezależnej ocenie AA tego, jak modele znajdują, odtwarzają i łatają podatności w prawdziwym oprogramowaniu — ML4 uzyskuje 50%. To plasuje go w top 5 z 18 testowanych modeli. Wyżej są tylko Grok 4.7, MiMo-V2.6-Pro i GPT-6 Luna, a GLM-5.3 Flash remisuje. Mistral mówi, że ML4 „zdecydowanie prowadzi wśród modeli z otwartymi wagami opracowanych poza Chinami” — wykres AA jest z tym zgodny.

Najmocniej wyróżnia się CyberGym-E2E, jeden z trzech komponentów indeksu. Prosi model o odtworzenie realnej podatności w oprogramowaniu open-source (CVE — publicznie katalogowana luka) i jej załatanie. ML4 zdobywa 82%, pierwsze miejsce z 18 modeli testowanych przez AA. Mistral raportuje też 93% w Cybench — zestawie 40 zadań konkursowych z bezpieczeństwa — choć nikt tego nie odtworzył.

Ciekawe są też dane o odmowach. W CyberGym-E2E wykres AA pokazuje, że Claude Opus 5.5 odmawia z powodów bezpieczeństwa w ok. 96% zadań, a GPT-6 Astra w 100%. Te modele mają wyniki bliskie zera, bo odmawiają wykonania zadania — ich wyniki nic nie mówią o faktycznych możliwościach. Czy odmowa to słuszna polityka — to osobna dyskusja.

I to jest sedno propozycji Mistrala. Praca defensywna często zaczyna się od odtworzenia błędu, by udowodnić, że istnieje — a zespoły bezpieczeństwa muszą robić to masowo, skanując duże bazy kodu i triage’ując setki znalezisk. Model, który większość takiej pracy odmawia, albo którego dostawca może zmienić zasady moderacji w środku incydentu, to ryzyko. Argument Mistrala brzmi, że uruchomienie ML4 na własnej infrastrukturze daje ci kontrolę nad jego zachowaniem. Szerzej — spór o to, czy zabezpieczenia AI blokują legalną pracę defensywną, trwa już od dawna.

A teraz zła część: gdy wagi będą publiczne, atakujący dostaną te same możliwości. Indeks AA jest celowo defensywny (modele pracują na kodzie źródłowym i nie prosi się ich o zbudowanie działającego exploita), więc 82% w odtworzeniu nie znaczy 82% zdolności ofensywnych. Mimo to dystans od „odtwórz crash” do „uzbrój go” nie jest nieskończony. Mistral poświęca trzy tygodnie przed wydaniem na red teaming modelu — celowe wywoływanie niewłaściwych zachowań — z „liderami cyberbezpieczeństwa, zweryfikowanymi partnerami i organami państwowymi”.

Dlaczego otwarte wagi mają znaczenie w Mistral Large 4

Przypadek cyberbezpieczeństwa to tak naprawdę argument za otwartymi wagami — i wykracza daleko poza bezpieczeństwo. „Możesz pobrać model” to zbyt mało powiedziane.

Bank uruchamiający ML4 na własnych serwerach nigdy nie wysyła danych klientów do Mistrala. Agencja rządowa kontroluje całe środowisko wdrożeniowe. Zespół bezpieczeństwa może dostroić zachowanie modelu bez czekania na politykę moderacji dostawcy, co — jak widać wyżej — nie jest hipotetycznym problemem. A jeśli dostawca padnie lub wycofa wersję modelu, samohostowane wdrożenia działają dalej.

Otwarte wagi ułatwiają też personalizację. Pisałem o Mistral Forge w kwietniu, a Mistral mówi, że ML4 „używa tego samego środowiska treningu, personalizacji i RL”, które oferuje klientom korporacyjnym przez Forge. Dla organizacji chcących dostrajać ML4 na własnych danych, Forge to oczywista droga.

Szybko o terminologii. Open-weight znaczy, że wytrenowane parametry modelu są publicznie dostępne. Nie znaczy to, że dane treningowe, kod treningu czy inne komponenty są wydane na licencji open-source. Strona modelu Mistrala opisuje ML4 jako open-weight, ale nie opublikowała jeszcze warunków licencji. Do tego czasu kwestia użycia komercyjnego, praw do fine-tuningu i redystrybucji pozostaje otwarta. Frustrujące jest pisanie „sprawdź licencję” o modelu, którego cała oferta to kontrola — ale tak jest.

Mistral Large 4 a europejskie dążenia do suwerenności AI

Kontrola stoi też w centrum politycznej narracji Mistrala. Prezydent Francji Macron opisał podejście Mistrala jako „trzecią drogę w AI”. Dwie pierwsze to amerykańskie modele zamknięte — potężne, ale podległe prawu USA i politykom dostawcy — oraz chińskie modele otwarte — często potężne, ale budzące obawy o rezydencję danych i geopolitykę w europejskich instytucjach. Oferta Mistrala to otwarte wagi, europejska infrastruktura i europejskie prawo.

To obejmuje europejskie wdrożenie, które — jak mówi Mistral — działa „end-to-end, niezależnie od innych dostawców usług cyfrowych i zgodnie z prawem europejskim”. Jeśli podlegasz RODO albo sektorowym zasadom rezydencji danych, zweryfikuj to twierdzenie w umowach przetwarzania danych Mistrala, zanim na nim polegniesz.

Mistral ma też środki, by poprzeć ofertę. Nazywa ML4 „pierwszym kamieniem milowym na roadmapie finansowanej przez naszą rundę Serii D o wartości 3 mld €”, prowadzoną przez Samsunga przy wycenie 21 mld €, którą Mistral opisuje jako największą rundę kapitałową w historii europejskiej technologii. Większość środków trafia w europejską moc centrów danych.

Czy więc Europa może tworzyć modele na granicy możliwości, dając organizacjom większą kontrolę nad miejscem i sposobem ich działania? ML4 to silny punkt danych dla kontroli. W kwestii granicy — 32. miejsce z 44 w Vals Index mówi, że Europa jeszcze tam nie jest.

Mistral Large 4 vs inne modele z otwartymi wagami

Skoro Europa jeszcze tam nie jest, warto zapytać, kto jest — i jak ML4 do nich się ma. Nie zestawiam wszystkich wyników w jednej tabeli, bo pochodzą z różnych setupów, a jedna tabela sugerowałaby porównywalność. Liczby parametrów też nie są proxy możliwości — er. Poniższa tabela tylko umiejscawia każdy z nich:

Model

Architektura

Dostępność wag

Mocne strony

Pochodzenie

Mistral Large 4

MoE, 1 bln łącznie / 49 mld aktywnych

27 października (plan)

Cyberbezpieczeństwo, prawo (potwierdzone niezależnie)

Francja

GLM-5.3

Nieujawniona

Tak

Kodowanie, STEM

Chiny

DeepSeek V4 Pro

MoE

Tak

Kodowanie, matematyka

Chiny

Reflection Beam

Nieujawniona

Tak

Ogólne rozumowanie

USA

Qwen3.8 Max

Nieujawniona

Niepotwierdzone

Wielojęzyczność, kodowanie

Chiny

Mistral Large 4 vs GLM-5.3

To porównanie najważniejsze, bo GLM-5.3 to jeden z najsilniejszych chińskich modeli otwartych. Jak w sekcji o kodowaniu: różnią ich jeden punkt na wykresie Mistrala, ewaluacje ludzkie są podzielone, a GLM-5.3 sięga 69% na żywej tablicy, gdzie ML4 jeszcze nie przetestowano. Remis — do czasu niezależnych tablic z oboma modelami.

Mistral Large 4 vs DeepSeek V4 Pro

ML4 wygrywa we wszystkich porównaniach opublikowanych przez Mistrala (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), ale żadne nie jest niezależnie potwierdzone, a DeepSeek V4 Pro osiąga 63% na żywym liderboardzie DeepSWE — powyżej 62% ML4. Nie ma opublikowanego head-to-head w finansach.

Mistral Large 4 vs Reflection Beam

Reflection Beam to inny zachodni konkurent z otwartymi wagami, co czyni go najprostszym testem tezy Mistrala „najlepszy poza Chinami”. Dane są skąpe. Wykres DeepSWE Mistrala pokazuje Beam na 44%, prawie 18 punktów poniżej ML4, ale to liczba samodzielnie raportowana zestawiona z wynikiem AA — nie opierałbym się na tej luce. Reflection nie ujawnił rozmiaru Beam, więc porównanie skali też jest niemożliwe. ML4 ma natomiast szersze wejście multimodalne i znacznie mocniejsze opublikowane dowody w cyberbezpieczeństwie.

Kiedy możesz użyć Mistral Large 4?

Nie musisz czekać na rozstrzygnięcie porównań, by samodzielnie przetestować ML4. Oto dotychczasowy harmonogram:

  1. 6 października: start publicznego podglądu. Każdy może wywołać mistral-large-4 przez Mistral Studio.
  2. W trakcie podglądu: liderzy cyberbezpieczeństwa, zweryfikowani partnerzy i organy państwowe dostają wersję z „ograniczoną moderacją i rozszerzonymi możliwościami cyber” do red teamingu. Pierre Stock powiedział TechCrunch, że Mistral będzie „pracować z zaufanymi partnerami i rządami, by upewnić się, że otwarte wagi można wykorzystać do obrony, a nie do [prowadzenia] złośliwych ataków”. Tymczasem trening RL trwa, więc model w API wciąż się zmienia.
  3. 27 października: zaplanowane wydanie wag wraz z pełnymi szczegółami architektury, dodatkowymi benchmarkami i metodologią potreningową Mistrala.

Zaktualizuję tę sekcję, gdy wagi się ukażą.

Czego wciąż nie wiemy o Mistral Large 4

Do tego czasu wiele spraw pozostaje otwartych. Piszę to w dniu premiery, więc lista jest długa:

  • Ostateczna wydajność w benchmarkach: RL wciąż trwa, więc każdy z powyższych wyników może się zmienić. Mistral spodziewa się „dużych i szybkich popraw”, ale nikt tego jeszcze nie zmierzył.
  • Niezależne wyniki w kodowaniu, wizji i pracy wiedzy: poza AA Cyber Index i vals.ai nic nie zostało odtworzone.
  • Ceny: ogłoszenie i strona dokumentacji się różnią, a stawki w podglądzie mogą nie być docelowe.
  • Warunki licencji: nie zbudujesz produktu na „open-weight” bez licencji.
  • Wymagania sprzętowe do samohostowania: nieopublikowane.
  • Pełna architektura: obiecana wraz z wagami — być może wyjaśni też rozbieżność 49 mld vs 52 mld aktywnych parametrów.
  • Okno kontekstu: 1 mln tokenów wg dokumentacji Mistrala, 512 tys. wg vals.ai.
  • Końcowa ocena bezpieczeństwa: red teaming trwa do października.

Wnioski

Mistral Large 4 to rzadki model o 1 bln parametrów z 49 mld aktywnych, z multimodalnym wejściem i nadchodzącymi otwartymi wagami. W dniu premiery widzimy, że jest najlepszym modelem z otwartymi wagami w prawniczym benchmarku Harvey’ego, a jednocześnie 32. z 44 w Vals Index i za Kimi K3 na własnym wykresie kodowania Mistrala.

Nie sądzę jednak, by prymat w benchmarkach był prawdziwą stawką Mistrala. Zakład jest taki, że to zdolne otwarte wagi i samohostowanie są tym, na czym najbardziej zależy przedsiębiorstwom i rządom. Dane o odmowach w cyberbezpieczeństwie to jak dotąd najjaśniejszy dowód, że ten pakiet rozwiązuje realny problem zespołów bezpieczeństwa.

27 października to data, na którą warto czekać. Wtedy wyjdą wagi, niezależni badacze uruchomią finalny checkpoint, a Artificial Analysis i vals.ai przetestują model, który Mistral faktycznie wypuści, zamiast podglądu wciąż w treningu. Le Chonk wtedy albo dowiezie to, co obiecuje wpis premierowy, albo nie.

Jeśli chcesz poznać podstawy koncepcji stojących za modelami MoE, nasz kurs Introduction to Large Language Models omawia fundamenty. Więcej o produktach Mistrala znajdziesz w naszym omówieniu Mistral Forge, Mistral Large 3, Mistral Le Chat i Mistral Vibe 2.0, jego terminalowego agenta do kodowania.

FAQs

Czym jest Mistral Large 4 (Le Chonk)?

To nowy flagowiec Mistrala, uruchomiony w publicznym podglądzie 6 października 2026 r.: model Mixture-of-Experts z ok. 1 bln parametrów łącznie i 49 mld aktywnych na token. Przyjmuje tekst i obrazy, generuje tekst, a otwarte wagi są planowane na 27 października.

Skąd nazwa Le Chonk?

To nawiązanie do „Le Chaton Fat” — fikcyjnego modelu o 24 bln parametrów, który Mistral dla żartu ogłosił, a potem usunął w czerwcu 2026 r. Żart rozlał się po społecznościach AI, a gdy pojawił się realny model bilionowy, nazwa poszła za nim.

W czym Mistral Large 4 jest najlepszy?

Najmocniejsze niezależne wyniki ma w cyberbezpieczeństwie i pracy prawniczej. Zajmuje miejsce w top 5 z 18 modeli w Artificial Analysis Cyber Index i szóste z 75 w Harvey's Legal Agent Benchmark, pierwsze wśród modeli z otwartymi wagami (stan na 6 października). W szerokim Vals Index zajmuje 32. miejsce z 44, więc siła w wertykalach i ogólna wydajność mówią różne rzeczy.

Czy Mistral Large 4 jest open source?

Nie. To model z otwartymi wagami — to co innego. Open-weight oznacza, że parametry modelu są publicznie dostępne, ale niekoniecznie dane treningowe, kod treningu czy inne komponenty. Mistral nie opublikował jeszcze warunków licencji, więc sprawdź je, zanim zbudujesz produkt na tym modelu.

Kiedy mogę pobrać wagi Mistral Large 4?

27 października 2026 r., według Axios. API jest dostępne już teraz przez Mistral Studio, ale podgląd jest wciąż w reinforcement learning, więc wydane wagi będą się różnić od tego, co dziś serwuje API.

Tematy
Sztuczna inteligencja

Ucz się z DataCamp

Kurs

Wprowadzenie do sztucznej inteligencji

2 godz.
427.3K
Poznaj podstawowe pojęcia sztucznej inteligencji, takie jak machine learning, deep learning, NLP, generative AI i inne.
Zobacz szczegółyRight Arrow
Rozpocznij Kurs
Zobacz więcejRight Arrow