강의
2026년 10월 6일, Mistral은 Mistral Large 4(ML4)의 공개 프리뷰를 출시했습니다. 이는 총 1조 파라미터, 토큰당 활성 490억 파라미터, 텍스트·이미지 입력을 지원하며, 이달 말까지 오픈 웨이트 공개를 예고한 모델입니다. 지금까지 Mistral이 만든 모델 중 가장 크며, Mistral의 유럽 데이터센터에서 Nvidia Grace Blackwell GPU 3,800대로 처음부터 학습했습니다.
지난 1년 대부분 동안 가장 강력한 오픈 웨이트 모델은 중국 연구실(GLM, DeepSeek, Kimi, Qwen)에서 나왔고, 전체적으로 가장 강력한 모델은 미국의 API 뒤에 비공개로 머물렀습니다. Mistral은 세 번째 선택지를 노립니다. 발표에 따르면 ML4는 "이미 전 세계에서 가장 강력한 오픈소스 모델들과 경쟁하는 성능을 달성했으며, 미국이나 유럽에서 개발된 어떤 오픈 웨이트 모델보다도 크게 앞선다"고 합니다.
출시 글이 암시하는 것보다 상황은 더 복잡합니다. 아래에서는 아키텍처, 벤치마크(독립 재현 결과와 그렇지 않은 것을 구분), 코딩, 비전, 사이버보안, 오픈 웨이트, 그리고 아직 모르는 점을 다룹니다. 한 섹션만 읽을 시간이라면, 사이버보안을 추천합니다.
빠른 정리
Mistral Large 4(Le Chonk)는 1조 파라미터의 오픈 웨이트 모델로, Mistral은 중국 밖에서 제작된 모델 중 가장 강력하다고 소개합니다. 특히 사이버보안, 금융, 법률, 비주얼 그라운딩에 강점이 있다고 합니다. 독립 평가 결과는 사이버보안과 법률 분야의 주장을 뒷받침하고, 금융은 중위권, 광범위 지수에서는 44개 중 32위로 집계됩니다. API는 현재 사용 가능하며, 웨이트는 10월 27일 공개 예정입니다.
Mistral Large 4(Le Chonk)란?
요약만으로는 빠진 내용이 많습니다. 기본부터 보겠습니다. ML4는 Mistral의 새로운 플래그십이자, Mistral의 표현을 빌리면 "지금까지 가장 크고 가장 강력한 모델"입니다. Le Chonk는 별명인데, Mistral의 출시 카피는 통상과 반대로 씁니다. "비공식적으로는 ML4, 매우 공식적으로는: le Chonk."
네이티브 멀티모달 Mixture-of-Experts(MoE) 모델입니다. 핵심 수치는 총 1조 파라미터와 토큰당 활성 490억이지만, Mistral의 모델 문서에는 약간 다른 수치(총 1.05조, 활성 520억)가 기재되어 있습니다. 둘 중 어느 쪽도 차이를 설명하지 않습니다.("활성"이 왜 중요한지는 다음 섹션에서 다룹니다.)
Mistral은 ML4를 엔터프라이즈 업무에 겨냥합니다. 코딩, 사이버보안, 금융, 법률, 제조·엔지니어링, 기술 도면이나 위성 이미지 판독 같은 비주얼 작업 등입니다.
|
사양 |
세부 정보 |
|
총 파라미터 수 |
|
|
활성 파라미터 |
|
|
아키텍처 |
Mixture-of-Experts, 하이브리드 인스트럭트·리저닝 |
|
입력 |
|
|
출력 |
텍스트만 |
|
컨텍스트 윈도우 |
배포를 계획하는 이들에게 가장 중요한 행은 둘이며, 둘 다 아직 불확실합니다. 컨텍스트 윈도우와 라이선스입니다. 모델 작동 방식으로 들어가기 전에 이름부터 간단히 설명합니다.
왜 Le Chonk일까요?
2026년 6월, Mistral은 풍자 형식의 "Le Chaton Fat" 발표를 올렸다가 삭제했습니다. 가상의 24조 파라미터 모델이었죠. 인터넷은 아랑곳하지 않고 스펙을 수백 조로 부풀렸습니다. 4개월 뒤 Mistral이 실제 1조 파라미터 모델을 내놓자, 이름은 자연스럽게 따라왔습니다. 이야기는 여기까지. 이제 모델로 돌아갑니다.
Mistral Large 4의 작동 방식
Mistral은 아직 전체 아키텍처 상세를 공개하지 않았습니다(웨이트와 함께 공개 예정). 따라서 이 섹션은 공개된 내용에 한정합니다.
1조 파라미터, 활성 490억
1조 파라미터 모델이라 해서 매 토큰에 1조 전부를 쓰지는 않습니다. MoE 모델은 각 토큰을 소수의 "전문가" 서브네트워크로 라우팅하기 때문에, 추론 계산량은 활성 490억 파라미터를 따릅니다. 이는 실질적으로 약 500억짜리 덴스 모델에 더 가깝습니다.
그렇다고 서빙이 싸냐고요? 아닙니다. 1조 파라미터 전체가 어딘가 메모리에 상주해야 하므로, ML4를 자체 호스팅하려면 다중 GPU 인프라가 상당해야 합니다. 또한 MoE는 동일한 활성 파라미터 수의 덴스 모델보다 지연을 낮게 유지하며 서빙하기가 더 어렵습니다. Mistral은 하드웨어 요구사항을 공개하지 않았고, 대기업과 정부 조직 외에 전체 모델을 직접 돌릴 팀은 많지 않을 것 같습니다.
멀티모달 입력
활성 파라미터는 텍스트만 다루지 않습니다. ML4는 이미지를 입력받을 수 있지만, 출력은 텍스트뿐입니다. Mistral은 이 모델이 "복잡한 문서, 차트, 자연 이미지 전반에서 강력하게 추론"한다고 하며, 엔지니어링·제조·지상관측 등 시각 인지가 중요한 산업을 겨냥합니다. 데모도 모두 산업 지향입니다. 기술 도면에서 기계 부품 검사, PDF에서 증거 추출, 기가픽셀급 위성 이미지에서 찾기 어려운 객체를 탐색하는 작업 등입니다.
160개+ 언어
이러한 산업 고객은 국경을 넘나들어 일하는 경우가 많습니다. 여기서 언어가 중요해집니다. Mistral에 따르면 학습 데이터의 "상당 부분"이 다국어였고, 160개 이상의 언어와 모든 EU 공용어를 포괄했습니다. 유럽 정부를 주요 고객으로 삼는 유럽 기업에게는 중요한 세일즈 포인트입니다.
학습 인프라
유럽을 겨냥한 메시지에서, 학습이 어디서 이뤄졌는지도 중요합니다. Mistral에 따르면 ML4는 Nvidia Grace Blackwell GPU 3,800대에서 처음부터 학습되었고, 자체 유럽 데이터센터를 사용했습니다. Mistral의 과학 담당 부사장 Pierre Stock은 TechCrunch에 대략 4,000대라고 밝혔으며, "중국 경쟁사보다 두세 배 적다"고 말했습니다. 이 비교는 검증되지 않았습니다.
이와 관련한 컴퓨트 구축은 꽤 오래전부터 공개되어 왔습니다. 2026년 3월, Mistral은 부채 8억 3,000만 달러를 조달해 파리 인근 데이터센터용 Nvidia GB300 GPU 13,800대를 구매했습니다. ML4가 구체적으로 그 클러스터에서 학습되었는지는 Mistral이 밝히지 않았으므로, 둘을 단정 짓지는 않겠습니다.
이 글에서 다루는 모든 벤치마크를 읽는 방식을 바꾸는 디테일이 하나 있습니다. 강화학습(RL) 단계가 아직 진행 중이라는 점입니다. RL은 모델이 과업 시도 결과에 점수를 매겨 스스로 개선하는 사후 훈련 단계인데, 현재 약 3,000대 GPU를 사용하고 하루 약 330억 토큰을 생성하고 있으며, "포화 기미가 없다"고 합니다. 즉, 오늘 API로 호출하는 모델은 10월 27일에 웨이트가 공개될 모델과 동일하지 않을 수 있습니다.
Mistral Large 4 벤치마크
RL이 미완이라는 점이 이 섹션의 모든 내용을 잠정적으로 봐야 하는 첫 번째 이유입니다. 두 번째 이유는 Mistral의 수치 대부분이 독립적으로 재현되지 않았고, 재현된 일부도 일치하지 않는다는 점입니다.
출시 시점의 독립 평가는 세 가지로 나뉩니다.
- 독립 재현: Artificial Analysis(AA) Cyber Index(그 하위 구성인 CyberGym-E2E 포함), vals.ai의 5개 평가(Terminal-Bench 4.0 포함).
- AA가 실행했으나 아직 비공개: Mistral의 코딩 차트 각주에 따르면 DeepSWE, Terminal-Bench, SWE-Atlas 점수는 "하네스 공개 전에 Artificial Analysis가 비공개로 평가한 수치"를 사용했습니다. 해당 하네스가 공개되면 AA의 Coding Agent Index에 게재될 예정입니다. 그 전까지는 AA와 Mistral 외에는 검증할 수 없습니다.
- Mistral 단독: 그 외 모두.
표의 마지막 열에 가장 주목하세요. 벤치마크는 독립 그룹이 만들었더라도, 그 위에서의 ML4 점수는 여전히 Mistral의 주장일 수 있습니다.
벤치마크 요약
|
벤치마크 |
ML4 결과 |
경쟁자 |
측정 내용 |
|
DeepSWE v1.1 |
61.7%, AA가 비공개 실행 |
Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44%(자체 보고) |
장기 지평 소프트웨어 엔지니어링 |
|
Terminal-Bench 4.0 |
28.3% Mistral 발표, 22.73% vals.ai |
vals.ai에서 44개 중 20위 |
복잡한 터미널 워크플로 |
|
SWE-Atlas-QnA |
59.4%, AA가 비공개 실행 |
미공개 |
리포지토리 이해 |
|
Coding Agent Index |
49.8%, AA가 비공개 실행 |
DeepSeek V4 Pro 0813, Qwen3.8 Max보다 앞섬 |
위 3개 코딩 벤치마크의 종합 |
|
AutomationBench |
59.9% Mistral 발표 |
Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro보다 앞섬 |
Gmail, Slack, Salesforce 등 앱에서 657개 비즈니스 워크플로 |
|
AA-Briefcase |
1,393 Elo, Mistral이 AA 인용 |
DeepSeek V4 Pro보다 앞섬 |
장기 지평 지식 작업 |
|
Dense 200 |
42% Mistral 발표 |
GPT-6 Astra 41% |
비주얼 그라운딩 |
|
AA Cyber Index |
Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53% |
실제 소프트웨어의 결함 찾기·수정 |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%, GPT-6 Luna 78% |
실제 취약점의 재현 및 패치 |
|
|
93% Mistral 발표 |
오픈 웨이트 중 "최상위권"(Mistral 주장) |
보안 대회 과제 40개 |
|
|
Finance Agent v2 |
전체 75개 중 22위, 오픈 웨이트 32개 중 7위 |
금융 에이전트 과업 |
|
|
Harvey의 Legal Agent |
오픈 웨이트 31개 중 1위 |
자율 법률 과업 |
|
|
2점 만점에 1.691 Mistral 발표 |
Mistral이 시험한 오픈 모델 중 최고 |
책임 있는 AI 행동 |
|
|
93.3% Mistral 발표 |
"경쟁자 중 더 높은 점수 없음"(Mistral 주장) |
프롬프트 인젝션 저항성 |
|
|
Vals Index |
오픈 웨이트 16개 중 9위 |
광범위 과업의 종합 지수 |
Mistral 4 벤치마크 순위
Mistral의 헤드라인 주장과 나란히 마지막 행을 보세요. vals.ai의 광범위 지수에서 ML4는 전체 44개 중 32위, 오픈 웨이트 16개만 놓고는 9위입니다. 적어도 종합 지수에서는 "전 세계 최강 오픈소스 모델과 경쟁"한다는 말과 맞추기 어렵습니다. Mistral의 버티컬 성과는 훨씬 좋아 보이며, 그 자체로 틀린 말은 아닙니다. 다만 측정 범위가 더 좁을 뿐입니다. ML4를 사용할지 결정할 때는, 관심 있는 버티컬의 성과가 어떤 헤드라인보다 중요합니다.
코딩
코딩은 헤드라인과 세부의 간극이 가장 먼저 드러나는 영역입니다. Mistral의 수치는 얼핏 좋아 보입니다. 하지만 DeepSWE 차트를 자세히 보면 텍스트에는 없는 사실이 드러납니다. 가장 높은 막대는 Kimi K3로 69%이며, ML4보다 7포인트 앞섭니다. ML4는 GLM-5.3(62% 대 61%)을 근소하게 앞서지만, 1포인트는 하네스 선택의 노이즈 범위 안입니다. "하네스"는 에이전트형 벤치마크에서 모델을 감싸는 골조로, 사용 도구, 프롬프트, 시도 횟수를 뜻합니다. Mistral의 차트에서는 경쟁자마다 하네스가 다릅니다. Datacurve의 실시간 DeepSWE 리더보드에서는 모든 모델이 동일한 설정으로 실행되며, GLM-5.3과 Kimi K3가 모두 69%, DeepSeek V4 Pro가 63%를 기록합니다. ML4는 아직 등재되지 않았습니다.
Terminal-Bench도 반대 방향에서 같은 효과를 보여줍니다. Mistral은 28.3%를 발표했고, vals.ai의 독립 실행은 22.73%였습니다. 의도적 부풀리기라기보다는, 한 설정에서 나온 한 숫자가 곧 순위는 아니라는 상기입니다.
사람이 평가한 결과가 더 흥미롭습니다. Mistral이 Surge AI에 의뢰한 블라인드 평가에서, 전문 주석가가 코딩 결과물을 1~5점으로 채점했습니다. ML4는 5개 중 2위(3.74)를 차지했으며, GLM-5.3(3.60), Kimi K3(3.59), GLM-5.2(3.40)보다 앞섰고, Claude Opus 5(4.22)에는 크게 뒤졌습니다. Kimi K3를 주목하세요. DeepSWE에서는 ML4보다 7포인트 높았지만, 사람 선호에서는 뒤집혔습니다. 테스트를 통과하는 것과 읽기 좋은 코드를 쓰는 것은 같은 능력이 아닙니다.(그리고 이는 Opus 5이지, 더 최신의 5.5가 아니므로, 최고급 비공개 모델과의 격차는 더 클 가능성이 큽니다.)
두 번째 내부 평가에서는 상황이 더 복잡해집니다. ML4가 코딩과 금융에서 GLM-5.3과 "비슷하거나 근접"했고, CAD와 STEM에서만 우위라고 합니다. 두 모델은 대체로 비슷하다고 보겠습니다.
금융
금융은 비교적 단순합니다. 기준 삼을 독립 수치가 있기 때문입니다. ML4는 vals.ai의 Finance Agent v2에서 54.68%를 기록하여, 전체 75개 중 22위, 오픈 웨이트 32개 중 7위입니다. 확실한 중위권입니다. Mistral의 실제 주장은 더 좁습니다. 이 벤치마크에서 ML4가 GPT-6 Astra를 앞선다는 것입니다.
또한 실제 금융·회계 과업을 위한 스프레드시트 생성·편집 능력을 측정하는 FinWorkBench에서 강한 성과를 보고합니다. 이 수치는 Mistral의 차트에만 있으며 독립 재현은 아직 없습니다.
법률
법률은 문서상으로 더 좋아 보입니다. Harvey의 Legal Agent Benchmark에서 ML4는 75개 중 6위, 오픈 웨이트 31개 중 1위입니다. 점수는 15.83%입니다.
이 수치는 두 번 읽어야 합니다. 자율 법률 업무에서 세계 6위라는 것은 대략 여섯 개 중 한 개 과업을 완수한다는 뜻입니다. 벤치마크는 어렵고 순위는 사실이지만, 이를 "ML4가 감독 없이 법률 업무를 수행한다"로 받아들이면 안 됩니다. 아직 그런 모델은 없습니다.
비전과 비주얼 그라운딩
비전은 반대 사례입니다. 대담한 주장, 아직 독립 데이터 없음. 헤드라인 주장은 비주얼 그라운딩에 관한데, 이는 "이 그림을 설명하라"가 아니라 "이 도면에서 금 간 용접 부분을 찾아라"처럼 텍스트 설명으로 이미지 내 특정 객체나 영역을 찾아내는 능력입니다. Mistral은 Dense 200에서 42%를 보고하며, GPT-6 Astra의 41%를 근소하게 앞선다고 합니다. 1포인트 차이로 구매 결정을 내리지는 않겠습니다.
또한 Mistral은 ChartQA Pro와 GDP.pdf(문서 추론 벤치마크)에서도 좋은 성능을 보인다고 합니다. 비전에 관한 결과는 아직 독립 재현이 없습니다. Mistral이 강조하는 활용 사례는 주로 산업 분야입니다. 재난 대응을 위한 위성 이미지, 기술 도면 검사, 대규모 지리공간 이미지 스캔 등입니다.
코딩에서 Mistral Large 4는 얼마나 좋을까?
대부분의 독자가 실제로 ML4를 사용하는 영역이 코딩이니 다시 돌아옵니다. 오픈 웨이트 모델 중 경쟁력은 있지만, 사용 가능한 코딩 모델 중 최고는 아니며, Mistral의 자체 차트상 오픈 모델 중에서도 최고는 아닙니다. 수치는 반복하지 않겠습니다. 업무로 번역하면 이렇습니다.
- 실제 코드베이스의 이슈 수정(에이전트형 소프트웨어 엔지니어링): 사용할 만하나, Kimi K3가 더 강해 보입니다.
- 대규모 리포지토리 이해: 유망하나, 비공개 실행된 한 점수에 의존합니다.
- 장시간(수시간) 에이전트 실행: Mistral의 RL 설정은 긴 궤적에 맞춰져 있지만, 독립 검증은 아직 없습니다.
- 터미널 중심 작업: 현재까지 가장 약한 독립 신호입니다.
웨이트 공개 후 AA의 공개 Coding Agent Index에 ML4가 등재될 때까지는, 신뢰할 만한 오픈 웨이트 옵션 그 이상으로 판단하진 않겠습니다.
여기서 오픈 웨이트의 장점은 점수와 무관합니다. 기업은 ML4를 자체 인프라에서 실행해, 사유 소스 코드를 외부 API로 보내지 않을 수 있습니다. 기밀 코드베이스를 다루는 코딩 에이전트에게는, 이 점만으로 선택이 갈릴 수 있습니다.
사이버보안에서의 Mistral Large 4
이는 Mistral의 가장 대담한 주장입니다. AA의 독립 평가인 Artificial Analysis Cyber Index에서, 모델이 실제 소프트웨어의 취약점을 찾고 재현해 패치하는 능력을 평가한 결과 ML4는 50%를 기록했습니다. 18개 모델 중 상위 5위입니다. Grok 4.7, MiMo-V2.6-Pro, GPT-6 Luna만 더 높고, GLM-5.3 Flash와 동률입니다. Mistral은 ML4가 "중국 외에서 개발된 오픈 웨이트 모델을 큰 격차로 이끈다"고 주장하며, AA의 차트와도 부합합니다.
특히 두드러지는 것은 인덱스의 세 구성 중 하나인 CyberGym-E2E입니다. 오픈소스 소프트웨어의 실제 취약점(CVE, 공개 카탈로그된 보안 결함)을 재현하고, 패치까지 하도록 요구합니다. ML4는 82%로, AA가 테스트한 18개 모델 중 1위입니다. 또한 Mistral은 Cybench의 보안 대회 과제 40개에서 93%를 기록했다고 보고하지만, 이 수치는 아직 재현되지 않았습니다.
거부 데이터도 흥미롭습니다. CyberGym-E2E에서, AA의 차트에 따르면 Claude Opus 5.5는 안전상의 이유로 약 96% 과업에서 차단되었고, GPT-6 Astra는 100% 차단되었습니다. 이 모델들은 과업을 거부했기 때문에 점수가 거의 0에 가깝고, 실제 역량을 반영하지 않습니다. 거부가 올바른 정책인지 여부는 별개의 논쟁입니다.
이 지점이 Mistral의 핵심 제안입니다. 방어적 보안 업무는 종종 결함이 존재함을 증명하기 위해 재현하는 것에서 시작하며, 대규모 코드베이스를 스캔하고 수백 건을 분류해야 합니다. 업무의 상당수를 거부하거나, 사건 도중에 제공업체가 모더레이션 규칙을 바꿀 수 있는 모델은 리스크입니다. Mistral의 명시적 주장은 ML4를 자체 인프라에서 실행하면 그 행동을 사용자가 통제할 수 있다는 것입니다. 정당한 방어 작업을 AI 안전장치가 가로막는 문제에 대한 논쟁은 이미 오래되었습니다.
이제 부정적 측면입니다. 웨이트가 공개되면 공격자도 같은 역량을 얻게 됩니다. AA의 인덱스는 의도적으로 방어적입니다(모델은 소스 코드만 다루며, 작동하는 익스플로잇 제작을 요구하지 않음). 따라서 82% 재현 점수가 곧 82%의 공격 능력을 뜻하지는 않습니다. 그래도 "크래시 재현"에서 "무기화"까지의 거리는 무한하지 않습니다. Mistral은 공개 전 3주 동안 "사이버보안 리더, 검증된 파트너, 국가 당국"과 함께 레드팀을 운영해, 모델의 악용 가능성을 의도적으로 점검한다고 합니다.
Mistral Large 4에서 오픈 웨이트가 중요한 이유
사이버보안 주장은 사실 오픈 웨이트의 당위에 대한 논리이며, 보안을 훨씬 넘어섭니다. "모델을 내려받을 수 있다"는 표현으로는 부족합니다.
ML4를 자체 서버에서 실행하는 은행은 고객 데이터를 Mistral에 보내지 않습니다. 정부 기관은 배포 환경 전체를 통제합니다. 보안팀은 제공업체의 모더레이션 정책을 기다리지 않고 모델 행동을 조정할 수 있습니다. 앞서 본 바와 같이, 이는 가정이 아닙니다. 제공업체가 중단되거나 모델 버전을 종료해도, 자체 호스팅 배포는 계속 운영됩니다.
오픈 웨이트는 커스터마이징을 실질적으로 가능케 합니다. 저는 4월에 Mistral Forge를 다뤘고, Mistral은 ML4가 "엔터프라이즈 고객에게 Forge를 통해 제공하는 것과 동일한 학습·커스터마이징·RL 환경"을 사용한다고 말합니다. 자체 데이터로 ML4를 파인튜닝하려는 조직에게 Forge는 자연스러운 경로입니다.
용어를 짚고 가겠습니다. 오픈 웨이트는 학습된 모델 파라미터가 공개된다는 뜻입니다. 학습 데이터, 학습 코드 등 다른 구성요소가 오픈소스 라이선스로 공개된다는 뜻은 아닙니다. Mistral의 모델 페이지는 ML4를 오픈 웨이트라고 설명하지만 라이선스 조건은 공개하지 않았습니다. 공개 전까지는 상업적 이용, 파인튜닝 권리, 재배포가 모두 미정입니다. 통제 가능성을 내세우는 모델에 대해 "라이선스를 확인하라"고 적어야 하는 점은 다소 답답하지만, 현황이 그렇습니다.
Mistral Large 4와 유럽의 AI 주권
통제는 Mistral의 정치적 메시지의 핵심이기도 합니다. 프랑스의 마크롱 대통령은 Mistral의 접근을 "AI의 제3의 길"로 표현했습니다. 첫째 길은 미국의 비공개 모델로, 강력하지만 미국 법과 제공업체 정책의 적용을 받습니다. 둘째 길은 중국의 오픈 모델로, 종종 강력하지만 유럽 기관에는 데이터 거주와 지정학적 우려가 있습니다. Mistral의 제안은 오픈 웨이트, 유럽 인프라, 유럽 법 체계입니다.
여기에는 Mistral이 "다른 디지털 서비스 제공자와 독립적으로, 유럽 법 아래에서" 운영한다고 밝힌 유럽 내 배포도 포함됩니다. GDPR이나 업종별 데이터 거주 요건을 받는다면, 이 주장을 Mistral의 데이터 처리 계약과 대조해 확인하세요.
Mistral은 이 주장을 뒷받침할 자금도 있습니다. Mistral은 ML4를 "€30억 규모의 시리즈 D로 자금 지원을 받은 로드맵의 첫 이정표"라고 부르며, 삼성 주도로 €210억 밸류에이션에서 이루어진 라운드로, Mistral에 따르면 유럽 기술 기업 역사상 최대 규모의 지분 투자라고 합니다. 대부분은 유럽 데이터센터 용량 확충에 투입됩니다.
그렇다면 유럽은, 모델의 실행 위치와 방식을 조직이 더 통제하면서도 프런티어급 모델을 만들 수 있을까요? ML4는 통제 측면에서는 강한 데이터 포인트입니다. 프런티어 측면에서는 Vals Index 44개 중 32위가 아직은 아니라는 신호입니다.
Mistral Large 4와 다른 오픈 웨이트 모델 비교
유럽이 아직 아니라면, 누가 그 자리에 있고 ML4는 어떻게 견주는지 물을 수 있습니다. 점수는 설정이 제각각이라 한 표에 모으지 않겠습니다. 하나의 표가 곧 비교 가능함을 암시하기 때문입니다. 파라미터 수가 역량의 대리 지표도 아닙니다er. 아래 표는 위치만 정리합니다:
|
모델 |
아키텍처 |
웨이트 공개 |
강점 |
출신 |
|
Mistral Large 4 |
MoE, 총 1조 / 활성 490억 |
10월 27일(예정) |
사이버보안, 법률(독립 근거 있음) |
프랑스 |
|
GLM-5.3 |
비공개 |
예 |
코딩, STEM |
중국 |
|
DeepSeek V4 Pro |
MoE |
예 |
코딩, 수학 |
중국 |
|
Reflection Beam |
비공개 |
예 |
일반적 추론 |
미국 |
|
Qwen3.8 Max |
비공개 |
미확인 |
다국어, 코딩 |
중국 |
Mistral Large 4 vs. GLM-5.3
가장 중요한 비교입니다. GLM-5.3은 중국 오픈 모델 중 최강급이기 때문입니다. 코딩 섹션에서 다뤘듯, Mistral의 차트에서는 1포인트 차이, 사람 평가에서는 갈리고, 실시간 리더보드에서는 GLM-5.3이 69%를 기록하며 ML4는 아직 미등재입니다. 두 모델이 독립 리더보드에 함께 오를 때까지는 무승부로 보겠습니다.
Mistral Large 4 vs. DeepSeek V4 Pro
ML4는 Mistral이 공개한 비교(DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase)에서는 모두 이깁니다. 하지만 어느 것도 독립 확인이 없고, DeepSeek V4 Pro는 실시간 DeepSWE 리더보드에서 63%로, ML4의 62%를 상회합니다. 금융 분야의 정면 비교는 공개된 바 없습니다.
Mistral Large 4 vs. Reflection Beam
Reflection Beam은 서구권 오픈 웨이트 경쟁자이므로, Mistral의 "중국 밖 최고" 주장을 가장 직접적으로 시험합니다. 데이터는 빈약합니다. Mistral의 DeepSWE 차트에서 Beam은 44%로 ML4보다 약 18포인트 낮지만, 이는 자체 보고 수치와 AA 실행 수치를 비교한 것이므로 격차에 큰 의미를 두기 어렵습니다. Reflection은 Beam의 규모를 공개하지 않아 규모 비교도 불가합니다. ML4는 더 넓은 멀티모달 입력과 사이버보안에 관한 훨씬 강한 공개 근거를 갖습니다.
Mistral Large 4는 언제 쓸 수 있나?
비교가 정리될 때까지 기다릴 필요는 없습니다. 직접 써보세요. 현재까지의 롤아웃은 다음과 같습니다.
- 10월 6일: 공개 프리뷰 시작. 누구나 mistral-large-4를 Mistral Studio에서 호출할 수 있습니다.
- 프리뷰 기간: 사이버보안 리더, 검증된 파트너, 국가 당국에는 "완화된 모더레이션과 확장된 사이버 역량"의 버전을 제공해 레드팀을 진행합니다. Pierre Stock은 TechCrunch에, Mistral이 "신뢰할 수 있는 파트너와 정부와 협력해 오픈소스 웨이트가 방어에는 쓰이고 악의적 공격에는 쓰이지 않도록 하겠다"고 밝혔습니다. 한편 RL 학습은 계속되어, API 모델은 수시로 변합니다.
- 10월 27일: 웨이트 공개 예정이며, 전체 아키텍처 상세, 추가 벤치마크, 사후 학습 방법론도 함께 공개됩니다.
웨이트가 공개되면 이 섹션을 업데이트하겠습니다.
Mistral Large 4에 대해 아직 모르는 것들
그 전까지는, 미정인 것이 많습니다. 출시 당일에 쓰는 글이니 목록이 깁니다.
- 최종 벤치마크 성능: RL이 진행 중이므로, 위의 모든 점수가 바뀔 수 있습니다. Mistral은 "크고 빠른 개선"을 예상하지만, 아직 측정된 바 없습니다.
- 코딩, 비전, 지식 작업의 독립 결과: AA Cyber Index와 vals.ai 외에는 재현된 것이 없습니다.
- 가격: 발표와 문서 페이지가 불일치하며, 프리뷰 요금이 유지될지는 미정입니다.
- 라이선스 조건: "오픈 웨이트"만으로는 제품을 만들 수 없습니다. 라이선스가 필요합니다.
- 자체 호스팅 하드웨어 요구사항: 미공개.
- 전체 아키텍처: 웨이트와 함께 공개 예정이며, 활성 파라미터 490억 vs 520억의 불일치도 설명할 수 있습니다.
- 컨텍스트 윈도우: Mistral 문서는 100만 토큰, vals.ai는 51만 2천을 표기.
- 최종 안전성 평가: 레드팀은 10월 내내 진행.
결론
Mistral Large 4는 활성 490억 파라미터의 1조급 스파스 모델로, 멀티모달 입력을 지원하며, 오픈 웨이트 공개를 앞두고 있습니다. 출시 당일 기준, Harvey의 법률 벤치마크에서는 오픈 웨이트 중 최고지만, Vals Index에서는 44개 중 32위이고, Mistral의 자체 코딩 차트에서는 Kimi K3에 뒤집니다.
그러나 벤치마크 선두가 Mistral의 진짜 승부처라고 보지는 않습니다. 진짜 승부는 역량 있는 오픈 웨이트와 자체 호스팅이 기업과 정부가 가장 중시하는 가치라는 점입니다. 사이버보안의 거부 데이터는 이 패키지가 보안팀이 이미 겪고 있는 문제를 해결한다는 가장 명확한 증거입니다.
관전 포인트는 10월 27일입니다. 그때 웨이트가 공개되고, 독립 연구자들이 최종 체크포인트를 직접 실행하며, Artificial Analysis와 vals.ai가 학습이 계속되는 프리뷰가 아니라 실제 공개 모델을 시험할 수 있습니다. Le Chonk가 출시 글에 걸맞을지 여부는 그때 판가름납니다.
MoE 모델의 개념적 배경은 Introduction to Large Language Models 코스에서 기본기를 확인하세요. Mistral의 제품 전반은 Mistral Forge, Mistral Large 3, Mistral Le Chat, Mistral Vibe 2.0(터미널 기반 코딩 에이전트) 커버리지를 참고하세요.
FAQs
Mistral Large 4(Le Chonk)는 무엇인가요?
2026년 10월 6일 공개 프리뷰로 출시된 Mistral의 새 플래그십입니다. 약 1조 총 파라미터와 토큰당 활성 490억의 Mixture-of-Experts 모델로, 텍스트와 이미지를 입력받아 텍스트를 출력합니다. 오픈 웨이트는 10월 27일 공개 예정입니다.
왜 Le Chonk라고 부르나요?
2026년 6월 Mistral이 농담 삼아 발표했다가 삭제한 가상의 24조 파라미터 모델 "Le Chaton Fat"을 떠올리게 하는 이름입니다. 농담이 AI 커뮤니티 전반으로 퍼졌고, 실제 1조 파라미터 모델이 나오자 이름도 따라왔습니다.
Mistral Large 4는 무엇을 가장 잘하나요?
독립 성과가 가장 강한 분야는 사이버보안과 법률 업무입니다. Artificial Analysis Cyber Index에서 18개 모델 중 상위 5위, Harvey의 Legal Agent Benchmark에서는 75개 중 6위이자 오픈 웨이트 중 1위입니다(두 지표 모두 10월 6일 기준). 반면 광범위한 Vals Index에서는 44개 중 32위로, 버티컬 강점과 종합 성능은 다른 이야기를 들려줍니다.
Mistral Large 4는 오픈소스인가요?
아닙니다. 오픈 웨이트일 뿐, 다릅니다. 오픈 웨이트는 모델 파라미터가 공개된다는 뜻이지, 학습 데이터·학습 코드·다른 구성요소의 공개를 의미하지는 않습니다. Mistral은 아직 라이선스 조건을 공개하지 않았으니, 모델로 제품을 만들기 전에 반드시 확인하세요.
Mistral Large 4 웨이트는 언제 다운로드할 수 있나요?
2026년 10월 27일, Axios 보도에 따르면. API는 현재 Mistral Studio에서 이용 가능하지만, 프리뷰는 아직 강화학습 중이므로 공개되는 웨이트는 현재 API가 제공하는 모델과 다를 것입니다.