跳至内容

Mistral Large 4(Le Chonk):我们所知的一切

Mistral 的万亿参数开放权重模型在网络安全与法律基准上领先。
已更新 2026年10月9日  · 15分钟 阅读

使用 AI 探索

ChatGPTClaudePerplexity

2026年10月6日,Mistral 发布了 Mistral Large 4(ML4)的公开预览版。这是一款拥有1万亿参数、每个标记有490亿活跃参数,支持文本与图像输入,并承诺在本月底开放权重的模型。它是 Mistral 迄今为止规模最大的模型,在 Mistral 位于欧洲的数据中心,使用3800块 Nvidia Grace Blackwell GPU 从零开始训练。

在过去的大部分时间里,性能最强的开放权重模型多由中国实验室(GLM、DeepSeek、Kimi、Qwen)推出,而总体最强的模型仍藏于美国的封闭 API 之后。Mistral 想要占据第三条赛道。其公告称,ML4 “已实现与全球最强的开源模型相当的性能,同时显著领先于任何由美国或欧洲开发的开放权重模型”。

实际情况比发布帖所呈现的更复杂。下文将介绍架构、基准测试(区分哪些已被独立复现,哪些尚未)、编码、视觉、网络安全、开放权重,以及仍未知的内容。如果您只能读一节,请优先看网络安全。

快速结论

Mistral Large 4(Le Chonk)是一款拥有1万亿参数的开放权重模型,Mistral 将其定位为中国以外构建的最强模型,尤其在网络安全、金融、法律和视觉定位方面。独立评测支持其在网络安全和法律上的说法,金融表现居中,并在广泛综合指数中位列44款模型中的第32名。API 已上线,权重将于10月27日发布。

什么是 Mistral Large 4(Le Chonk)?

上面的简述省略了很多细节,先从基础讲起。ML4 是 Mistral 的新旗舰,用 Mistral 自己的话说,是其“迄今为止最大、最强的模型”。Le Chonk 是昵称,不过 Mistral 的发布文案颇有反转:“非官方名为 ML4,正式名称:le Chonk。”

它是原生多模态的专家混合(MoE)模型。核心数据是总参数1万亿、每个标记活跃参数490亿,不过 Mistral 自家的 模型文档给出了略有不同的数字(总计1.05T,活跃52B)。两处都未解释差异。(为何“活跃”重要,会在下一节说明。)

Mistral 将 ML4 瞄准企业场景:编码、网络安全、金融、法律、制造与工程,以及读取技术图纸或卫星图像等视觉任务。

规格

详情

总参数量

公告称为1万亿,文档称为1.05T

活跃参数量

公告称为49B,文档称为52B

架构

专家混合,指令与推理混合

输入

文本与图像

输出

仅文本

上下文窗口

文档称为100万标记,vals.ai称为512K(悬而未决)

对于计划部署的人来说,最重要的两行都尚未明朗:上下文窗口和许可。在讨论模型如何工作之前,名称也值得简单解释一下。

为什么叫 Le Chonk?

2026年6月,Mistral 发布了一个讽刺性的“Le Chaton Fat”公告,虚构了一款24万亿参数模型,随后删除。但网络上的段子继续发酵,参数被吹到数百万亿。四个月后,Mistral 真正发布了万亿参数模型,名字也就自然沿用了。故事就这么简单。回到模型本身。

Mistral Large 4 的工作原理

Mistral 尚未公布完整架构细节(承诺将与权重一同发布),因此本节仅限于已披露的信息。

1万亿参数,490亿活跃

一个1万亿参数的模型并不会在每个标记上使用全部1万亿参数。MoE 模型会将每个标记路由到少数“专家”子网络,因此推理计算对应的是490亿活跃参数。这更接近于一款约50B参数的稠密模型,而非1T。

但它是否易于服务?并不。全部1万亿参数仍需驻留在某处内存中,因此自托管 ML4 需要严肃的多 GPU 基础设施。与同等活跃参数量的稠密模型相比,MoE 模型也更难以实现低延迟服务。Mistral 尚未公布硬件要求;除大型企业和政府机构外,很少有团队会自行运行完整模型,这并不令人意外。

多模态输入

这些活跃参数不仅处理文本。ML4 也可接收图像,但只输出文本。Mistral 称其“能够对复杂文档、图表和自然图像进行强有力的推理”,目标行业包括工程、制造与地球观测等注重视觉感知的领域。演示全是工业场景:检查技术图纸中的机械部件、从 PDF 中提取证据、在千兆像素卫星图像中定位难以发现的目标。

160+ 种语言

这些工业客户往往跨国运营,这就是语言能力的用武之地。Mistral 表示训练数据中有“相当比例”为多语言,覆盖160多种语言以及所有欧盟官方语言。对于一家争取欧洲政府客户的欧洲公司而言,这是重要卖点。

训练基础设施

对于欧洲定位而言,训练发生地也很重要。Mistral 称 ML4 是 在其自有的欧洲数据中心,使用3800块 Nvidia Grace Blackwell GPU 从零训练。Mistral 科学副总裁 Pierre Stock 对 TechCrunch 提供了更圆整的数字——4000块,并称这“比中国竞争对手少两到三倍”。这一对比尚无人核实。

其算力建设早已公开。2026年3月,Mistral 通过举债筹集了8.3亿美元,采购1.38万块 Nvidia GB300 GPU,用于巴黎附近的数据中心。Mistral 并未说明 ML4 是否就在该集群上训练,因此我不会将二者直接关联。

有一条细节会影响您看待本文所有基准的方式:强化学习(RL)仍在进行。RL 是后训练阶段,模型通过对自身任务尝试的评分来改进。Mistral 表示当前有约3000块 GPU 在跑 RL,每日生成约330亿标记,“尚未出现收敛迹象”。因此,今天通过 API 可调用的模型,并非10月27日将发布权重的那一个。

Mistral Large 4 的基准测试

尚未完成的 RL 是本节所有内容需谨慎对待的第一重原因。第二重原因是 Mistral 的大多数数据尚未被独立复现,已被复现的结果也并非总是吻合。

发布时的独立评测大致分三类:

  • 已独立复现:Artificial Analysis(AA)网络安全指数,包括其 CyberGym-E2E 组件;以及 vals.ai 的五项评测,包括 Terminal-Bench 4.0。
  • 由 AA 运行但尚未公开:Mistral 的编码图表脚注称,DeepSWE、Terminal-Bench 和 SWE-Atlas 的分数“使用的是 Artificial Analysis 在该测评套件公开前私下评估的结果”。这些数据将在 AA 的 Coding Agent Index公开后出现。在此之前,AA 与 Mistral 之外的人无法核验。
  • 仅 Mistral:其余所有。

请最关注表格的最后一列。即便基准由独立团队构建,ML4 在其上的分数也可能仍只是 Mistral 的自报。

基准概览

基准

ML4 结果

对手

测量内容

DeepSWE v1.1

61.7%,由 AA 私下运行

Kimi K3 69%,GLM-5.3 61%,DeepSeek V4 Pro 57%,Qwen3.8 Max 51%,Reflection Beam 44%(自报)

长周期软件工程

Terminal-Bench 4.0

Mistral 报告为28.3%,vals.ai 复现为22.73%

在 vals.ai 上位列44款中的第20名

复杂终端工作流

SWE-Atlas-QnA

59.4%,由 AA 私下运行

未公布

代码库理解

Coding Agent Index

49.8%,由 AA 私下运行

领先于 DeepSeek V4 Pro 0813 与 Qwen3.8 Max

上面三项编码基准的综合

AutomationBench

Mistral 报告为59.9%

领先于 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro

横跨 Gmail、Slack、Salesforce 等应用的657个业务流程

AA-Briefcase

1393 Elo,Mistral 引用为 AA 数据

领先于 DeepSeek V4 Pro

长周期知识型工作

Dense 200

Mistral 报告为42%

GPT-6 Astra 41%

视觉定位

AA Cyber Index

50%,18款中前五

Grok 4.7 56%,MiMo-V2.6-Pro 56%,GPT-6 Luna 53%

在真实软件中发现并修复缺陷

CyberGym-E2E

82%,18款中第1

MiMo-V2.6-Pro 79%,GPT-6 Luna 78%

复现并修补一个真实漏洞

Cybench

Mistral 报告为93%

据 Mistral 称,这是开放权重中“最高之一”

40道安全竞赛挑战

Finance Agent v2

54.68%

75款中第22名,32个开放权重中第7名

金融智能体任务

Harvey 的法律智能体

15.83%,75款中第6名

31个开放权重中第1名

自主法律任务

KORA 基准

1.691 / 2,Mistral 报告

在 Mistral 测试的开放模型中最高

负责任的 AI 行为

B3 抗攻击

Mistral 报告为93.3%

据 Mistral 称,“竞争对手中无更高分”

对提示注入的抗性

Vals 指数

48.05%,44款中第32名

16个开放权重中第9名

跨任务的广泛综合

Mistral 4 基准排名

将最后一行与 Mistral 的标题式表述放在一起看。在 vals.ai 的广泛指数上,ML4 总体位列44款中的第32名,仅在开放权重中位列16款中的第9名。与“可与全球最强开源模型竞争”的说法难以完全对上,至少在综合层面如此。Mistral 的垂直领域成绩看起来好得多,这并非错误,只是测量更聚焦。如果您要决定是否基于 ML4 构建,您所在的垂直领域比任何“头条”更重要。

编码

编码是标题与细节之间落差最先显现之处。Mistral 的数字乍看不错。但看其 DeepSWE 图表,您会发现文字未提到的一点。最高柱是 Kimi K3,69%,领先 ML4 七个点。ML4 略微领先 GLM-5.3(62% 对 61%),但一个点完全在不同测评“夹具”(harness)带来的噪音范围内。所谓“夹具”,是包裹模型参与智能体基准时的外部设置,包括工具、提示词以及尝试次数。在 Mistral 的图表上,每个对手都在不同夹具中运行。而在 Datacurve 自家的 实时 DeepSWE 排行榜上,所有模型都在相同设置下运行,GLM-5.3 和 Kimi K3 都达到 69%,DeepSeek V4 Pro 达到 63%。ML4 尚未上榜。

Terminal-Bench 从另一个方向显示了同样的效应。Mistral 报告为28.3%,vals.ai 的独立运行得到22.73%。我不认为这是谁在“灌水”,只是提醒:单一设置下的单一数字并不能代表排名。

人工评测更有意思。在 Mistral 委托 Surge AI 的盲测中,专业标注员按1到5分对编码输出打分。 ML4 在五款中位列第二(3.74),领先 GLM-5.3(3.60)、Kimi K3(3.59)和 GLM-5.2(3.40),远落后于 Claude Opus 5(4.22)。注意 Kimi K3:在 DeepSWE 上领先 ML4 七个点,在人工偏好上却落后。通过测试与写出人们乐于阅读的代码并非同一项技能。(而且这是 Opus 5,并非更新的 5.5,因此与最佳封闭模型的差距可能更大。)

Mistral 的第二项内部评估让事情更复杂:它发现 ML4 在编码与金融上“与 GLM-5.3 持平或接近”,只在 CAD 与 STEM 上更优。我会将两者视为大致相当。

金融

金融方面更简单,主要因为有独立数字作为锚点。ML4 在 vals.ai 的 Finance Agent v2 上得分54.68%,总体位列75款中的第22名,在32个开放权重模型中位列第7,稳居中游。Mistral 的实际主张更窄:ML4 在该基准上击败 GPT-6 Astra。

Mistral 还报告了在 FinWorkBench 上的强势表现,该基准测试模型是否能为真实的财务与会计任务构建与编辑电子表格。这些数字来自 Mistral 的图表,尚未被他处复现。

法律

法律方面纸面表现亮眼。在 Harvey 的法律智能体基准上,ML4 在75款中位列第6,在31个开放权重模型中位列第1。其得分为15.83%。

请再读一遍这个数字。全球第六的自主法律工作意味着大约每六个任务完成一个。该基准难度很高,排名是真实的,但不应将此解读为“ML4 可在无人监督下从事法律工作”。目前无一模型可以。

视觉与视觉定位

视觉方面相反:大胆宣称,但尚无独立数据。重点在视觉定位,即根据文本描述在图像中定位特定对象或区域,比如“在这张图纸中找出开裂的焊缝”,而非“描述这张图片”。Mistral 报告在 Dense 200 上得分42%,略高于 GPT-6 Astra 的 41%。若仅差一分,不足以作为采购依据。

Mistral 还称 ML4 在 ChartQA Pro 和 GDP.pdf(文档推理基准)上表现良好。上述视觉结果均未被独立复现。Mistral 强调的用例多为工业场景,从用于灾害响应的卫星图像,到检查技术图纸、扫描大型地理空间图像。

Mistral Large 4 的编码实力如何?

回到编码,这是多数读者实际会用 ML4 做的事。在开放权重中它具备竞争力,但不是市面上最好的编码模型,甚至在 Mistral 自己的图表上也不是最好的开放模型。我不重复数字了,这些数字在工作中的含义如下:

  • 在真实代码库中修复问题(智能体式软件工程):可用,但 Kimi K3 看起来更强。
  • 理解大型仓库:前景可期,但依据的是单一的私下运行分数。
  • 长时、多小时的智能体运行:Mistral 的 RL 设置面向长轨迹构建,但尚无人独立验证。
  • 重度终端工作:目前独立信号最弱。

在权重进入 AA 的公开 Coding Agent Index(预计在权重发布后)之前,我只会将其视为一个可信的开放权重选项。

开放权重在这里的价值与分数无关。企业可在自有基础设施上运行 ML4,而无需将专有源码发送至外部 API。对于在保密代码库上运行的编码智能体,这一点本身就可能决定选择。

Mistral Large 4 的网络安全表现

这是 Mistral 最大胆的主张。在 Artificial Analysis Cyber Index上,AA 对模型在真实软件中发现、复现并修补漏洞的独立评测显示,ML4 得分50%。在被测的18款模型中位列前五。仅 Grok 4.7、MiMo-V2.6-Pro 与 GPT-6 Luna 更高,GLM-5.3 Flash 与其持平。Mistral 称 ML4“在中国以外开发的开放权重模型中遥遥领先”,AA 的图表与此一致。

其中的亮点是该指数的三个组成部分之一 CyberGym-E2E。它要求模型在开源软件中复现一个真实漏洞(“CVE”,即已公开收录的安全缺陷),并予以修补。ML4 得分82%,在 AA 测试的18款模型中排名第一。Mistral 还报告在 Cybench(40道安全竞赛挑战)上拿到93%,但尚无人复现。

拒绝率数据也很有意思。在 CyberGym-E2E 上,AA 的图表显示 Claude Opus 5.5 因安全原因拒绝了约96%的任务,GPT-6 Astra 则拒绝了100%。这些模型几乎零分是因为任务被拒,并非能力不足。因此分数并不代表其真实能力。至于是否应当拒绝,这是另一个层面的讨论。

这正是 Mistral 的核心卖点。防御性安全工作往往从复现漏洞以证明其存在开始,安全团队需要规模化执行,扫描大型代码库并筛选数百条发现。若模型在大多数此类工作上选择拒绝,或其提供方在事故处理中途改变审核规则,那就是负担。Mistral 的主张是,自托管 ML4 能将其行为掌控在您自己手中。关于 AI 安全保障阻碍正当防御工作的更广泛讨论已持续一段时间。

坏消息也有:一旦权重公开,攻击者也能获得同等能力。AA 的指数刻意偏向防御(模型基于源代码工作,绝不要求构建可运行的利用程序),因此82%的复现分并不等于82%的进攻能力。尽管如此,从“复现崩溃”到“武器化”的距离并非无限。Mistral 正在发布前的三周内,与“网络安全领军者、审查过的合作伙伴和国家机构”一道对模型进行红队攻击测试,即有意诱导其不当行为。

为何开放权重对 Mistral Large 4 很重要

网络安全场景其实是在为开放权重辩护,且意义远超安全本身。“你可以下载模型”这句话远不足以概括。

银行在自有服务器上运行 ML4,无需将客户数据发送至 Mistral。政府机构可完全掌控部署环境。安全团队可在无需等待提供商审核政策的情况下调整模型行为——上一节已经说明,这并非假设。如果提供商宕机或废弃某版本,自托管部署仍可继续运行。

开放权重也让定制变得可行。我在四月曾介绍过 Mistral Forge,Mistral 表示 ML4 “使用与 Forge 提供给企业客户相同的训练、定制与 RL 环境”。对于希望在自有数据上微调 ML4 的机构,Forge 是显而易见的路径。

术语澄清:开放权重指训练后的模型参数可公开获取。这并不意味着训练数据、训练代码或其他组件采用开源许可证。Mistral 的 模型页面将 ML4 描述为开放权重,但尚未公布许可条款。在此之前,商业使用、微调权利与再分发都悬而未决。对于一款主打“可控”的模型却要写“请查看许可证”,确实有点令人沮丧,但事实如此。

Mistral Large 4 与欧洲“AI 主权”

“可控”也是 Mistral 政治叙事的核心。法国总统马克龙将 Mistral 的做法描述为 “AI 的第三条道路”。前两条是美国的封闭模型——能力强,但受美国法律和提供商政策约束;以及中国的开放模型——往往同样强,但对欧洲机构而言存在数据驻留与地缘政治顾虑。Mistral 的提议是:开放权重、欧洲基础设施、欧洲法律。

这包括一个据称由 Mistral “端到端、独立于其他数字服务提供商并受欧洲法律管辖”的欧洲部署。如果您受 GDPR 或行业数据驻留规则约束,在依赖该主张前,请与 Mistral 的数据处理协议进行核对。

Mistral 也有资金支撑这一主张。Mistral 称 ML4 是“由我们30亿欧元 D 轮融资支持的路线图上的第一个里程碑”,该轮由三星领投,估值210亿欧元,Mistral 将其描述为欧洲科技公司有史以来最大的一笔股权融资。大部分资金将投入欧洲数据中心产能。

那么,欧洲能否在让组织更好掌控模型运行位置与方式的同时,产出前沿级模型?ML4 在“可控性”上是个有力的数据点。而在“前沿性”上,Vals 指数第32/44 的结果显示,欧洲尚未到达那里。

Mistral Large 4 与其他开放权重模型对比

既然欧洲尚未到达,那么谁到了?ML4 与他们相比如何?我不会把各模型的分数放在一张表里,因为它们来自不同设置,汇总会暗示可比。参数量也不是能力的代名词。下表仅作定位:

模型

架构

权重可用性

强项

来源地

Mistral Large 4

MoE,1T 总计 / 49B 活跃

10月27日(计划)

网络安全、法律(有独立支持)

法国

GLM-5.3

未披露

可用

编码、STEM

中国

DeepSeek V4 Pro

MoE

可用

编码、数学

中国

Reflection Beam

未披露

可用

通用推理

美国

Qwen3.8 Max

未披露

未确认

多语言、编码

中国

Mistral Large 4 vs. GLM-5.3

这一对比最重要,因为 GLM-5.3 是中国最强的开放模型之一。如编码部分所述,在 Mistral 的图表上两者仅差1分,人工评测各有胜负,而在 ML4 尚未参与的实时排行榜上 GLM-5.3 达到 69%。在独立排行榜同时纳入二者前,暂可视为打平。

Mistral Large 4 vs. DeepSeek V4 Pro

在 Mistral 发布的对比中(DeepSWE、Coding Agent Index、AutomationBench、AA-Briefcase),ML4 都胜出,但均未独立确认;而 DeepSeek V4 Pro 在实时 DeepSWE 排行榜上达到 63%,高于 ML4 的 62%。金融方面尚无公开的正面对比。

Mistral Large 4 vs. Reflection Beam

Reflection Beam 是另一家西方的开放权重竞争者,因此是对 Mistral“中国产品以外最佳”的最直接检验。数据仍然稀薄。Mistral 的 DeepSWE 图表给出 Beam 44%,比 ML4 低近18分,但这是自报分对上 AA 运行的分,我不会过分依赖这一差距。Reflection 尚未披露 Beam 的规模,无法比较参数。ML4 则在多模态输入更广、网络安全的公开证据也强得多。

何时可以使用 Mistral Large 4?

在这些比较尘埃落定之前,您不必等待即可亲自试用 ML4。当前节奏如下:

  1. 10月6日:公开预览开启。任何人都可通过mistral-large-4 调用 Mistral Studio。
  2. 预览期间:网络安全领军者、审查过的合作伙伴与国家机构可获取“降低审核、扩展网络能力”的版本用于红队测试。Pierre Stock 告诉 TechCrunch,Mistral 将“与可信的合作伙伴和政府合作,确保开放源代码权重可用于防御,而非实施恶意攻击”。同时,RL 训练仍在继续,API 模型持续变化。
  3. 10月27日:计划发布权重,并附上完整架构细节、更多基准和 Mistral 的后训练方法。

权重发布后我会更新本节。

我们对 Mistral Large 4 仍未知的内容

在那之前,仍有很多未知。我在发布当天写下这些,因此清单较长:

  • 最终基准表现:RL 仍在进行,上述每一项分数都可能变化。Mistral 预期会有“大而快的提升”,但尚无人测量。
  • 编码、视觉和知识型工作的独立结果:除 AA 网络安全指数与 vals.ai 外,尚无复现。
  • 定价:公告与文档页说法不一致,预览价可能不会延续。
  • 许可条款:没有许可证,无法基于“开放权重”构建产品。
  • 自托管硬件要求:未公布。
  • 完整架构:承诺与权重一同发布,或将解释活跃参数 49B 与 52B 的差异。
  • 上下文窗口:Mistral 文档称100万标记,vals.ai 称512K。
  • 最终安全评估:红队测试将持续至10月。

结论

Mistral Large 4 是一款稀疏模型,总参数1万亿、活跃参数490亿,支持多模态输入,开放权重即将发布。首发当天我们看到,它在 Harvey 的法律基准上是最强的开放权重模型,但在 Vals 指数上位列44款中的第32名,并在 Mistral 自己的编码图表上落后于 Kimi K3。

我也不认为基准领先是 Mistral 的真正赌注。赌注在于:有能力的开放权重与自托管,才是企业与政府最在意的。网络安全中的拒绝率数据,是这套组合能解决安全团队现有痛点的迄今为止最清晰证据。

10月27日值得关注。届时权重发布,独立研究者可亲自跑最终检查点,Artificial Analysis 与 vals.ai 也能测试 Mistral 实际发布的模型,而非仍在训练中的预览版。Le Chonk 是否配得上发布帖,届时见分晓。

关于 MoE 模型背后的概念,我们的大型语言模型入门课程涵盖基础。关于 Mistral 的更多产品,请参阅我们对 Mistral Forge、 Mistral Large 3、 Mistral Le Chat 以及其基于终端的编码智能体 Mistral Vibe 2.0 的报道。


Oluseye Jeremiah's photo
Author
Oluseye Jeremiah
LinkedIn

专注于人工智能、机器学习与数据科学的技术写作者,擅长将复杂概念讲解得清晰易懂。

FAQs

什么是 Mistral Large 4(Le Chonk)?

这是 Mistral 的新旗舰,于2026年10月6日开启公开预览:一款专家混合模型,总参数约1万亿,每个标记活跃参数490亿。支持文本与图像输入、文本输出,计划于10月27日开放权重。

为什么叫 Le Chonk?

这是一则对“Le Chaton Fat”的呼应——Mistral 于2026年6月开玩笑发布、后又删除的一款虚构24万亿参数模型。这个梗在 AI 社交媒体上传开后,当真正的万亿参数模型到来时,名字也就顺理成章了。

Mistral Large 4 最擅长什么?

其最强的独立结果在网络安全与法律工作上。在 Artificial Analysis Cyber Index 上位列18款中的前五;在 Harvey 的法律智能体基准上位列75款中的第六、开放权重中第一(截至10月6日)。但在广泛的 Vals 指数上仅列第32/44,因此垂直强项与整体表现呈现不同图景。

Mistral Large 4 是开源的吗?

不是。它是开放权重(open-weight),不同于开源。开放权重指模型参数公开可得,但不必然包含训练数据、训练代码或其他组件。Mistral 尚未公布许可条款,因此在基于该模型构建产品前请先确认许可证。

我什么时候可以下载 Mistral Large 4 的权重?

2026年10月27日, 据 Axios 报道。API 现已可通过 Mistral Studio 获取,但预览版仍在强化学习阶段,因此发布的权重会与当前 API 服务的模型不同。

主题
人工智能

与 DataCamp 一起学习

课程

理解 Artificial Intelligence

2 小时
427.3K
了解人工智能基础概念,如机器学习、深度学习、NLP、生成式 AI 等。
查看详情Right Arrow
开始课程
查看更多Right Arrow