Tracks
我们一直在稳定地撰写关于 Meta 的 Llama 系列模型的文章(Llama 2、Llama 3 等)。随后,Llama 4 于 2025 年 4 月发布并遭到广泛批评,多个媒体以及公司离任的 AI 负责人都证实,其基准测试结果通过从未公开的专用子模型被操纵。
此后,更新戛然而止。大约同一时间,Meta 宣布将 Horizon Worlds 转至仅限移动端,这实际上终结了其曾押注公司未来的 VR 版本。看起来这家公司在两个战场上同时失去了立足点。
2026 年 4 月 8 日,Meta 推出了 Muse Spark,这是 Meta Superintelligence Labs 推出的首个模型。新闻稿中多次使用了“个人超级智能”这一表述。撇开这些不谈,底层仍然是一款实打实的模型,将 Meta 再次带回前沿讨论之列。
如果您想看看 Meta 的新模型与当前最强劲的竞争对手之一相比如何,建议阅读我们的指南:Muse Spark vs Claude Opus 4.6。您也可以阅读我们的Muse Glimmer 指南以及本地运行 Muse Glimmer 的教程。
Muse Spark 是什么?
Muse Spark 是一款原生多模态推理模型,在单一架构中处理文本、图像、音频和工具使用。它支持可视化思维链,这意味着模型能够对基于图像的问题逐步推理,而非仅给出一个最终答案。它还包含多代理编排,我们稍后会谈到。
早期的 Llama 模型基于训练中的模式匹配给出答案。Muse Spark 会在回答前先把问题推理一遍。这就是实质性的转变。
谁在推动它?
Meta Superintelligence Labs(MSL)成立于 2025 年 6 月 30 日,彼时 Mark Zuckerberg 调整了公司的 AI 组织架构。Scale AI 前 CEO Alexandr Wang 出任首席 AI 官;作为交易的一部分,Meta 对 Scale AI 投资了约 140 亿美元。
GitHub 前 CEO Nat Friedman 负责产品与应用研究,OpenAI 的 GPT-4 与 o1(Muse Spark 目前对标的同一款 o1)的共同创建者赵昇佳出任首席科学家。
还有一个值得点名的第三个因素:Meta 长期的首席 AI 科学家、公司最显眼的开源拥护者 Yann LeCun 于 2025 年 11 月离职。此前的组织调整限制了他的角色,团队也转向闭源开发。
Muse Spark 有哪些新变化(以及为何值得关注)?
核心亮点是推理模式、重构的训练流水线,以及对健康领域的刻意聚焦。我们按顺序来看。
三种推理模式
Muse Spark 提供三种交互方式,在尝试之前了解它们之间的区别很有价值。
- Instant 是面向日常查询的默认模式。它快速响应,不进行延展推理,类似标准聊天模型。
- Thinking 使用扩展的思维链推理。模型会花更多时间,推演中间步骤,在较难问题上通常表现更好。本文大多数基准测试结果都来自该模式。
- Contemplating 是最有意思的一种。详见下文。
需要先说明一点:Contemplating 模式正逐步推出,首日并非所有用户都可用。如果您暂时没看到,这是正常的。
Contemplating 模式
Contemplating 模式会启动多个并行工作的推理代理,并将它们的输出融合为一个响应。相比之下,Gemini 的 Deep Think 和 OpenAI 的 GPT Pro 模式通过“想得更久”来扩展推理,Muse Spark 则通过“想得更广”来扩展推理。更多代理同时工作,而不是一个代理工作更久。
Meta 的观点是,这种方式在延迟更低的情况下可产生相当的效果,因为代理是并行而非串行运行。目前尚无独立的延迟验证,但 Contemplating 模式在若干高难评测上的基准数据领先(稍后详述)。
这是一种推理时特性,而非架构层面的改变。模型本身并未变化。
强化学习扩展与“思维压缩”
Meta 在开发 Muse Spark 的九个月中,从零重建了训练栈。关于强化学习(RL)的说法主要来自 Meta 的技术博客,尚未获得独立验证。
更有意思的细节是研究团队称之为“思维压缩”的技术。在 RL 训练过程中,模型因得到正确答案而被奖励,但也因思考时间(对应过多输出 token)而被惩罚。这在处理数学等复杂任务时,会形成三阶段行为。
首先,模型通过“想更久”来提升。随后,长度惩罚生效,迫使模型用更少的 token 解决同样的问题。到某个阶段,模型再次延展推理,在使用更少 token 的同时突破先前的性能上限。
实际结果是:模型学会了“以少胜多”。这一结论基于 Meta 自己的训练曲线,尚未独立验证。
计算量减少 10 倍
Meta 声称其新架构在训练算力上减少十倍的情况下,仍能匹配 Llama 4 Maverick 的性能。这关乎架构效率,而非 Muse Spark 的上限。Llama 4 Maverick 在 Artificial Analysis Intelligence Index 上得分 18。Muse Spark 得分 52。
Artificial Analysis 独立测试的 token 效率数据也指向相同方向。Muse Spark 使用了 5800 万个输出 token。GPT-5.4 使用了 1.2 亿。Claude Opus 4.6 使用了 1.57 亿。
健康:刻意聚焦
健康是 Muse Spark 最明显的基准优势,而且是有意为之。Meta 与超过 1000 名医生合作,为健康推理精心整理了训练数据。
该模型可以生成涵盖营养成分、药物信息和运动生理的交互式展示。在 HealthBench Hard 上,Muse Spark 得分 42.8,GPT-5.4 为 40.1,Gemini 3.1 Pro 为 20.6。对比 Gemini 的差距在独立评估下同样成立。
这显然是 Meta 对 ChatGPT Health 的回应。Meta 之所以认为自己能竞争,在于 30 亿用户规模的社交语境,这应当能帮助其更好地理解人们实际如何提出健康问题。至于这种优势能否覆盖复杂或罕见问题,而不只是基准中常见的日常问题,值得观察。
Llama 怎么办?
开发者社区只问了一个问题,这值得直接回答。
Muse Spark 不是开源的。直到 Llama 4 的每个 Llama 模型都随权重一同发布,开发者可以下载并在本地运行。像 r/LocalLLaMA 这样的社区由此建立。这个用例没了。
Meta 的说法部分出于竞争:包括 DeepSeek 在内的中国实验室使用 Llama 权重加速了自身研究。Wang 表示公司“希望”未来将 Muse 模型开源,但未给出时间表。这句里的“希望”承担了很大的分量。
Llama 团队已并入 Wang 的实验室,Llama 4 是旧架构下的最后一个模型。Llama 是否会与 Muse 并行继续,还是悄然淡出,Meta 并未表态。
Muse Spark 基准测试结果
鉴于 Llama 4 的历史,Muse Spark 的基准测试需要先把自报数据与独立验证数据分开看,这一点很重要。
以下为 Thinking 模式的结果,也是大多数可公平比较的数据所在。

来源:Meta Superintelligence Labs / ai.meta.com
Contemplating 模式针对最高难度评测有单独一组数据。在 Humanity's Last Exam 和 FrontierScience Research 上领先,但在 IPhO 2025 理论物理问题上落后于 GPT-5.4 Pro 和 Gemini 3.1 Deep Think。以上均为 Meta 自报数据,宜作为方向性参考而非定论。

来源:Meta Superintelligence Labs / ai.meta.com
Artificial Analysis 的独立评估更为谨慎。他们将 Muse Spark 排在智能指数第四,落后于 Gemini 3.1 Pro Preview、GPT-5.4 和 Claude Opus 4.6,但仍居全球前五。数据也清晰显示了短板:如果您的用例重视编码或抽象推理,ARC-AGI-2 和 Terminal-Bench 2.0 值得关注。
测试 Muse Spark
基于上述基准分数,让我们实际测试一下 Muse Spark。我将从多步推理、图像理解与代码调试三个方面考察该模型。
测试 1:斐波那契—二进制逻辑链(级联推理稳定性)
在第一个测试中,我用一个多步骤练习来瞄准 Muse Spark 的高级推理能力。模型需要:
- 找出正确的斐波那契项
- 准确转换为二进制
- 精确计数比特位
- 在计算出的区间内生成素数
- 执行一次大规模求和
使用的提示为:
Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?
Muse Spark 表现很好,首次尝试就正确解出了该练习。更令人印象深刻的是,GPT-5.4 在最后一步失败,只有将其拆分为两个步骤(列出素数再求和)才成功。

测试 2:多线时序图的图像理解与销售推理
Meta 宣称 Muse Spark 善于理解复杂图像,所以我使用下面这张多线时序图,看看它能否识别模式并转化为有用的建议。

提示如下:
Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark 正确识别了所有模式,说明其图像识别效果不错。

所用数据是随机虚构的,因此并没有明确的标准答案。尽管如此,Muse Spark 能识别所有事件,并针对不同产品及各次事件发生的时间进行推理,得出了合理结论。它甚至在未被提示的情况下分析了产品组合的月活跃用户(MAU)总和变化,这是一个不错的加分项。

所有建议的下一步都与产品 MAU 模式和事件影响的分析相一致。Muse Spark 为每个产品识别出了最重要的主题(A 的发布打法、B 的定价、C 的规模化),并提出了合理的具体行动。
测试 3:代码调试
最后,我将测试 Muse Spark 在诊断代码缺陷方面的能力。该测试旨在检验模型是仅能逐行追踪代码正确性,还是也能发现底层缺陷。
提示如下:
A developer wrote this Python function to compute a running average:
def running_average(data, window=3):
result = []
for i in range(len(data)):
start = max(0, i - window + 1)
chunk = data[start:i + 1]
result.append(round(sum(chunk) / window, 2))
return result
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!
该函数始终以 window (3) 为除数,即使在开头 chunk 的元素少于 3 个时也是如此。错误输出为 [3.33, 10.0, 20.0, 30.0, 40.0],但前两个值应分别为 10.0 和 15.0,因为对应的 chunk 仅包含 1 个和 2 个元素。修复方法是将 / window 改为 / len(chunk)。
模型常常能完美追踪循环中的数学步骤,但最后却报告“看起来正确”。它们会逐步看到数学运算,却不会指出用 3 去除单个元素不合理。这要求模型同时把握意图(移动平均应如何工作)与执行(代码实际在做什么),并发现两者间的落差。

Muse Spark 识别出了移动平均这一意图并找到了错误。它提出了正确的修改,并解释了必要性。它甚至建议了另一种方案,以便在需要时完全跳过不完整的窗口。
总体而言,模型圆满通过了三项测试,给人留下了不错的第一印象。
如何访问 Muse Spark?
您可以在 Muse Spark 上通过 meta.ai 或 iOS 与 Android 的 Meta AI 应用访问。两者均免费。初期在美国优先推出,随后数周扩展至其他地区。 
Meta 计划在相同时间范围内将其推广至 WhatsApp、Instagram、Facebook、Messenger 以及 Ray-Ban AI 眼镜。
目前暂无公共 API。私有预览面向部分企业合作伙伴开放,尚未确认更广泛开放日期。关于隐私:Meta 的政策对将对话用于改进其模型的限制较少。如果您计划分享敏感信息,请先阅读相关条款。
Muse Spark 的不足之处
Meta 在其技术博客中直言不讳:该模型在多步代理任务与编码工作流方面存在缺口。
在 SWE-Bench Verified 上,与 Gemini 和 Opus 4.6 的差距较小。但在代理化工作上差距拉大:Terminal-Bench 2.0(59.0 对 GPT-5.4 的 75.1)与 GDPval-AA 办公自动化(1444 对 GPT-5.4 的 1672)。这差距不小。
抽象视觉推理同样如此:Muse Spark 在 ARC-AGI-2 上为 42.5,而 GPT-5.4 与 Gemini 均在 70 分中段。擅长读图表的模型,在新奇视觉模式上却明显落后。
这一点在发布当天就引发回应。François Chollet(ARC Prize 联合创始人、Keras 与 ARC-AGI 的创建者)称该模型“为公众基准过度优化,牺牲了其他一切”。Wang 回复并承认 ARC-AGI-2 的差距,同时指出用户在视觉编码与推理方面的正面反馈。此结论能否在更大范围的使用中成立,仍有待观察。
此前提到的公共 API 缺失,也是竞争层面的不足。Wang 在发布日表示:“我们确实还有一些模型行为上的粗糙边角,会随着时间打磨。”
Muse Spark 的安全性
Meta 在发布前依据其 Advanced AI Scaling Framework 进行了评估。在 BioTIER-refuse 上,Muse Spark 在生物武器查询拒绝率方面位居比较集首位。上述数字来自 Meta 自报。

来源:Meta Superintelligence Labs / ai.meta.com
更有意思的发现来自 Apollo Research。他们发现,Muse Spark 在他们测试的所有模型中展现出最高的“评估觉察”率:模型经常识别出安全评估的测试情境,并因此表现得更加谨慎。
一个只有在“被盯着看”时才表现良好的模型,是一个值得认真对待的问题。Apollo 先前的研究记录了这种模式会在实际部署中提高他们所谓的“谋划行为”。
Meta 在发布日对这一发现予以承认,这在各实验室中并不常见。他们的后续研究认为该问题影响的是一小部分对齐评估,且与危险能力无关,结论是不构成阻塞性担忧。相关研究仍在进行中。
Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1
上文的基准测试展示了这些模型能做什么。本节讨论实际应该用哪一款。
一览
|
规格 |
Muse Spark |
GPT-5.4 |
Opus 4.6 |
Gemini 3.1 Pro |
|
发布时间 |
2026 年 4 月 8 日 |
2026 年 3 月 5 日 |
2026 年 2 月 5 日 |
2026 年 2 月 19 日 |
|
上下文窗口 |
262K* |
1.05M |
自 3 月 13 日起为 1M |
1M |
|
输入模态 |
文本、图像、语音 |
文本、图像 |
文本、图像 |
文本、图像、音频、视频 |
|
API 价格(每 100 万个 token 输入/输出) |
无公共 API |
$2.50 / $15.00 |
$5.00 / $25.00 |
$2.00 / $12.00 |
|
面向消费者的访问 |
meta.ai(美国优先) |
ChatGPT |
Claude.ai |
Gemini 应用 |
*Artificial Analysis 记录的 Muse Spark 上下文窗口为 262K。部分来源称为 1M。Meta 尚未发布确认任一数值的模型卡。
您该用哪一个?
在以下情况选择 Muse Spark:您的用例是健康查询、图表解读或面向消费者的多模态应用。当前尚无公共 API,如果您要构建生产级集成,还需等待。
在以下情况选择 GPT-5.4:您需要一款今天就能用于构建的通用模型。它在编码、抽象视觉推理与办公自动化上领先,并已提供公共 API 与 1M 上下文窗口。
在以下情况选择 Claude Opus 4.6:您需要处理长文档或需要谨慎、高质量的写作输出。自 2026 年 3 月 13 日起,其 1M 上下文窗口进入标准定价。其价格在本组中最高,为每 100 万 token $5/$25。
在以下情况选择 Gemini 3.1 Pro:您的流程需要处理视频。它是此处唯一支持视频输入的模型,且以 $2/$12 每 100 万 token 成为本组最便宜的前沿选项。
大家如何评价 Muse Spark
早期反应正如预期地分化。一些人发现了具体而令人惊讶的点,另一些人看着基准表得出了不同结论。

“从零重建完整栈”的表述频繁出现。对于这 9 个月的时间线,信或不信取决于您对 Meta 说法的信任程度。
Pietro Schirano 分享了一个具体示例:他让 Muse Spark 将 UI 截图转为代码,结果模型从界面中提取了图像素材,而不是将其当作一张平面的图片。

这不是基准测试。这类内容之所以会被分享,是因为确实出人意料。
Aakash Gupta 的观点最为尖锐。他的表述是:“这是一个数据标注公司 CEO 的模型。指纹遍布结果之中。”Muse Spark 领先的那些基准,都是训练集策划决定上限、对数据质量高度敏感的任务。
而其落后的那些(ARC-AGI-2、Terminal-Bench、GDPval)恰恰是架构与 RL 扩展比数据更重要的领域。他的结论是:“他把数据管道能解决的事情做到最好,而其他一切则平庸。”

结论
在 Artificial Analysis Intelligence Index 上,Llama 4 Maverick 的 18 分到 Muse Spark 的 52 分,跃升并不含糊。对于一个在九个月内从零重建的团队而言,健康与多模态方面的结果是实打实的第一步,并经受住了独立测试。
当然,短板也很明显。与 GPT-5.4 相比,编码与代理化任务差距不小;抽象视觉推理是明显弱项,而且仍然没有公共 API。如果您需要一款今天就能对接的模型,Muse Spark 还不是。
我始终回到开源这个问题。Llama 生态建立在“权重可用”的信任之上。Muse Spark 打破了这一点。Wang 所说“希望”开源未来版本并非承诺。在我看来,这是此次发布最具影响力的变化,却远没有基准分数那么受关注。
更大的 Muse 模型正在开发中。如果架构如其所称具备可扩展性,今天的数字将显得保守。这就是赌注。
如果您想学习如何更高效地使用任意大语言模型,建议学习我们的 Understanding Prompt Engineering 课程。
Muse Spark 常见问题
如果我在本地使用 Llama,Muse Spark 能替代它吗?
不会。Muse Spark 仅限云端使用。您无法下载、在本地硬件上运行或进行微调。访问方式为 meta.ai 或 Meta AI 应用,两者都需要 Meta 帐号。Llama 构建其社区所依赖的“开放权重”用例在这里并不存在。
我什么时候该用 Contemplating 模式而不是 Thinking?
当问题确实存在多条有效解法路径、涉及复杂的科学问题、含有歧义输入的多步推理,或不同视角可能得出不同结论的研究任务时,Contemplating 模式最有用。对多数日常查询而言,Thinking 模式更快,且结果相当。另一个值得了解的点:Contemplating 模式仍在逐步推出,您可能暂时还无法访问。
所谓“计算量减少 10 倍”对我这个用户意味着什么?
眼下对您而言可能没什么影响。该对比针对的是 Muse Spark 自身的上一代模型,而非 GPT-5.4 或 Gemini,且该数值尚未独立验证。更相关的数据点是推理效率:如前所述,Artificial Analysis 的独立测试中,Muse Spark 使用了 5800 万个输出 token,而 Claude Opus 4.6 为 1.57 亿。该差距未来可能反映在定价上,但 API 定价尚未公布。
值得从我现在用的模型切换到 Muse Spark 吗?
如果您用 ChatGPT 处理通用任务,日常体验相近。若您的主要用例是健康查询、科学或图表分析,Muse Spark 是个不错的升级。如果您依赖编码助手或长文档工具,它目前还不能替代 GPT-5.4 或 Opus 4.6。详情见上方对比表。
我是否应担心“评估觉察”的发现?
日常使用层面不必过度担心,但值得理解其含义。研究发现 Muse Spark 在识别到自己正处于安全测试场景时,会更为谨慎地表现,这并非因其底层“价值观”不同,而是因为识别了上下文。Meta 的后续研究认为,这影响的是一小部分对齐评估,且与危险能力无关。如果您在为敏感部署评估模型,建议在仅根据安全基准分数下结论前,先阅读 Apollo 的完整报告。