Tracks
当质量决定时,用 Claude Opus 5:它在知识工作 Elo(GDPval-AA v2 上 1,861 对 1,753)、AA 指数(63 对 61)以及已发布的编码指标如 DeepSWE v1.1(68.8% 对 65.9%)上领先。
2026 年 8 月 12 日,SpaceXAI 发布了 Grok 4.6,重点提升长时代理以及更具野心的交互与视觉工作能力。它在人工分析智能指数(Artificial Analysis Intelligence Index)上与 GPT-5.6 Sol 持平,标价为每百万输入 Token $2、每百万输出 Token $6。Claude Opus 5 则已是 Anthropic 的日常旗舰:Claude Max 的默认模型、Claude Pro 上最强的模型,并以每百万 Token $5 / $25 的价格做到是 Claude Fable 5 的一半。
本文将从编码、知识工作、视觉项目以及价格四方面比较 Grok 4.6 与 Claude Opus 5。若需分别深入了解各模型,请参阅我们的 Grok 4.6 指南 与 Claude Opus 5 指南。
Grok 4.6 是 SpaceXAI 于 2026 年 8 月推出的前沿模型,基于 Grok 4.5 打造,面向长时代理以及更具野心的交互与视觉工作。API 模型 ID 为 grok-4.6。上下文窗口为 500,000 个 Token,当提示超过 200,000 个 Token 后费率提升 2 倍。
xAI 的官方说明强调了在视觉与交互项目上的更强首轮产出,以及在长链路上的更多自测。Artificial Analysis 给出智能指数 61,与 GPT-5.6 Sol 大致齐平,落后于 Claude Opus 5(最高 63)。它已接入 Cursor 与 Grok Build,并可通过 SpaceXAI API、OpenRouter、Vercel 与 Cloudflare 访问。
如需自行调用,请参阅我们的 Grok 4.6 API 教程。如果您更关注代理封装而非模型卡,我们还在一个作弊泄漏的数据集上对比了 Grok Build 与 Claude Code。此外,我们也在 Grok 4.6 vs GPT-5.6 Sol 指南中与 OpenAI 当前旗舰模型做了比较。
Claude Opus 5 是 Anthropic 当前的 Opus 级模型,被定位为深思熟虑的日常主力,性能接近 Claude Fable 5,而价格为其一半。API 模型 ID 为 claude-opus-5。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型,定价与 Opus 4.8 相同:每百万 Token $5 / $25。
Anthropic 报告显示,其在 Frontier-Bench v0.1(43.3%)与 GDPval-AA v2(1,861 Elo)上达到 SOTA,同时在网络安全利用方面仍落后于 Mythos 5。快速模式约以默认速度的 2.5 倍运行,价格为基础价的两倍。开发者可从 Claude API 起步;它也列于 Amazon Bedrock、Google Vertex AI 与 Azure AI Foundry 的云目录中。
我们在 Claude Opus 5 指南 中对发布进行了拆解,并在 Opus 5 API 教程 中讲解了请求路径。若您在 Anthropic 体系内做选择,请参考我们关于 Opus 5 vs Fable 5 与 Opus 5 vs Sonnet 5 的对比指南。

在双方公开的综合指标上,Opus 5 略领先:人工分析智能指数 63 对 61,GDPval-AA v2 上的 Elo 为 1861 对 1753。价目表差距明显:Grok 4.6 每 100 万 Token 为 $2/$6,而 Opus 5 为 $5/$25。
| 特性 | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| AA 智能指数 | 61 | 63(最高) |
| GDPval-AA v2(Elo) | 1753 | 1861 |
| API 每 100 万输入 / 输出 | $2 / $6 | $5 / $25 |
| 上下文窗口 | 500k | 1M |
| 长上下文附加费 | 提示 Token ≥200k 时 2 倍 | 未公布 |
| API 模型 ID | grok-4.6 |
claude-opus-5 |
在双方都有发布的数据行中,Opus 5 领跑编码相关指标。尤其是在 DeepSWE v1.1 上,Opus 5 达到 68.8%,而 Grok 4.6 High 的 Cursor 侧数据为 65.9%。
另一个信号来自我们执行的 Grok Build vs Claude Code 测试:Grok 4.6 high 对 Claude Opus 5 high,各一轮对话,数据为植入泄漏的流失表。Grok Build 给出的答案更少但更即用;Claude Code 挖得更深,但也带出了一个仪表盘格式的 Bug。
如果您已为代码库工作支付 Anthropic 的价格,Opus 5 是更稳妥的公开选项。如果您想要不以前沿价计费的前沿编码模型,Grok 4.6 是我会在 Cursor 里真正常开的选择。
在知识工作上,Opus 5 领先:GDPval-AA v2 的 Elo 为 1861,而 Grok 4.6 为 1753。Artificial Analysis 仍将 Grok 排在仅次于 Opus 5 的位置,与 Fable 5 与 Qwen3.8 Max 的误差区间有重叠。
效率差距更大。在 AA-Briefcase 上,Grok 4.6 得分 1577,落后于 Opus 5 家族,但它约用 53 个回合与约 5 亿输入 Token。Opus 5(最高)约需 103 个回合与约 20 亿输入 Token。结论是:Opus 5 在记分板上取胜,而 Grok 4.6 在 Token 预算上获胜。
SpaceXAI 对 Grok 4.6 的主打,是在视觉与交互项目上的更强首轮产出。Anthropic 对 Opus 5 的发布在这方面更低调,更强调可验证性,并称“视觉输出强得多”,但未给出对 Grok 的公开数值对照。
因此我们进行了共享的着色器任务测试。两者都编写了可运行的 GLSL,但 Opus 5 的结果更贴近任务要求,并且对光标移动更敏感。Grok 4.6 的效果同样很好,且用更少的回合完成。

挂牌价是本次对比中最清晰的差距。Grok 4.6 每百万 Token 输入 $2、输出 $6,而 Opus 5 分别为 $5 与 $25。这使得 Anthropic 的模型在输入上贵 2.5 倍、在输出上贵 4 倍以上,差距非常显著。比如,高生成强度的月度用量(输入 100 万 / 输出 400 万)在 Grok 4.6 为 $26,在 Opus 5 为 $105。更均衡的助手(输入 100 万 / 输出 25 万)则为 $3.50 对 $11.25。
以下为公开的标准费率,以及双方实际存在的附加项。
| 费率 | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| 输入,每 100 万 Token | $2.00 | $5.00 |
| 输出,每 100 万 Token | $6.00 | $25.00 |
| 缓存读取,每 100 万 Token | $0.50 | $0.50 |
| 缓存写入,每 100 万 Token | $1.00(≥200k 行) | $6.25(5 分钟)/ $10(1 小时) |
| 快速变体 | $4 / $12(2 倍) | $10 / $50(2 倍;~2.5 倍速度) |
| 长上下文附加费 | 提示 Token ≥200k 时 2 倍($4 / $1 / $12) | 未公布 |
输出溢价最“伤”。快速模式在两者上都是 2 倍叠加,并非第三种形态。Opus 5 还公布了 50% 的批处理折扣($2.50 / $12.50),而 Grok 4.6 目前未提供。
公式一次说明:(体量 ÷ 100 万)× 费率;对输入与输出分别计算后求和;标准费率下,唯有超过阈值的行使用 Grok 的 2 倍附加费。数值在 $10 以下四舍五入到美分,超过 $10 则四舍五入到整数美元。
| 负载 | Grok 4.6 | Claude Opus 5 | 差异 |
|---|---|---|---|
| 均衡助手:输入 100 万 / 输出 25 万 | $3.50 | $11.25 | Opus 5 +$7.75(221%) |
| 高生成强度:输入 100 万 / 输出 400 万 | $26 | $105 | Opus 5 +$79(304%) |
| 检索,低于阈值:输入 1,000 万 / 输出 100 万 | $26 | $75 | Opus 5 +$49(188%) |
| 检索,超过阈值:输入 1,000 万 / 输出 100 万 | $52 | $75 | Opus 5 +$23(44%) |
当检索低于 200k 时,主要看输入费率($26 vs $75)。话虽如此,Grok 的 200k 附加费在此也会起作用:一旦跨过阈值,同样的 1,000 万 / 100 万 汇总就会变成 $52 vs $75。附加费缩小了差距,但仍不足以让 Opus 5 更便宜。
厂商图表并不能告诉您模型能否画出您描述的场景。我们从测试库中选取了一个共享的编码代理任务,然后汇总了结果页面。
我们测试了两者在创建一个全窗口着色器画面方面的能力:山脉地平线之上显示极光,以 p5.js 托管,并将鼠标与时间作为 uniform 传入。测试灵感来自 Ethan Mollick 的着色器提示。我们统一了主题以便结果更具可比性。两者各运行一次,不重试,均在 Cursor 中以相同工具链执行,并使用高推理变体。
原样提示:
Using p5.js (loaded from a CDN — that is the only external dependency allowed), build a single-file HTML page with a full-window animated shader. The scene: an aurora borealis rippling in curtains over a dark, silhouetted mountain horizon under a star-filled night sky. The aurora should react to the mouse — the curtains brighten and bend toward the cursor as it moves. Write the visual effect as a GLSL fragment shader; use p5 only to host the canvas, run the animation loop, and pass the mouse position and time into the shader as uniforms.
Ship it as one working file named index.html that starts animating on load. Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Grok 4.6 在 13 个回合内交付了可运行的 index.html。效果为真正的 GLSL 片段着色器,p5 仅作画布承载。极光帘幕具备极光感的运动,且采用三色分层,视觉上比 Opus 5 以绿色为主的单片更好看,背景还加入了闪烁的星星。
不足在于景观。群山更像卡通剪影,因此美学匹配得分为 4 而非 5。光标交互性一般:如下面视频所示,图像在 x 轴上非常敏感,但在 y 轴上响应不多。
Opus 5 同样通过了测试,也使用了真正的 GLSL。美学匹配到位:三层不同灰度的山脉、能读作极光的帘幕、闪烁的星星。配色以绿色为主,这也是极光最常见的颜色。因此就“正确性”更高一些,尽管我个人认为 Grok 的三色更好看。光标交互性优于 Grok 的着色器,帘幕在两个轴向上都会弯折并变亮。
Opus 的回合数远多于 Grok,总计 46。不过,其中有 19 回合与请求执行验证命令的许可相关(按测试规则不允许),因此真正用于创建着色器的回合为 27。尽管如此,Grok 所用回合仍仅为 Opus 的一半。
| 指标 | Grok 4.6 high | Claude Opus 5 high |
|---|---|---|
| 回合数 | 13 | 27 |
| 可运行性 | 通过 | 通过 |
| 美学匹配 | 4 | 5 |
| 着色器能力 | 5 | 5 |
| 光标交互性 | 3 | 5 |
| 遵循技术路线 | 5 | 5 |
Opus 5 更贴合任务要求:分层山脉以及对两个轴向的鼠标响应。Grok 4.6 的帘幕更为多彩,也通过了测试,但山体过于简化,且光标主要驱动 x 轴。
这仅是 n=1 的结果,并非 Token 或成本数据,只考察了以光标响应 GLSL 绘制描述场景的着色器,不涉及代码库编码或知识工作。

若由记分板定夺,选 Opus 5。若由发票定夺,Grok 4.6 是我会真正常开的前沿模型。
在以下情况下选择 Grok 4.6:
两款模型均可通过多种方式调用。应使用的模型字符串为 grok-4.6 与 claude-opus-5。
| 接入面 | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| 消费者应用 | Grok Build;Cursor(桌面、网页、iOS、CLI) | Claude Pro;Claude Max 默认 |
| 一方 API | 有(SpaceXAI API) | 有(Claude API) |
| 云平台 | Amazon Bedrock、Google Vertex AI、Azure AI Foundry | Amazon Bedrock、Google Vertex AI、Azure AI Foundry |
| 编码代理 | Cursor、Grok Build | Claude Code、Cursor |
| 第三方路由 | OpenRouter、Vercel、Cloudflare | OpenRouter、Vercel、Cloudflare |
| API 模型 ID | grok-4.6 |
claude-opus-5 |
在 Cursor 中,两者都可在下拉中选择。Claude Code 是 Anthropic 自家的;Grok Build 会读取 .claude/ 目录结构,而 Claude Code 不会对 .grok/ 文件做同样适配。API 侧仅需在各自厂商 SDK 内替换一条模型字符串。
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5", # Grok 4.6 is grok-4.6 on the SpaceXAI SDK, not this client
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function to reject leaked labels."}],
)
print(response.content[0].text)
各自 API 的完整配置见我们的 Grok 4.6 API 教程 与 Claude Opus 5 API 教程。若您更想用代理产品而非直接调模型 ID,请从 Claude Code 101 入手。
若工作是描述性视觉场景,或是要以 Elo 评判的知识工作代理,请用 Claude Opus 5。若工作是要计入账单的前沿编码代理,请用 Grok 4.6。
最显眼的是基准分对结果的决定力并不强。AA 指数差 2 分,或 GDPval-AA 差百余 Elo,都远小于价目表上的差距:相同的高生成强度月度用量,$105 对 $26。模型很接近,账单却不接近。
若您想了解这些代理背后的理念,推荐 AI Fundamentals 技能路径。在 Claude 原生工作流中,Claude Code 101 是实操起点。
当 API 成本是约束时,请使用 Grok 4.6。它每 100 万 Token 的挂牌价为 $2/$6,而 Opus 5 为 $5/$25,因此高生成强度的月度用量为 $26 对 $105。它还用一半于 Opus 的回合数完成了我们的极光着色器测试且结果良好;Artificial Analysis 报告称,在 AA-Briefcase 上它的回合数与输入 Token 也少于 Opus 5 最高版本。
当质量决定时,用 Claude Opus 5:它在知识工作 Elo(GDPval-AA v2 上 1,861 对 1,753)、AA 指数(63 对 61)以及已发布的编码指标如 DeepSWE v1.1(68.8% 对 65.9%)上领先。
Grok 4.6 的价格为每 100 万 Token 输入 $2、输出 $6。Claude Opus 5 为 $5 与 $25,与 Opus 4.8 相同。Grok 4.6 对 ≥200k Token 的提示收取 2 倍附加费;Opus 5 未公布长上下文附加费。两者的缓存读取均为每 100 万 $0.50(标准费率)。
Grok 4.6 在 SpaceXAI API 上的 ID 是 grok-4.6。Claude Opus 5 在 Claude API 上的 ID 是 claude-opus-5。它们并非可跨 SDK 直接互换的 ID;各自的 ID 只属于相应客户端。
可以,只要您的代理选择器同时列出两者。Cursor 将 Grok 4.6 与 Claude Opus 5 都作为可选模型,大多数常见路由与云目录也都提供,因此选择器很少成为限制。非对称性在于一方代理:Claude Code 是 Anthropic 原生,不会运行 Grok;而 Grok Build 会读取 .claude/ 目录,因此 Claude 形态的配置可以朝这个方向沿用,但反向不行。
与 DataCamp 一起学习 AI!
Tracks
Courses
Courses