Tracks
多数读者仍将 Grok 背后的实验室称作 xAI。SpaceXAI 于 2026 年 8 月 12 日发布了 Grok 4.6,距 Grok 4.5 刚刚过去一个多月,本次侧重编码、可视化网页工作,以及运行时间更长的代理任务。
发布数据并不支持一个简单的排行榜。Grok 在 SpaceXAI 选定的一些测试中领先,而 GPT-5.6 Sol 和 Claude Fable 5 在其他测试中居前。Artificial Analysis 将 Grok 与 Sol 放在同一智能水平,但 Grok 的混合价格更低;不过此次升级的首字延迟更晚,且按任务计费高于 Grok 4.5。
本文将沿着这一取舍,依次看模型规格、定价、接入方式,并与 Sol 和 Claude 直接对比。我们此前的 Grok 4.5 报道着重低 Token 使用。本次的问题在于:当考虑到缓存输入、推理 Token 与额外输出后,更高分数是否会改变实际账单。
要点速览:Grok 4.6
简评:这 5 分的提升本身并没有发布页所暗示的那么重要。价格行为与任务类型更能决定是否更换模型。
-
在
high努力级别,Grok 4.6 在 Artificial Analysis Intelligence Index 上得分 61,与 Sol 在max下数值相当,落后 Opus 5(max)2 分。 -
基础输入与输出费率仍为每百万 Token 分别 $2 与 $6,但缓存输入、首字延迟与按任务计费均较 Grok 4.5 上升。
-
在 AA-Briefcase 中,Grok 使用的轮次与输入 Token 少于 Opus 5;Sol 领跑终端测试,而 Sonnet 5 在不加长提示溢价的情况下提供两倍的上下文。
以下对比将供应商自述与 Artificial Analysis 结果分开看。这很关键,因为随努力级别或测试设置变化,模型的相对位置也会改变。
什么是 Grok 4.6?
Grok 4.6 是 SpaceXAI 的专有推理模型。API 与 Cursor 暴露的上下文上限不同,而且更高的长上下文费率远早于 API 上限就开始计算。下表将这些约束与输入类型、工具,以及知识截止点并列展示。
|
规格 |
Grok 4.6 |
|
500,000 Tokens(API);256,000 Tokens(Cursor 内) |
|
|
输入 / 输出 |
文本与图像输入;文本输出 |
|
推理力度 |
Low、Medium、High(默认)、XHigh |
|
知识截止 |
2026 年 2 月 1 日 |
|
工具 |
|
|
标准定价 |
每百万输入 Token $2,缓存 $0.50,每百万输出 $6 |
|
长上下文定价 |
当提示达到 200,000 Tokens 后,整次请求按 $4 / $1 / $12 计价 |
SpaceXAI 仍未公布任一模型的参数量。一些报道中的 1.5 万亿数字并非出自 SpaceXAI,因此不属已确认规格。
Grok 4.6 有哪些新变化?
SpaceXAI 表示这并非从零开始训练的新模型,而是在 Grok 4.5 的基础上继续训练,额外关注AI 代理任务。报告的变化集中在更长的代理运行、可视化构建与后训练上。
更长的代理任务
SpaceXAI 称 Grok 4.6 在多步骤的长任务(如研究、跨代码库工作与构建应用)中更能保持轨道。该模型据称会更频繁地自查,而非一遍通做完。
这也契合更广泛的测试变化。若模型在多次调用工具后遗忘先前决策,首答质量的重要性会下降。GitHub 的内部测试也发现 Grok 4.6 能在更长任务中持续推理并使用工具。
API 也提供了与此相关的功能。Grok 4.6 可流式输出推理摘要,Grok 4.5 未对外开放此能力;xAI 建议在长代理循环中配合使用上下文压缩与粘性 prompt_cache_key。压缩会将较早的历史浓缩为一条,但仍会消耗 Token,且请求必须先在压缩前适配进上下文窗口。
可视化与交互式网页开发
SpaceXAI 与 Cursor 都报告在可视化项目上的首次尝试更好。在一项外部测试中,Grok 4.6 将一款旧款 iPod Mini 产品页重构为 3D 站点,包含可用的色轮与滚动动画。演示可用,但一次测试无法证明更广泛的结论。
Grok 4.6 的后训练方式
若您只关心基准与定价,可跳过此小节。这里解释 SpaceXAI 对增益来源的说明。
SpaceXAI 进行了比 Grok 4.5 更多的训练。它使用了由 AI 生成的推理示例与工程示例,通过基于模型的检查去除质量较差的示例,随后在 强化学习方面对编码、办公任务、网页开发、内核调优与计算机设计进行训练。SpaceXAI 还称 Grok 4.5 在不同推理设置与主题上生成了新的训练示例。公司将增益归因于更多训练与更严格的数据筛选,而非新架构。
外部团队无法核验这些细节,SpaceXAI 也未分享足够信息以复现实验。这是公司给出的变化说明,而非外部复核的结果。
Grok 4.6 基准测试:官方与独立结果
SpaceXAI 的发布表展示了分数上涨的项目,但其竞品分数来自“自报或公开可得的最佳结果”。并非同一团队在同一设置下测试所有模型。下文加入了推理力度,因为它会影响得分。
|
基准 |
Grok 4.6(high) |
Grok 4.5(high) |
GPT-5.6 Sol(max) |
Claude Fable 5(max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2(Elo) |
1,753 |
1,526 |
1,728 |
1,741 |
|
DeepSWE 1.1 |
65.9% |
54.0% |
73.0% |
70.0% |
|
Terminal-Bench 3.0 |
26.0% |
15.7% |
34.6% |
34.1% |
|
APEX-Agents |
57.5% |
47.1% |
56.7% |
59.2% |
|
CursorBench v3.2 |
69.9% |
66.7% |
67.2% |
70.5% |
Grok 4.6 在整表上均较 Grok 4.5 有提升。Sol 的最大差距出现在 DeepSWE 与 Terminal-Bench,而 Fable 在 3 行居前。即便在 SpaceXAI 自己的表格中,也看不出唯一赢家。
独立基准结果
Artificial Analysis 对六个模型运行了自己的 Intelligence Index。本次结果与 SpaceXAI 的数字接近,但并不相同。

Grok 4.6 对比五个前沿对手。图片来源:作者。
图中 Grok 与 Sol 智能持平,但混合价格低得多。Artificial Analysis 以 7:2:1 的缓存输入:未缓存输入:输出比例计算该价格。每个完成的指数任务的成本同样体现差距:Grok $0.84,Sol $1.23,Opus 5 为 $2.34。
首答 Token 时间由 Grok 4.5 的 14.62 秒升至 40.44 秒,单任务成本由 $0.36 升至 $0.84。Grok 4.6 在相同测试中多用了约 20% 的输出 Token,因此标价不变并不代表任务成本不变。按完成任务计价比仅看 API 价卡更能反映真实情况,因为它包含了完成工作所用到的一部分额外推理。
与 GPT-5.6 Sol 和 Claude Sonnet 5 相比,Grok 4.6 更早送出首个答案 Token。Sol 在 max 努力下需 213.52 秒,Sonnet 5 需要 184.48 秒,而 Grok 仅 40.44 秒。只有与低时延模型(如Gemini 3.7 Flash)对比时,Grok 才显得慢。
这些基准对比有多可靠?
它们有助于发现相对强项,但并非可靠的跨模型排名。推理力度会改变分数与响应时间:GPT-5.6 Sol 在 high 努力下得 57,在 max 下得 61。基准名称也可能指向不同版本,因此 xAI 的 Terminal-Bench 3.0 与 Artificial Analysis 的 Terminal-Bench 2.1 并不可比。
与 Grok 4.5 的变化
对于 Grok 4.5 用户,问题不在于 4.6 在抽象意义上是否“更好”,而在于更高分数能否抵消不同的时延与 Token 使用特征。下表将这些变化放在同一基线。
|
指标 |
Grok 4.5(high) |
Grok 4.6(high) |
|
AA Intelligence Index |
56 |
61 |
|
每个指数任务成本 |
$0.36 |
$0.84 |
|
首答 Token 时间 |
14.62s |
40.44s |
|
缓存输入价格 |
$0.30 / M |
$0.50 / M |
|
运行指数使用的输出 Token |
60M |
72M |
|
基础输入 / 输出价格 |
$2 / $6 |
$2 / $6(不变) |
但是,“同价”只描述基础标价。对现有 Grok 4.5 用户还存在一项更重要的变化:缓存输入上涨 67%,由每百万 Token $0.30 提至 $0.50。更高的缓存费率扩大了价卡与实际完成任务成本之间的差距。
Grok 4.6 与竞品对比
比较完与前代的差异后,我们来看 Grok 4.6 与 OpenAI、Anthropic 的其它尖端模型如何对比。
Grok 4.6 vs GPT-5.6 Sol
指数上的平局掩盖了明显分野。Sol 在 DeepSWE 领先 7.1 分、在 Terminal-Bench 领先 8.6 分,使得偏终端的编码任务成为其最强用例。Grok 在另外三行任务上得分更高。
OpenAI 自身的测试将该终端优势延伸至网页浏览与计算机使用。它们依然是供应商选择的证据而非受控对比,但指向相同方向:Sol 的最强用例是依赖终端、浏览器或反复工具调用的工作。
OpenAI 还预览了 Ultrafast 模式,称其速度最高可快 14 倍。尚无公开价格,因此未纳入成本对比。
Grok 4.6 的起价为每百万输入 Token $2、每百万输出 $6。Sol 的标准费率为每百万输入 $5、输出 $30,输出价格是 Grok 的 5 倍。超过 272,000 个 Token 后,Sol 将输入价格翻倍,输出升至 $45。
这并不意味着每个 Grok 任务都便宜五倍。推理 Token 使用、缓存命中与轮次仍会改变最终账单。当 Token 使用可预测时,Grok 的价格优势最为明显。对于终端密集型工作,Sol 在基准上的更高分可能比标价差更重要。
Grok 4.6 vs. Claude Sonnet 5
Sonnet 5 与 Grok 4.6 的输入均从每百万 Token $2 起步,便于对比。Sonnet 5 默认有 100 万 Token 的上下文窗口,是 Grok 50 万的两倍,且长提示不加价。输出成本为每百万 $10,而 Grok 为 $6。
在 Grok 4.6 发布前两天,Anthropic 将 $2/$10 定价永久化,并取消了上调至 $3/$15 的计划。与较旧的价目表(包括我们早前的)比较时需注意。
在 Artificial Analysis 指数上,Sonnet 5 在 max 努力下得分 55,比 Grok 4.6 低 6 分。其测试共使用 3 亿输出 Token,而 Grok 为 7,200 万,令其单任务成本达到 $1.72。其分词器对同一文本产出的 Token 大约比 Sonnet 4.6 多 30%。这也让两代 Sonnet 之间的价格比较更复杂。此外,Sonnet 5 也并非 Anthropic 的顶级模型。
Grok 4.6 vs Claude Opus 5 与 Fable 5
Opus 5 按每百万输入 $5、输出 $25 计价,指数得分 63 居首。Fable 5 每百万输入 $10、输出 $50,得分 62。关于 Fable 的指数分还需说明:Artificial Analysis 记录到部分高难提示触发安全回退,因此分数反映的是用户可实际使用的模型,而非 Anthropic 不提供的无限制版本。
在 Artificial Analysis 的 AA-Briefcase 长代理任务基准上,Grok 4.6 约用 53 轮、0.5 十亿输入 Token 完成;Opus 5 约需 103 轮、20 亿 Token。这并不表明 Grok 整体更强,而是说明在该测试集中,Grok 使用了更少的步骤与输入 Token,而 Claude 在上述其他测试中居前。
Grok 4.6 定价
我会重点关注 200,000 Token 的提示阈值:一旦触发,整次请求的所有 Token 都按更高档计费。下表同时列出优先级与工具费用。
|
项目 |
费率 |
|
输入 Token(提示低于 200K) |
$2.00 / 百万 |
|
缓存输入(提示低于 200K) |
$0.50 / 百万 |
|
输出 Token(提示低于 200K) |
$6.00 / 百万 |
|
输入 / 缓存 / 输出(提示高于 200K) |
$4.00 / $1.00 / $12.00 |
|
快速或优先处理 |
标准费率的 2 倍 |
|
网页搜索、X 搜索、代码执行 |
每 1,000 次调用 $5 |
工具费用独立于 Token 费用。一次既搜索网页又运行代码的请求,可能在最终文本计费前同时产生两项工具费。目前没有单独的 grok-4.6-fast 模型名。直连 API 提供优先级选项,响应确认使用后按 2 倍计费。Cursor 提供独立的“Grok 4.6(Fast)”选项,费率同为 2 倍。

Cursor 中选择 Grok 4.6 Fast。图片来源:作者。
如何访问 Grok 4.6?
Grok 4.6 可通过以下一方渠道获取:
- SpaceXAI API
- Cursor
- Grok Build
- 第三方网关(OpenRouter、Vercel、Cloudflare、Google Cloud Vertex AI)
- 其他编码工具(GitHub Copilot、VS Code、JetBrains、Xcode、Eclipse)
发布覆盖 Pro、Pro+、Max、Business 与 Enterprise 套餐。Business 与 Enterprise 管理员需手动开启该模型(默认关闭)。Grok 4.6 不支持 SpaceXAI 的 Batch API,因此没有折扣批处理选项。
另有一项企业细节与模型可用性无关。响应默认是有状态的,SpaceXAI 称历史将保留 30 天。在 零数据保留(ZDR)下,团队无法使用存储的响应链或延迟补全;xAI 建议改用加密推理回放与 WebSocket Responses。每条响应都会包含一个标头,指示是否启用了 ZDR。
Grok 4.6 的发布周:模型、Copilot 与 Cursor
那一周让我注意到的是,围绕 Grok 4.6 的模型发布与分发合作来得非常密集。

超越基准测试的 Grok 4.6 发布周。图片来源:作者。
Grok Bot 在模型发布前定下基调。这款早期测试版云端代理随 SuperGrok Heavy($300/月)或 Cursor Ultra($200/月)捆绑提供,而非单售,将访问与高端套餐绑定。随后,Grok 4.6 将同样的代理聚焦带入了 API、Cursor 与 Grok Build。
谷歌的 Gemini 3.7 Flash 发布与 OpenAI 的 GPT-5.6 Sol Ultrafast 预览让这一周更为热闹。与此同时,Copilot 的推广与 Cursor 加入 SpaceX扩大了 Grok 的分发。Cursor 将过程追溯至当年早些时候与 SpaceXAI 的合作,并将此举定位为获取 SpaceX GPU 资源,而非模型分数。其博文称,这将帮助其以更低成本训练模型。
我对那一周的解读是:SpaceXAI 希望将 Grok 放进人们已在使用的工具里。Grok 4.5 与 Cursor 联合训练,而 Grok 4.6 几乎立即进入 Copilot。这让合作分发成为发布的一部分,而非事后补充。
何时应使用 Grok 4.6?
当 API 价格与长时代理任务比首字时延更重要时,Grok 4.6 很适合;若 Sol 在终端分数更高或 Sonnet 5 的更大上下文窗口更契合任务,则适配度较弱。
Grok 4.6 适用场景:
- API 价格是首要约束。其标价与单任务成本均低于 Sol、Opus 5 与 Fable 5
- 工作以长、多步骤的代理任务运行,其轮次效率(在 AA-Briefcase 上轮次与输入 Token 均少于 Opus 5)可带来回报
- 任务属于知识工作或法律推理,在这类基准行中其更占优
- 对首字时延不敏感。长时运行中,慢启动影响较小;但在交互式对话中会影响整体体验
以下情况或许有更佳替代:
- 终端密集型编码 → GPT-5.6 Sol(DeepSWE 与 Terminal-Bench 分数更高)
- 需要大上下文窗口 → Claude Sonnet 5(100 万上下文,无长提示加价)
- 需要最低时延的交互式使用 → Gemini 3.7 Flash
- 只按顶级智能购置 → Opus 5(63)或 Fable 5(62)位居指数前列
Grok 4.6 的最终看法
Grok 4.6 落在一个尴尬的中间地带。它的指数上升 5 分,标价仍低于 Sol 与 Opus 5,但启动更慢,且按测得任务计费高于 Grok 4.5。“同价、更好模型”忽略了一半事实。
我仍期待看到的是一个跨数小时的运行场景,期间代码库、工具与指令持续变化。Cursor 与 GitHub Copilot 现已提供这样的环境。若在其中纠错与失败率依然较低,那么代理训练的主张便有了超越固定测试的证据;否则,这 5 分的提升就仍只是 5 分。
对于基于 xAI API 构建的读者,我们的 Grok 4 API 教程涵盖 Python 客户端与请求流程。
Grok 4.6 常见问题
Grok 4.6 是否取代 Grok 4.5?
官方没有。SpaceXAI 尚未宣布 Grok 4.5 的退役日期,且它仍在 API 与 Cursor 中列出。目前没有强制迁移至 4.6。
我可以自托管 Grok 4.6 吗?
不能。如上所述,没有开源权重,也未公布参数量,因此没有可下载并在本地硬件运行的内容。所有接入路径(包括直连 API)都通过 SpaceXAI 的基础设施或转售伙伴。
GitHub Copilot 如何为 Grok 4.6 计费?
Copilot 按提供商标价将 Grok 4.6 的使用量折算为 GitHub AI Credits,1 美分等于 1 个积分。常规代码补全与下一次编辑建议不计 AI Credits。模型在聊天或代理任务中的使用遵循 Copilot 的使用规则。
Grok 4.6 在欧盟可用吗?
可以,但在美国处理。欧盟用户可以访问 Grok 4.6(共享的 Grok 4.5 基座已通过《欧盟 AI 法》并于 7 月向欧盟用户开放,4.6 在 Cursor 全欧上线),但不提供欧盟数据驻留。xAI 的模型页面仅列出 us-east-1 与 us-west-2,因此请求在美国运行。请在各界面(API 控制台、Cursor、网关)逐一确认后再依赖。
Grok 4.6 是否支持 Cursor 的美国数据驻留?
Grok 4.6 已在 Cursor 上线(有独立模型页),但仅美国数据驻留属于 Enterprise 功能,且只覆盖受支持模型并有部分排除。因此在依赖前,请先确认 4.6 位于 Cursor 当前的受支持模型列表中。