Tracks
SpaceXAI 于 2026 年 8 月 12 日发布了 Grok 4.6,早于此一个月,OpenAI 已在 7 月 9 日将 GPT-5.6 系列全面开放。两次发布的主张相近:能长时间运行、在多步任务中保持跟进的代理,以及更强的一稿质量用于交互式工作。Grok 4.6 宣称在人工分析智能指数(Artificial Analysis Intelligence Index)上与 GPT-5.6 Sol 打平,这等于把一个 6 美元的输出档位模型与一个 20 美元的并列放置,然后让您来分辨差异。
本文将从代理式编码、长周期知识工作、上下文处理、推理控制与价格方面比较 Grok 4.6 与 GPT-5.6 Sol,然后在同一个编码代理中对两者进行一次高难度构建任务。若需分别对每个模型的深入介绍,请参阅我们的 Grok 4.6 指南 与 GPT-5.6 Sol、Terra 与 Luna 指南。
要点速览
- 能力相近:两者在人工分析智能指数上均得分 61,并且在已公布的编码基准中各自领先约一半。
- 价格差异明显,且并非按固定倍数:Sol 的输入贵 2 倍,输出贵 3.3 倍。
- 两款模型对长提示均加收费用,且 Grok 的阈值更早到来:20 万个 token,而 Sol 为 27.2 万个。
- 在我们的实操构建测试中,两者都交付了正确、稳定的仿真。Sol 用了 3 回合;Grok 需要 14 回合。
- 当推理与生成占比高时选 Grok 4.6;当需要 1,050,000-token 窗口、偏重终端的工程任务或以最少回合获得成品时选 GPT-5.6 Sol。
什么是 Grok 4.6?
Grok 4.6 是 SpaceXAI 面向编码、代理式任务与知识工作的前沿模型,发布于 2026 年 8 月 12 日。它在 Grok 4.5 基础上强化对长时间运行代理以及更具雄心的交互式与视觉化工作,SpaceXAI 表示它能在多步中持续跟进复杂任务:如研究主题、跨代码库工作,或把想法变成可运行的应用。训练过程中新增了经策划的模型生成推理数据,并在内核优化、Web 开发与计算机辅助设计等方向进行代理式强化学习。
其独特之处在于定价立场。Grok 4.6 在人工分析智能指数上提升 5 分的同时,仍保持 Grok 4.5 的标价——每百万输入 token 2 美元、输出 6 美元。Artificial Analysis 指出,这在前沿模型中并不常见,因为能力提升通常伴随涨价。
要看模型的实际表现,我们的 Grok 4.6 API 教程 手把手演示如何构建一个可用工具的代理;我们的 Grok Build 教程 则在编码代理中构建一个机器学习项目,4.6 现已成为默认模型。我们还在 Grok Bot 文章 中介绍了 SpaceXAI 的代理队友。
什么是 GPT-5.6 Sol?
GPT-5.6 Sol 是 OpenAI GPT-5.6 家族的旗舰,自 2026 年 7 月 9 日起全面开放,同时发布的还有用于日常工作的 Terra 与注重成本效率的 Luna。OpenAI 将 Sol 的定位同样强调效率而非仅是原始能力:在编码、知识工作、网络安全与科学领域达到最先进结果,同时使用更少的 token。更强的计算机使用能力让它能检查与优化渲染结果,而非只生成其背后的代码。
两种新的能力档位登场。max 相比 xhigh 给模型更多时间进行推理与修订;ultra 默认并行协调四个代理,用更多 token 换取在更短墙钟时间内的更好分数。在 Terminal-Bench 2.1 上,Sol Ultra 达到 91.9%,而基础 Sol 为 88.8%。
想要上手该模型?我们的 Cursor 代理模式教程 使用 GPT-5.6 Sol 构建一个 REST API;我们的 ChatGPT Work 指南 则在 GPT-5.6 上跑通端到端数据科学流程。若要不同对照,我们也将其与 Anthropic 旗舰进行了对比:Claude Opus 5 vs GPT-5.6 Sol。
Grok 4.6 vs GPT-5.6 Sol:正面对比
简言之:两者能力同级、价格陌路。

两者在智能指数均为 61,编码基准各有胜负,而 Sol 的输出价格高出 3.3 倍。
| 特性 | Grok 4.6 | GPT-5.6 Sol |
|---|---|---|
| 发布日期 | 2026 年 8 月 12 日 | 2026 年 7 月 9 日 |
| AA 智能指数 | 61 | 61 |
| 每 100 万 token 的输入 / 输出 | $2 / $6 | $4 / $20 |
| 上下文窗口 | 500,000 tokens | 1,050,000 tokens |
| 长上下文阈值 | 200,000 tokens | 272,000 tokens |
| 超过该阈值后的费率 | $4 / $12 | 输入 2 倍,输出 1.5 倍 |
| 推理设置 | Low、Medium、High、XHigh | None 至 Max,外加 Ultra |
| API 模型 ID | grok-4.6 |
gpt-5.6-sol |
| 知识截止 | 2026 年 2 月 1 日 | 2026 年 2 月 16 日 |
编码与代理式工作流
Cursor 的表格中,Grok 4.6(high)对比 GPT-5.6 Sol(max)并未分出胜负。Grok 以 69.9% 领先 CursorBench v3.2(Sol 为 67.2%),在 GDPval-AA v2 上 Elo 为 1753(Sol 为 1728)。Sol 则拿下 DeepSWE v1.1,73% 对 65.9%,以及 Terminal-Bench v3.0,34.6% 对 26%。
| 基准 | Grok 4.6(high) | GPT-5.6 Sol(max) | 备注 |
|---|---|---|---|
| AA 智能指数 | 61 | 61 | 九项基准的综合;打平 |
| CursorBench v3.2 | 69.9% | 67.2% | Cursor 自有代理框架 |
| DeepSWE v1.1 | 65.9% | 73% | 真实代码库中的长周期工作 |
| Terminal-Bench v3.0 | 26% | 34.6% | 二者都不高;与 OpenAI 2.1 版本不同 |
| FrontierCode v1.1 Extended | 61.3% | 60.6% | 差异在噪声范围内 |
| APEX-Agents | 57.5% | 56.7% | 差异在噪声范围内 |
阅读这些差距时请保持谨慎:
- 努力档位不匹配:Grok 为 high,Sol 为 max。
- 第三方数据行取自各方最佳自报或公开数据,并非同一套框架。
- Cursor 表中的 Terminal-Bench v3.0 与 OpenAI 文章中的 2.1(Sol 为 88.8%)不是同一版本。
在 IDE 代理循环中,Grok 更强;在长周期仓库工作与命令行上,Sol 更强。
长周期的代理式知识工作
在 Artificial Analysis 的私有长周期知识工作套件 AA-Briefcase 上,Grok 4.6 以 1577 Elo 领先 Sol 的 1502。在法律任务评测 Harvey LAB 上,公开数据为 15.8% 对 2.5%,相差 6 倍;但两者的绝对分数都不高,应视作信号而非定论。
Grok 还在 Artificial Analysis 的工具使用套件的银行分支上取得 50.7%。其在 Terminal-Bench v2.1 上为 88.4%,与领先模型持平,但注意这是 v2.1,而非上表的 v3.0。
上下文窗口与长上下文工作
Sol 的窗口大约是 Grok 的两倍:1,050,000 tokens 对比 Grok 4.6 的 500,000,并有 128,000-token 的输出上限;SpaceXAI 未在文本中给出对应上限。超过 500K 后,Grok 并无等效方案。
两者均在到达上限前对长提示重定价,且 Grok 的阈值更早:
- Grok 4.6:超过 200,000 tokens 后,整次请求按输入与输出各 2 倍计费。
- GPT-5.6 Sol:超过 272,000 tokens 后,整次请求按输入 2 倍、输出 1.5 倍计费。
在 200,000 与 272,000 之间,输入费率相当(均为每百万 4 美元)。Grok 的输出仍更便宜,但幅度小于标称价所显示的差距。
推理力度控制
Sol 提供更多档位:none 至 max,外加 ultra,可并行运行四个代理。Grok 4.6 的默认为 low、medium、high,并提供 xhigh。将 Sol 降到 none 以做廉价分类调用很实用。Ultra 在 Terminal-Bench 2.1 上从 88.8% 提升到 91.9% 是真实收益,但这两个极端的输出计费都比 Grok 高 3.3 倍。
内建工具界面
Grok 4.6 提供函数调用、网页搜索、X 搜索与代码执行。GPT-5.6 Sol 另有文件搜索、图像生成、代码解释器、托管 Shell、应用补丁、电脑操作,以及 Responses API 上的工具搜索。
Sol 还具备程序化工具调用(Programmatic Tool Calling):模型会编写并运行一个小程序来协调工具、过滤中间结果,而不是将每个工具的响应都回传给模型。
定价:您实际要付多少钱
价格是最清晰的差异点,且形态并非简单倍数关系。
Token 费率对照
| 费率 | Grok 4.6 | GPT-5.6 Sol |
|---|---|---|
| 输入,每 100 万 tokens | $2.00 | $4.00 |
| 输出,每 100 万 tokens | $6.00 | $20.00 |
| 缓存输入读取,每 100 万 tokens | $0.50 | $0.40 |
| 长上下文阈值 | 200,000 提示 tokens | 272,000 输入 tokens |
| 超过阈值后 | 输入与输出均 2 倍 | 输入 2 倍、输出 1.5 倍 |
| 快速变体,输入 / 输出 | $4.00 / $12.00 | 不适用 |
Sol 的输入贵 2 倍、输出贵 3.3 倍,因此随着模型输出增多,差距会扩大。两者的推理 token 都按输出费率计费。缓存读取价格接近($0.50 vs $0.40),但 SpaceXAI 提醒:若在 Responses API 上未提供 prompt_cache_key,当服务器缓存冷时,您常会按完整输入计费。详情可参阅我们的 Grok 4.6 API 教程。
真实负载的成本
公式为(用量 ÷ 1,000,000)× 费率,再对输入与输出按标准费率分别求和。
| 工作负载 | Grok 4.6 | GPT-5.6 Sol | 差额 |
|---|---|---|---|
| 偏生成:100 万入 / 400 万出 | $26 | $84 | +$58(223%) |
| 检索,低于阈值:1000 万入 / 100 万出 | $26 | $60 | +$34(131%) |
| 检索,超过阈值:1000 万入 / 100 万出 | $52 | $110 | +$58(112%) |
偏生成的场景凸显了输出费率差距。两个检索场景的入/出总量相同(1000 万入 / 100 万出),仅区别于每次请求是否超过双方阈值,因此两行之间的差额即为附加费的影响。该行中,Grok 的账单从 $26 翻倍至 $52;Sol 从 $60 增至 $110。虽然绝对差额变大,但相对溢价从 131% 收窄至 112%。两家厂商均未公布针对同一工作负载的 token 统计,因此这些总额应理解为费率对比,而非实际账单。
Grok 4.6 与 GPT-5.6 Sol 的实测表现
我们在同一个编码代理中对两者进行了一次高难度构建任务。
测试内容
我们让两者都创建一个单文件物理仿真,因为两家都声称在交互式与视觉化工作中表现强劲。相同提示,逐字节一致,粘贴到一个空工作区中的全新对话。一次尝试,不重试,中途不干预。
Build a single-file HTML page (inline CSS and JS, canvas, no build step, no external libraries, no network) that simulates a few dozen balls of varying sizes bouncing inside a slowly rotating square container, under gravity. The balls should collide with each other and with the container walls, and lose a little energy on each collision so the system settles rather than gaining energy over time. The container keeps rotating throughout, so the balls should slosh and re-pile as it turns.
Ship it as one working file named index.html that starts animating on load. Do not ask me clarifying questions, make reasonable assumptions and note them briefly in a comment at the top of the file.
两者均在 2026 年 8 月 25 日于 Cursor 内运行:Grok 4.6 为高推理,GPT-5.6 Sol 亦为高推理。结果描述的是它们作为代理的表现,而非裸模型。两者的网络访问均被拒绝(遵循测试权限规则)。
Grok 4.6 的产出
Grok 交付了可运行的 index.html,通过可运行性检查:单文件、加载即动画、控制台无未捕获错误、30 秒后仍稳定运行。随着盒子旋转,边界约束有效,球与球之间的碰撞看起来可信,系统能量逐渐损失并最终收敛,而非随时间加速。
这花了 14 个助手回合,期间进行了多轮自我修正。它也请求使用浏览器检查自己的工作,但根据测试权限规则我们拒绝了。
GPT-5.6 Sol 的产出
Sol 同样通过了可运行性检查,并在物理正确性与稳定性上均得 5 分。其容器旋转比 Grok 更慢,使“晃动与再堆积”的效果更易观察,这是它在视觉质量上领先的唯一维度。
它用 3 个回合就达到了这一结果,整体速度明显快于 Grok。
结果
各维度分数为 1 到 5,通过观测每个仿真 30 秒并按预先设定的评分细则打分。
| 指标 | Grok 4.6(high) | GPT-5.6 Sol(high) |
|---|---|---|
| 回合数 | 14 | 3 |
| 可运行性 | 通过 | 通过 |
| 物理正确性 | 5 | 5 |
| 随时间的稳定性 | 5 | 5 |
| 视觉质量 | 4 | 5 |
| 总体 | 3.5 | 5 |
就产物而言,接近打平:两者物理都对、稳定性都好。差异在于努力程度。Sol 用 3 回合达到同样结果,而 Grok 用了 14 回合,这也是 Grok 总分降至 3.5 的原因。
但请注意:这是一项 n=1 的视觉构建测试,把它视为一个数据点而非基准,也不代表在大型代码库或长检索链中的表现。
何时选择 Grok 4.6 或 GPT-5.6 Sol
由于能力接近,决策主要取决于工作负载形态、上下文规模,以及您更在意回合数还是按 token 计费。若输出便宜到足以主导账单,选 Grok;若您需要更大的窗口或更少回合,选 Sol。

如果符合以下情况,请选择 Grok 4.6:
- 您的工作负载写得多。 每百万输出 token 6 美元,对比 Sol 的 20 美元;当月偏生成的用量账单为 $26 而非 $84,且推理 token 也按同样的输出费率计。
- 您的提示保持在 200,000 tokens 以下。 这是 Grok 的 $2 与 $6 费率完整适用的区间。
- 您的代理工作主要在 IDE 内进行。 Grok 在 CursorBench v3.2 上以 69.9% 领先,且是 Grok Build 的默认模型。
- 您更关注每 token 成本,而非回合数。
如果符合以下情况,请选择 GPT-5.6 Sol:
- 您需要超过 50 万 token 的上下文。 Sol 的 1,050,000-token 窗口是 Grok 4.6 所不具备的。
- 您的代理在真实仓库中进行长周期工作。 Sol 在 DeepSWE v1.1 上为 73%,对比 Grok 的 65.9%,是双方在编码上最显著的差距。
- 回合数比 token 价格更重要。 在我们的物理构建中,Sol 3 回合完成,Grok 需要 14 回合。
- 您希望更细的努力控制。 Sol 提供 none 到 max,并新增
ultra。
如何开始使用 Grok 4.6 与 GPT-5.6 Sol
若您已调用兼容 OpenAI 的端点,两者都是“一处字符串替换”。字符串分别为 grok-4.6 与 gpt-5.6-sol。OpenAI 也将 gpt-5.6 的别名路由到 Sol。
| 使用界面 | Grok 4.6 | GPT-5.6 Sol |
|---|---|---|
| 第一方 API | xAI API | OpenAI API |
| 消费级应用 | Grok 应用与 Grok.com | ChatGPT |
| 编码代理 | Grok Build(默认模型)、Cursor(所有套餐) | Codex、Cursor |
| 模型网关 | OpenRouter、Vercel、Cloudflare | OpenRouter、Vercel、Cloudflare |
| API 模型 ID | grok-4.6 |
gpt-5.6-sol |
在编码代理中使用 Grok 4.6 与 GPT-5.6 Sol
在 Cursor 中,两款模型都可在选择器中直接切换,我们也是据此进行构建测试。切换仅更改选择器,而非重写配置。
通过 API,替换就是一处字符串。xAI 提供兼容 OpenAI 的端点:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["XAI_API_KEY"],
base_url="https://api.x.ai/v1", # drop this line for gpt-5.6-sol
)
response = client.responses.create(
model="grok-4.6", # swap for "gpt-5.6-sol"
input="Find and fix the bug: function median(a){a.sort();return a[a.length/2]}",
)
print(response.output_text)
完整设置请参阅我们的 Grok 4.6 API 教程、Cursor 代理模式教程 与 Grok Build 教程。
总结
如果您的账单主要由输出与推理 token 构成,请使用 Grok 4.6。在智能指数打平且输出价格不到三分之一的情况下,这是最容易的选择。若您需要百万级窗口或长周期仓库工作,请使用 GPT-5.6 Sol,并接受溢价。在切换之前,请检查您的提示是否落在 Grok 的 200,000-token 附加费分界线两侧。
在我们的测试中,发布声明经受住了检验:两款模型都给出了不错的结果。不过,Sol 的速度显著快于 Grok,所需回合仅为 Grok 的约 20%,这显示出明显差距。若您希望在代理中亲自运用这些模型而非只阅读相关文章,推荐我们的 Software Development with Cursor 课程。
Grok 4.6 vs GPT-5.6 Sol 常见问答
Grok 4.6 比 GPT-5.6 Sol 更好吗?
两者并无绝对胜者。它们在人工分析智能指数上同为 61 分,并且在已公布的编码基准中各自领先约一半:Grok 4.6 拿下 CursorBench v3.2(69.9% vs 67.2%),而 GPT-5.6 Sol 拿下 DeepSWE v1.1(73% vs 65.9%)与 Terminal-Bench v3.0(34.6% vs 26%)。在我们自己的单文件物理构建测试中,两者都产出正确、稳定的仿真。差异在于努力程度:Sol 3 回合完成,Grok 用了 14 回合。
Grok 4.6 和 GPT-5.6 Sol 的费用是多少?
Grok 4.6 的价格为每 100 万输入 token 2 美元、每 100 万输出 token 6 美元。GPT-5.6 Sol 的输入为 4 美元、输出为 20 美元。缓存输入读取为 Grok $0.50、Sol $0.40。倍数并不统一:Sol 的输入贵 2 倍、输出贵 3.3 倍,因此随着模型输出增多,差距会扩大。两者也会对长提示重定价:Grok 自 200,000 tokens 起(输入 $4、输出 $12),Sol 自 272,000 输入 tokens 起(输入 2 倍、输出 1.5 倍),两者均对整次请求生效。
Grok 4.6 与 GPT-5.6 Sol 的 API 模型 ID 是什么?
字符串分别是 SpaceXAI 的 grok-4.6 与 OpenAI 的 gpt-5.6-sol。OpenAI 也将 gpt-5.6 的别名路由至 Sol。由于 xAI API 兼容 OpenAI,在两者之间切换只需替换一个字符串,并将基地址改为 https://api.x.ai/v1。
谁的上下文窗口更大:Grok 4.6 还是 GPT-5.6 Sol?
GPT-5.6 Sol 可容纳 1,050,000 tokens,而 Grok 4.6 为 500,000,并有 128,000-token 的输出上限;SpaceXAI 未公布文本输出上限。两款模型都会对长提示加价,且 Grok 的阈值更早(200,000)而 Sol 为 272,000。在这两个数字之间,Grok 已加价而 Sol 未加价,使两者输入费率在每百万 4 美元持平。
我该如何访问 Grok 4.6 与 GPT-5.6 Sol?
通过 xAI API 或 Grok Build 访问 Grok 4.6;通过 OpenAI API 或 Codex 访问 GPT‑5.6 Sol。两者也可通过 Cursor 与 OpenRouter,或 Vercel、Cloudflare 等 AI 网关使用。