Tracks
如果您在 2026 年下半年为具备代理能力的工作挑选模型,可选名单很短,而且这两个名字只相差两周发布。Anthropic 于 7 月 24 日推出 Claude Opus 5,OpenAI 则在 7 月 9 日将 GPT-5.6 Sol 推向全面可用。两者都定位旗舰级,主打长时间的专业任务,且价格几乎相同。
本文将从编码、推理、电脑操作、工具使用、定价与可用性等方面对比 Claude Opus 5 与 GPT-5.6 Sol,帮助您判断哪一个更契合您的工作流。若需分别深入了解各自模型,请参阅我们的 Claude Opus 5 指南 与 GPT-5.6 系列指南。
要点速览
- Opus 5 擅长新颖推理与代理任务;GPT-5.6 Sol 则是更强的终端与浏览通用型。
- 两者的输入 token 费用均为每百万 $5。输出方面,Opus 5 便宜 17%。
- 遇到真正新颖的问题、编码与电脑操作请选择 Opus 5。面向终端工作流、浏览代理与网络安全防御请选择 Sol。
什么是 Claude Opus 5?
Claude Opus 5 是 Anthropic 的 Opus 等级模型,于 2026 年 7 月 24 日发布,以半价提供与更高等级的 Fable 5 接近的效果。它是 Claude Max 的新默认模型,也是 Claude Pro 上可用的最强模型。
该模型的显著特征是坚持性。Anthropic 的表述是,Opus 5 会自我验证并迭代直至成功,而不是在“看似合理”时就停止;其报告的失配行为审计分为 2.3,是近期 Anthropic 模型中最低。上下文可达 100 万 tokens,输出上限 128K,且默认开启思考。
如果您想亲自上手而非只阅读介绍,我们的 Claude Opus 5 API 教程 演示了如何构建一个修复 bug 的代理,并在五个努力级别上进行基准测试。
什么是 GPT-5.6 Sol?
GPT-5.6 Sol 是 OpenAI GPT-5.6 系列的旗舰模型,该系列在有限预览后于 2026 年 7 月 9 日全面可用。该系列分为三个等级:
- Sol:旗舰模型,性能最高
- Terra:平衡的日常模型
- Luna:高性价比选项
OpenAI 称 Sol 在编码、知识型工作、网络安全与科学领域提供业界领先的结果,同时比其超越的模型消耗更少的 tokens。
Sol 的主打功能是 ultra,这是一种推理设置,默认在并行工作流中协调四个代理。OpenAI 还在 Responses API 中加入了程序化工具调用,让模型可以编写并运行小程序来编排工具与筛选中间数据,而不是把每次工具响应都再路由回模型。
关于系列结构与预览期注意事项,请参阅我们的 GPT-5.6 全面解读。我们也报道了 GPT-5.6 Pro 声称的 Dinitz-Garg-Goemans 猜想反例,这是迄今为止该系列最有趣的应用。
Claude Opus 5 vs GPT-5.6 Sol:正面交锋
在展开各维度对比前,先给出摘要。
| 特性 | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| 发布 | 2026 年 7 月 24 日 | 2026 年 7 月 9 日 |
| 输入,每百万 tokens | $5.00 | $5.00 |
| 输出,每百万 tokens | $25.00 | $30.00 |
| 上下文窗口 | 100 万 tokens | 100 万 tokens |
| 最大发电量 | 128K tokens | 128K tokens |
| 新颖推理(ARC-AGI-3) | 30.2% | 7.78% |
| 仓库级编码(SWE-Bench Pro) | 79.2% | 64.6% |
| 终端编码(Terminal-Bench 2.1) | 89.1% | 88.8%(配合 ultra 为 91.9%) |
| 长程编码(DeepSWE V1.1) | 68.8% | 72.7% |
| 电脑操作(OSWorld 2.0) | 70.6% | 62.6% |
| 浏览代理(BrowseComp) | 90.8% | 90.4%(配合 ultra 为 92.2%) |
| 标志性功能 | 自我验证与迭代 | ultra 并行代理模式 |
| 模型 ID | claude-opus-5 |
gpt-5.6-sol |
新颖推理与抽象问题
这是一处差异最显著的维度,因此我先谈它。ARC-AGI-3 要求模型解决其训练中未遇到的问题,使其成为最接近“推理而非回忆”的测试。
Opus 5 得分 30.2%。GPT-5.6 Sol 得分 7.78%,尽管它在榜单中排名第二。作个对比,Gemini 3.1 Pro 预览版仅有 0.42%。将 Opus 5 的成绩放在背景中看,Opus 4.8 在两个月前的得分是 1.5%,这意味着在同一代 Anthropic 模型中实现了二十倍的飞跃。
我想谨慎对待单一基准上 4 倍差距的含义。ARC-AGI-3 是刻意对记忆化不利的,而 30.2% 依然意味着大多数失败。但如果您的工作涉及在训练语料中找不到先例的问题,这是整个对比中最相关的数字,且差距悬殊。
编码与代理工程
编码方面并非一边倒,而是各有胜负。每家厂商都在其重点强调的基准上领先——这正是预期之中,也正是您需要继续读下去而非只看标题结论的原因。
| 基准 | Claude Opus 5 | GPT-5.6 Sol | 备注 |
|---|---|---|---|
| SWE-Bench Verified | 96.0% | 96.2% | 几乎持平;Fable 5 为 95.0% |
| SWE-Bench Pro | 79.2% | 64.6% | Claude Mythos 5 以 80.3% 领先 |
| DeepSWE v1.1 | 68.8% | 72.7% | Sol 领先 3.9 个百分点 |
| Terminal-Bench 2.1 | 89.1% | 88.8%(配合 ultra 为 91.9%) |
旗鼓相当,ultra 成为分水岭 |
| Frontier-Bench v0.1 | 43.3% | 37.5% | Opus 4.8 在两个月前仅为 18.7% |
| AA Coding Agent Index v1.1 | 未公布 | 80 | Fable 5 为 77.2,Opus 4.8 为 72.5 |
一旦将仓库工作与终端工作拆开,脉络就很清晰。Opus 5 在 SWE-Bench Pro 上领先近 15 分,并将 Opus 4.8 在 Frontier-Bench 上的成绩直接翻倍有余,该基准衡量代理式软件工程能力,如根据技术图纸在 FreeCAD 中重建某个零件。Anthropic 自己的例子很值得引用:在无法直接查看图纸的情况下,Opus 5 自行编写了计算机视觉流水线,从原始像素中提取几何信息;在五次尝试内,没有竞争模型能解出。
Sol 则拿下终端,但优势比以往版本更小。它与 Opus 5 在 Terminal-Bench 2.1 上打成平手,配合 ultra 则提升至 91.9%。Sol 还以 3.9 分优势拿下 DeepSWE v1.1(真实代码库上的长程工程测试),同时输出 token 少于 Fable 5 的一半,成本也低约三分之一。
我们实操中的一个补充:当我们用 Opus 5 构建修复 bug 的代理,并在五个努力级别上跑测试时,low 努力在三次运行中全部修复了 bug,而 max 努力有一次失败。该失败运行返回了一份架构上有效但内容空洞的报告,完全没有工具调用,根因字段被设为 "b0"。教训是:结构化输出只保证“有结构”,不保证“有内容”,且更高的努力不必然更好。详见我们的 Opus 5 API 教程。
我的看法:如果您的代理活在 shell 中,且负担得起 ultra,Sol 略占上风;如果代理主要在仓库内跨多文件进行架构推理,Opus 5 更合适。没有哪个模型能在“编码”这个大类上一锤定音,任何相反的厂商宣传都只是在挑基准说话。
电脑操作与浏览
如果您要构建能驱动 GUI 的任何东西,电脑操作就很重要,而这一点与编码一样,呈现分化。
Opus 5 在 OSWorld 2.0 上拿到 70.6%,Sol 为 62.6%,差距 8 个百分点。Anthropic 还称 Opus 5 以不到 Fable 5 三分之一的成本超越其在 OSWorld 上的最佳结果。考虑到 Fable 5 的输入每百万 token 收费 $10,而 Opus 5 为 $5,这样的对照更有意义。
浏览几乎打成平手。Opus 5 在 BrowseComp 上报告为 90.8%;Sol 为 90.4%,配合 ultra(16 个并行代理)则升至 92.2%。再次说明,ultra 在此处起到关键作用。
Sol 的 OSWorld 成绩还带来一个值得注意的 token 效率结论:OpenAI 称其在使用 85% 更少输出 tokens 的情况下超越了 Opus 4.8。这是与 Anthropic 上一代的对比,而非对 Opus 5,因此不能直接用于本次对阵,但它表明 Sol 的电脑操作路径在单任务成本上异常划算。
工具使用与自动化
工具使用是将抽象能力差距转化为“业务任务完成率”的维度,Opus 5 在此处领先明显。
在 Zapier 的 AutomationBench(衡量模型能否把一项业务任务从头到尾完成)上,Opus 5 得分 26.0%,Sol 为 18.1%。Anthropic 报告称其通过率约为同成本下次佳模型的 1.5 倍,且即使在最低努力设置下,Opus 5 也能通过比任何其他模型更多的任务。
Zapier CEO Wade Foster 描述的一个具体案例:Opus 5 处理了一份原始的账户健康工作簿,从头到尾执行了挽留流失的流程,标记高风险账户、通知正确负责人,并为留存运营生成摘要。此前模型均未通过;Opus 5 达到 100%。
Sol 的反击更多在架构层面而非分数。Responses API 中的程序化工具调用允许 Sol 编写小程序来协调工具、筛选中间结果,并在工作推进中选择下一步动作,从而使重工具任务以更少的模型往返推进。这确实是一种效率机制,但与“更高的正确完成率”是不同命题,而 AutomationBench 度量的是后者。
网络安全与科学
这是两家厂商刻意做相反选择的维度,对某些读者而言足以决定取舍。
Anthropic 未在网络攻防任务上训练 Opus 5。其明确表示 Opus 5 并未推动双重用途能力的前沿,且在生物研究与进攻性网络安全上均落后于 Mythos 5。在 OSS-Fuzz 上,Opus 5 识别漏洞的速率接近 Mythos 5,但在漏洞利用开发上大幅落后。Opus 5 的网络安全分类器会阻止基于二进制的漏洞扫描、渗透测试与利用生成,不过 Anthropic 预计其干预频率比 Fable 5 降低约 85%。
OpenAI 则走向另一端。Sol 被描述为 OpenAI 最强的网络安全模型,且数据显著:
- ExploitBench: 在可比的输出 token 预算下 73.5%,对比 GPT-5.5 的 47.9%
- ExploitGym: 两小时上限下 24.9%,六小时提升至 33.7%,对比 GPT-5.5 的 15.1% 峰值
- SEC-Bench Pro: 71.2%,对比 GPT-5.5 的 45.8%,且延迟更优
- 夺旗赛: 96.7%
两家都设置了访问门槛。OpenAI 通过 Daybreak 的 Trusted Access for Cyber 路由高级防御能力,要求在 9 月 1 日前使用硬件绑定的通行密钥以继续访问其网络安全能力最强的模型,并称 Sol 的网络安全护栏会比前代模型多阻断约十倍的潜在有害活动。Anthropic 则运行网络安全验证计划(Cyber Verification Program),为注册的企业与研究人员提供限制更少的 Opus 5 构建版本。
在科学方面,Opus 5 在 Anthropic 的生命科学评测上全面超越 Opus 4.8,最大提升出现在有机化学(在基于光谱数据推断分子结构上提升 10.2 个百分点)与蛋白质序列—功能预测(提升 7.7 个百分点)。Sol 则在 GeneBench Pro 上报告 28.7%,对比 GPT-5.5 的 12%,在 LifeSciBench 上为 59.9%。两者没有共享基准,因此这并非对比,而是各自“对不同试卷的自评”。
定价
在标准上下文下的输入与缓存读取价格完全一致,消除了一个变量。剩下的差别是 Sol 在输出上贵 20%,再加上仅由 Sol 收取的长上下文附加费。
Token 费率并列对照
| 费率 | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| 输入,每百万 tokens | $5.00 | $5.00 |
| 输出,每百万 tokens | $25.00 | $30.00 |
| 缓存输入读取,每百万 tokens | $0.50 | $0.50 |
| 缓存写入,每百万 tokens | $6.25 | $6.25 |
| 长上下文附加费 | 无(至 100 万为统一费率) | 输入 2× / 输出 1.5×(当输入超过 272K 后) |
| 快速模式 | 价格 2×,速度约 2.5× | 价格 2×,速度约 2.5× |
短上下文下的成本差全部落在生成端,因此 Sol 的溢价在冗长推理与长文本输出中最“疼”。在以检索为主、输入远多于输出的任务中,这一差距会缩小,直到 Sol 的长上下文附加费开始生效为止。
两款模型现在都提供快速模式,价格约为标准的两倍、速度约为 2.5 倍。OpenAI 于 2026 年 7 月 30 日将 Sol 旧的优先处理并入快速模式,因此这项杠杆在两者间对称,并非差异点。
真实工作负载的成本
“每百万 tokens 的费率”很难直接用于预算,且单一固定比值会掩盖此对比中最重要的因素:两者之间的差距完全取决于工作负载的形状。以下给出三种具有代表性的形状,按标准费率、无缓存与无批量折扣计算。
| 工作负载 | 假设量级 | Claude Opus 5 | GPT-5.6 Sol | Sol 相对 Opus |
|---|---|---|---|---|
| 重生成 | 25 万入 / 100 万出 | $26.25 | $31.25 | +19% |
| 检索,低于 272K | 25 万入 / 2.5 万出 | $1.88 | $2.00 | +7% |
| 检索,高于 272K | 50 万入 / 5 万出 | $3.75 | $7.25 | +93% |
在重生成任务中,20% 的输出溢价几乎会直接体现,Sol 约贵 19%。在短检索任务中,差距几乎收敛至约 7%,因为输出成本在相同输入费率面前只是“零头”。
第三行最值得关注。一旦请求超过 272K 个输入 tokens,Sol 的附加费会将整次请求按输入 2×、输出 1.5× 计费,而 Opus 5 在 100 万内维持统一费率,因此在规模上溢价不会缩小,反而几乎会让账单翻倍。对以检索为主或长上下文的工作而言,这种“逆转”比标题中的输出溢价更重要。
为何相同任务费用不同
除了标称费率外,还有两点会让看似相同的工作产生不同账单:
- Sol 的长上下文附加费。任何超过 272K 输入 tokens 的请求,整个请求都会按输入 2×、输出 1.5× 计费,因此一次超大提示就会把 Sol 推入一个 Opus 5 从未有的更高费档。这是费率切换,而非 token 差异,已体现在上面第三种工作负载中。
- Sol 的
ultra。Ultra 本身没有费率溢价,仍按 $5/$30 计费,但其多代理、高努力模式会让每个任务消耗更多 tokens,使代理型作业在相同费率下的成本约为基础版 Sol 的三倍。该倍数为经验估计,并非实测数据。
这一提醒也适用于输出端整体。流传的效率结论几乎都与其他模型对比:据称 Sol 在编码代理指数上的输出 tokens 少于 Fable 5 的一半,Anthropic 则报告 Opus 5 在最大推理下比 Opus 4.8 少生成 26% 的 tokens。这些都是“与前代”的对比,无法改变上述账单数字。
何时选择 Claude Opus 5 与 GPT-5.6 Sol
各维度结果与工作负载能较好映射,先给出选择指南,随后再分别展开。
| 使用场景 | 推荐 | 理由 |
|---|---|---|
| 缺乏训练先例的真正新颖问题 | Claude Opus 5 | ARC-AGI-3 为 30.2%,Sol 为 7.78% |
| 复杂的终端与命令行代理 | GPT-5.6 Sol | Terminal-Bench 2.1 为 88.8%,配合 ultra 为 91.9% |
| 仓库级重构与架构工作 | Claude Opus 5 | SWE-Bench Pro 为 79.2%,Sol 为 64.6% |
| 防御性网络安全与漏洞复现 | GPT-5.6 Sol | ExploitBench 为 73.5%;Opus 5 设计上会阻止漏洞利用生成 |
| 驱动 GUI 的电脑操作代理 | Claude Opus 5 | OSWorld 2.0 为 70.6%,Sol 为 62.6% |
| 大文档集上的长上下文检索 | Claude Opus 5 | 默认 100 万上下文且无附加费档 |
| 多云企业部署 | Claude Opus 5 | 可在 Bedrock、Vertex AI 与 Azure AI Foundry 上使用 |
在以下情况下选择 Claude Opus 5...
- 您的问题确实是新的。 ARC-AGI-3 的差距是本次对比中最大的单项结果,直接映射到科研与任何答案不在训练语料中的场景。
- 您需要能把任务“做完”的代理。AutomationBench 的领先,是“完成度而非单点能力”的最强信号。
- 您在长上下文中工作。默认与上限均为 100 万 tokens,且无附加费档,比 OpenAI 公布的任何 Sol 上下文处理数字更为清晰。
- 对齐性是明确要求。2.3 的失配行为审计分是 Anthropic 迄今最佳,欺骗率与被诱导误用的易感性均最低。
在以下情况下选择 GPT-5.6 Sol...
- 您在运行复杂、常驻 shell 的代理。Sol 的 ultra 模式将其推到顶端
- 您从事防御性安全工作。ExploitBench、ExploitGym 与 SEC-Bench Pro 的数字都很高,而 Opus 5 的分类器会主动阻止利用生成,因此不存在纠结空间。
- 您希望内置并行代理编排。
ultra默认协调四个代理,并在 BrowseComp 中以 16 个代理将成绩推至 92.2%,且 Responses API 中的多代理测试版也允许您自建类似范式。
结语
两者相隔两周发布,却押注相反:Opus 5 直追新颖推理与任务完成,Sol 则侧重终端、浏览与防御性安全,并对输出收取 20% 溢价。
如果您的问题确实新颖、您的代理需要“完成”而非“尝试”,或您在长上下文中工作且其统一的 100 万定价优于 Sol 的附加费,请选 Opus 5;如果您的代理常驻 shell、您要做 Opus 5 设计上会阻止的漏洞复现,或您负担得起 ultra 以登顶终端与浏览榜单,请选 Sol。
在多数其他维度上,差距并没有厂商营销所暗示的那么大,因此请将模型与您的主要工作负载相匹配,而非盯着“头牌基准”。
常见问题
Claude Opus 5 和 GPT-5.6 Sol 哪个更好?
两者并非全面胜出。Opus 5 在抽象推理与仓库级编码方面领先,而 GPT-5.6 Sol 在长程任务上更强,且在终端编码与成本上互有高低。正确选择取决于您的具体工作负载,而非总体排名。
哪个模型更便宜?
在三种测试的工作负载中,Opus 5 都更便宜,但差距不一:在 272K 上下文以下仅便宜 7%,重生成作业便宜 19%,而一旦输入超过 272K tokens,Sol 的费率跳档使其贵 93%。如果您很少触及大上下文,两者几乎持平。
哪个模型更适合编码?
取决于编码类型。在这些基准中,Opus 5 在仓库级任务上领先(SWE-Bench Pro,79.2% vs 64.6%),在终端编码上几乎打平(89.1% vs 88.8%),而 GPT-5.6 Sol 在长程编码上领先(72.7% vs 68.8%)。没有单一赢家,请根据您的工作是仓库范围的编辑、终端自动化,还是长多步任务来匹配模型。
我能在两者之间轻松切换吗?
部分容易。两者分别运行在不同 API 上、定价也不同,因此切换意味着新端点与一定的提示调整。成本是更大的“坑”:当输入超过 272K tokens 时,Sol 的价格大约是 Opus 5 的两倍,因此在一个模型上便宜的工作负载,换到另一个模型可能就会变贵。
基准分数能直接告诉我该用哪个模型吗?
部分能。推理差距很大(30.2% vs 7.78%),但两者在该项的绝对分都不高,因此未必影响日常使用。编码分数普遍较高且接近,因此实际任务测试比排行榜更重要。
