Tracks
如果您要为整天运行的智能体选择中端模型,目前最明显的两个候选是 GPT-5.6 Terra 和 Claude Sonnet 5。两者都是各自厂商提供给免费用户的默认模型,都提供约 100 万 token 的上下文窗口,且输入 token 价格相差不到 1 美元。
本文将从编码与终端智能体、知识型工作、网络安全姿态、长上下文行为、API 控制面和定价等方面,对 GPT-5.6 Terra 与 Claude Sonnet 5 进行对比,帮助您选择更适合自己工作负载的模型。若需分别更深入了解各模型,请参见我们的 GPT-5.6 家族指南 与 Claude Sonnet 5 指南。
要点速览
- Terra 更适合以终端为驱动的编码智能体和工具密集的流水线,它的 token 效率特性在此类场景中能发挥实效。
- Sonnet 5 在长上下文与文档密集型任务中更从容,因为其费率在整个窗口内保持不变。
- 若您的智能体主要在 Shell 中运行、每轮调用很多工具,或您希望 8 月之后更便宜的输出 token,请选 GPT-5.6 Terra。
- 若您发送超大提示词、需要可预测的按 token 计费,或您刻意选择会拒绝利用性工作(exploit work)的模型,请选 Claude Sonnet 5。
什么是 GPT-5.6 Terra?
GPT-5.6 Terra 是 OpenAI GPT-5.6 家族的中间层级,于 2026 年 7 月 9 日与旗舰 Sol 和最便宜的 Luna 一同全面开放。OpenAI 将 Terra 定位为日常工作的均衡之选,并指出其大致对应于早期 GPT-5 家族的 mini 层级。它提供 1,050,000 token 的上下文窗口、128,000 token 的最大输出上限,以及 2026 年 2 月 16 日的知识截止。
让 Terra 不只是便宜的两个看点:它从 Responses API 继承了可编程工具调用(Programmatic Tool Calling),允许模型编写并运行小型内存程序来协调工具,而非每次都将工具响应往返模型处理。此外,OpenAI 于 2026 年 7 月 30 日将 Terra 的价格下调 20%,从发布时的 $2.50/$15 降至每 100 万 token $2.00/$12。
我们在GPT-5.6 Sol、Terra 与 Luna 指南中介绍了整个家族;若想了解旗舰层级的应用案例,我们关于GPT-5.6 Sol 协助否证麦克斯韦猜想的文章值得一读。另有旗舰级别的对比,请参见Claude Opus 5 vs GPT-5.6 Sol。
什么是 Claude Sonnet 5?
Claude Sonnet 5 是 Anthropic 的中端模型,于 2026 年 6 月 30 日发布,官方称其为迄今最具“智能体性”的 Sonnet。Anthropic 的说法是,它能进行规划、驱动浏览器与终端,并以此前需要 Opus 级别模型的自主性完成任务,在推理、工具使用、编码与知识工作方面接近 Opus 4.8 的水平,但价格更低。
它是 Free 与 Pro 方案的默认模型,并附带一组有意设计的限制:temperature、top_p 与 top_k 被移除,手动扩展思考会返回 400 错误,自适应思考默认开启。它还采用了新的分词器,相比 Sonnet 4.6,在相同文本上大约多产出 30% 的 token;Anthropic 通过截至 2026 年 8 月 31 日的首发定价进行抵消。
我们在Claude Sonnet 5 指南中解读了首发数据,并在Claude Opus 5 vs Claude Sonnet 5中将其与旗舰对比。
GPT-5.6 Terra vs Claude Sonnet 5:正面对比
在进入各项能力前,先看两者的总体形态。
| 特性 | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| 厂商与发布时间 | OpenAI,2026 年 7 月 9 日全面开放 | Anthropic,2026 年 6 月 30 日 |
| 定位 | 中端 | 中端 |
| 上下文窗口 | 1,050,000 个 token | 100 万个 token |
| 最大输出 | 128K 个 token | 128K 个 token |
| 每 100 万 token 价格 | $2.00 输入 / $12.00 输出 | $3.00 输入 / $15.00 输出(至 2026-08-31 为 $2.00/$10.00) |
| 长上下文附加费 | 输入超 272K token 后,输入 2 倍、输出 1.5 倍(作用于整个请求) | 未公布;至 100 万保持平价 |
| 标志性功能 | Responses API 中的可编程工具调用 | 可选力度的自适应思考 |
| 网络安全姿态 | 为网络安全训练;防御能力在 Trusted Access 后 | 未针对网络安全训练;默认开启安全防护 |
| 免费层 | ChatGPT Work 与 Codex 的 Free 与 Go 默认 | Free 与 Pro 的默认 |
| API 模型 ID | gpt-5.6-terra |
claude-sonnet-5 |
编码与终端智能体
通常,代码库内的编程更偏向 Anthropic,而终端工作更偏向 OpenAI。
这一分野仍然成立:在 Terminal-Bench 2.1 上,Terra 达到 87.4%,而 Sonnet 5(Anthropic 的发布材料)为 80.4%,命令行工作流上差距 7 个百分点。值得注意的是,在 OpenAI 的同一评测中,Terra 也领先 Claude Opus 4.8(78.9%)与 Claude Fable 5(83.1%)。
但目前,两款竞品的中端模型在仓库级编码方面旗鼓相当。SWE-Bench Pro(在真实仓库上进行多步修复)中,OpenAI 报告 Terra 为 63.4%,Anthropic 报告 Sonnet 5 为 63.2%。
| 基准 | GPT-5.6 Terra | Claude Sonnet 5 | 备注 |
|---|---|---|---|
| SWE-Bench Pro | 63.4% | 63.2% | 厂商各自报告;基本打平 |
| Terminal-Bench 2.1 | 87.4% | 80.4% | 厂商报告;Terra 在编码方面的最大已发布领先 |
| Artificial Analysis Coding Agent Index v1.1 | 77.4 | 未公布 | 独立指数;Terra 高于 Fable 5 的 77.2 |
Anthropic 自己的表述也支持这种分化。Sonnet 5 的编码故事更重在“执行到底”而非峰值分数:早期测试者称它会把 Sonnet 4.6 停下的任务完成,并且不经要求就检查自己的输出。
如果您的智能体长期待在 Shell 中,Terra 更有优势;若长期深入代码库推理故障,基准显示您在同级模型间做选择。

知识型工作与专业任务
两家都报告了 GDPval-AA v2(专业产出质量的 Elo 式量表),数值接近,难分伯仲。OpenAI 给 Terra 打分 1,593 Elo;Anthropic 给 Sonnet 5 打分 1618。OpenAI 在同评测中给 Claude Opus 4.8 打分 1600 Elo,Anthropic 给同一模型 1615,因此 Terra 与 Sonnet 5 之间 25 分的差距落在方法学噪音内。
Terra 在“Agents' Last Exam”(覆盖 55 个领域的长流程专业工作评测)上有一项未被回应的主张。Terra 得分 50.4%,高于 GPT-5.5(46.9%)、Claude Opus 4.8(45.2%)与 Claude Fable 5(40.5%)。Anthropic 未报告 Sonnet 5 在该评测的成绩,因此将其视为 OpenAI 的“主场”更合适,而非定论。
唯有计算机使用这一项,我建议您完全不要直接比较。OpenAI 报告 Terra 在 OSWorld 2.0 上为 50.2%,而 Anthropic 报告 Sonnet 5 在 OSWorld-Verified 上为 81.2%。二者是不同的数据集与评分方式,且 Anthropic 明确为此次发布调整了 OSWorld-Verified 的运行方式,把两个数字并列没有意义。
Terra 在该领域的实际优势是 token 核算。Notion 报告称,许多运行 GPT-5.5 的智能体在 Terra 上以一半成本、少用 16% 的 token 也能达到同等效果;Clio 报告称,可编程工具调用在多步文档分析中将提示 token 减少了 38%,且质量不变。这些是厂商与合作伙伴的说法,而非独立测量,但它们明确指出了变化点。
网络安全:两种相反的下注
这是对比中差距最大的部分,出于设计决策,而非能力偶然。
OpenAI 为 GPT-5.6 家族进行了网络安全训练:Terra 在夺旗(CTF)挑战中得分 91.8%,在 SEC-Bench Pro 得分 57.7%,在 ExploitBench 得分 52.9%,在 ExploitGym 得分 23.2%。其中两项超过了前旗舰 GPT-5.5(SEC-Bench Pro 45.8%、ExploitBench 47.9%)。
Anthropic 则走了相反方向。Sonnet 5 并未针对网络安全任务进行刻意训练,在与 Mozilla 合作、基于 Firefox 147 漏洞的利用开发评测中,它从未产出可用利用,得分 0.0%。Anthropic 为 Sonnet 5 默认启用实时网络安全防护,并建议在需要放松护栏的网络安全工作中使用 Opus 4.8。
对大多数读者而言,这更是 Sonnet 5 的“特性”而非弱点。如果您构建的产品里,模型尝试生成利用会带来风险,那么一个能稳定拒绝此类请求的模型更安全。若您从事防御性安全工作,Terra 位于 OpenAI 的 Daybreak Trusted Access for Cyber 项目之内,且个人成员需在 9 月 1 日前启用硬件绑定的通行密钥,才能继续访问网络安全能力最强的模型。
也需要提示 OpenAI 一侧的摩擦成本。OpenAI 表示,GPT-5.6 Sol 的网络安全防护会屏蔽大约比以往模型多 10 倍的潜在有害活动,并在 ChatGPT 与 Codex 中加入了“在较低能力模型上重试”的选项,正是因为良性请求也会被挡。Anthropic 一侧的 Reddit 讨论也有类似抱怨:Sonnet 5 会拦截良性的安全教学内容,说明两家都未完全解决“过度阻拦”。
上下文窗口与长上下文工作
名义上,两者相同:Terra 公布的 上下文窗口为 1,050,000 token,输出上限 128,000;Sonnet 5 为 100 万窗口、128K 输出上限。不同在于:当您真的把窗口填满,会发生什么。
Terra 公布了跨窗口的检索分数。在 OpenAI MRCR v2 的 8-needle 评测中,它在 256K-512K 区间得分 89.6%,在 512K-100 万区间为 72.5%,接近 Sol 的 91.5% 与 73.8%,且远高于 Luna 的 41.3%。这意味着在 512K 文档内,模型大约能在 9/10 的情形下找到隐藏细节,是进行知识提取的可靠助手。Anthropic 未在首发时公布 Sonnet 5 可比的“针”检索数据。
计费行为才是更重要的差异。Terra 对超过 272K 输入 token 的提示,整个请求按输入 2 倍、输出 1.5 倍计价,并非只对超出部分加价。Sonnet 5 未公布长上下文附加费,因此在整个窗口内保持标准费率。我会在定价一节给出具体数字,因为这会改变哪一方更便宜。
控制面:力度、思考与 API 约束
两者都提供“推理力度”调节,但在其余可控项上分歧明显。
Sonnet 5 完全移除了 temperature、top_p 与 top_k,调用这些参数会返回 400 错误。手动扩展思考同样返回 400;您只能使用默认开启的自适应思考,或完全关闭思考。
Sonnet 5 也不支持在 Anthropic 平台上的 Priority Tier,这会影响当下依赖其在 Opus 或 Sonnet 4.6 上提供时延保证的团队。Anthropic 提升了 Chat、Cowork、Claude Code 与 Claude 平台的速率限制,以吸收更高力度带来的更重 token 用量。
Terra 则在另一个方向上拥有更广的控制面。值得关注的特性:
-
Responses API 的可编程工具调用,在内存中运行协调程序,并与“零数据留存”兼容。
-
Responses API 的多智能体测试版,允许模型并发运行子智能体,并在一次请求中综合其成果。
-
max努力度,拥有 GPT-5.6 访问权限的任一用户均可在 ChatGPT Work 与 Codex 中切换。 -
显式缓存断点,最短缓存寿命 30 分钟,缓存读取九折计费,缓存写入为未缓存输入费率的 1.25 倍。
-
函数调用、结构化输出、托管 Shell、代码解释器与计算机使用均在 Responses API 上提供,但不支持微调。
需要注意的一点不对称:OpenAI 的 ultra 设置会并行协调四个智能体,但所有已发布的 ultra 基准都属于 Sol,而非 Terra。在有人发布 Terra Ultra 的数据之前,不要假定中端也能获得相同的多智能体增益。
定价:您实际要花多少钱
Terra 与 Sonnet 5 目前在输入价格上相差不到 1 美元,决定您账单的将是工作负载形态,而非标价。
token 费率并排
| 费率 | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| 输入,每 100 万 token | $2.00 | $3.00(至 2026-08-31 为 $2.00) |
| 输出,每 100 万 token | $12.00 | $15.00(至 2026-08-31 为 $10.00) |
| 长上下文附加费 | 输入超 272K 后,输入 2 倍、输出 1.5 倍(作用于整个请求) | 未公布;至 100 万保持平价 |
| 思考 token | 未另行公布费率 | 按输出 token 计费 |
| 免费层访问 | ChatGPT Work 与 Codex 的 Free 与 Go 默认 | Free 与 Pro 的默认 |
Terra 的 $2.00/$12.00 反映了 2026 年 7 月 30 日 OpenAI 的 20% 价格下调(发布时为 $2.50/$15.00)。Terra 的缓存输入读取为每 100 万 $0.20;Anthropic 支持 Sonnet 5 的提示缓存,但在发布材料中未单列 Sonnet 专属费率。
由于 Anthropic 按输出费率为思考 token 计费,将 Sonnet 5 运行在超高力度会直接放大您最昂贵的费用项。这是最容易冲破基于输入量预估的预算的方式。
真实工作负载要花多少钱
公式很简单:(体量 ÷ 100 万)× 费率,然后在输入与输出上求和。我在标准费率下计算了三种工作负载形态,分别隔离了两者真实差异的机制。
| 工作负载 | GPT-5.6 Terra | Claude Sonnet 5 | 差额 |
|---|---|---|---|
| 重生成:100 万入 / 400 万出 | $50 | $63 | Sonnet 5 多 $13(+26%) |
| 检索,低于阈值:1000 万入 / 100 万出,单次均低于 272K | $32 | $45 | Sonnet 5 多 $13(+41%) |
| 检索,高于阈值:1000 万入 / 100 万出,单次均高于 272K | $58 | $45 | Terra 多 $13(+29%) |
第三行是关键发现。第二行与第三行的总体体量不变,仅单次请求大小变化,而 Terra 的 272K 附加费将 41% 的成本优势转为 29% 的成本劣势。若您经常一次性塞入 30 万 token 的合同时长或仓库上下文,Terra 更低的标价会产生误导。
在 9 月之前购买时,“重生成”一行也会反转。按 Sonnet 5 的首发 $2.00/$10.00 费率,该工作负载花费 $42,对比 Terra 的 $50,Sonnet 5 便宜 $8,直到标准费率在 2026 年 9 月 1 日生效。Anthropic 设定该首发窗口,旨在让从 Sonnet 4.6 迁移基本成本持平,这一点在做预算前需要牢记。

为何同一任务成本不同
这些费率只有在两模型为同一任务消耗相同 token 数时才等于账单,而现实中往往不同。Terra 与 Sonnet 5 使用不同厂商的分词器,即使文本相同,在模型响应前的输入 token 计数也不同。
两家都未公布跨模型的 token 计数对比,因此我无法给出调整后的数值。目前仅有的前代说法,并不能直接说明 Terra 与 Sonnet 5 的关系:
- Anthropic 文档称 Sonnet 5 的新分词器相较 Sonnet 4.6 大约多出 30% 的 token;以及
- Notion 报告称 Terra 相较 GPT-5.5 少用 16% 的 token。
我的建议是,将上表视为费率比较而非费用预测,并在承诺前用具有代表性的样本测量您自身的 token 计数。Sonnet 5 的分词器变化尤其在发布时让团队措手不及,Simon Willison 的评测与云咨询公司都将其列为迁移中最大的意外。
何时选择 GPT-5.6 Terra 或 Claude Sonnet 5
以下是我预期大多数读者会遇到的场景与对应建议。
| 用例 | 推荐 | 理由 |
|---|---|---|
| 终端与 CLI 编码智能体 | GPT-5.6 Terra | Terminal-Bench 2.1 为 87.4%,对比 Sonnet 5 的 80.4%。 |
| 仓库级缺陷修复 | 皆可 | SWE-Bench Pro 的 63.4% vs 63.2% 打平;按价格与生态选。 |
| 超大上下文(30 万+ token) | Claude Sonnet 5 | 无长上下文附加费,而 Terra 超 272K 收 2 倍输入。 |
| 每轮多次工具调用的工具密集流水线 | GPT-5.6 Terra | Clio 的文档流程中,可编程工具调用将提示 token 降低 38%。 |
| 防御性安全与漏洞分流 | GPT-5.6 Terra | CTF 91.8%,可通过 Trusted Access for Cyber 访问。 |
| 将利用生成视为风险的产品 | Claude Sonnet 5 | 在 Firefox 利用开发评测中得分 0.0%,且默认开启网络安全防护。 |
| 2026 年 9 月前的重生成工作负载 | Claude Sonnet 5 | 首发 $2/$10 费率下,100 万入/400 万出月度比 Terra 便宜 $8。 |
| 需要自定义采样参数的工作负载 | GPT-5.6 Terra | Sonnet 5 会以 400 错误拒绝 temperature、top_p 与 top_k。 |
在这些情况下选择 GPT-5.6 Terra…
- 您的智能体常驻 Shell。Terminal-Bench 2.1 上 7 个点的差距,是两者间已发布的编码差异中最大的一项。
- 您每轮要调用很多工具。可编程工具调用将中间数据排除在模型上下文之外;PlayCo 报告在结构化场景构建中总 token 降低 63.5%、模型轮次减少 50.1%。
- 您从事防御性网络安全工作。Terra 在 SEC-Bench Pro 得分 57.7%,在 ExploitBench 得分 52.9%,与 Sonnet 5 的有意拒绝不在同一量级。
- 您需要更便宜的输出 token。2026 年 8 月之后,Sonnet 5 的输出为每 100 万 $15,对比 Terra 的 $12。
- 您希望有公开的长上下文检索指标,例如 MRCR v2 的 512K-100 万区间 72.5%。
在这些情况下选择 Claude Sonnet 5…
- 您的提示或文件上下文很大。至 100 万 token 的平价胜过 Terra 的 272K 悬崖,按 1000 万输入的月度,这会带来 29% 的差异。
- 您需要一个“按设计就会拒绝网络安全工作”的模型。Anthropic 自评认为,Sonnet 5 的网络安全能力显著弱于 Opus 4.8 与 Mythos 5,这对多数产品团队而言正是期望行为。
- 您已在 Claude 生态中。Sonnet 5 是 Free 与 Pro 的默认,并可在 Claude Code 中运行。
- 您更偏好“一个旋钮而非一排设置”。自适应思考加力度等级,比“力度 + max + ultra + 工具调用模式”的面更易把握。
若成本是硬约束,三种示例工作负载能最快帮您定位:重生成月 $50 对 $63;阈值以下检索 $32 对 $45;单次超 272K 输入后 $58 对 $45。
如何上手 GPT-5.6 Terra 与 Claude Sonnet 5
两款模型现已普遍可用,且都是各自厂商赠送给免费用户的默认模型,试用只需时间成本。
| 使用界面 | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| 消费者应用与层级 | ChatGPT Work:Free 与 Go 默认;Plus、Pro、Business、Enterprise 可选 | Claude 应用:Free 与 Pro 默认;Max、Team、Enterprise 可用 |
| 一方 API | OpenAI API,经 Responses 与 Chat Completions | Claude 平台上的 Claude API |
| 云平台 | Amazon Bedrock(GA)与 Microsoft Foundry(GA,含 APAC Data Zone);尚未在 Google Vertex 上线 | Claude Platform(AWS)与 Microsoft Foundry 上的 Claude;Google Vertex 标注为即将推出 |
| 编码智能体 | Codex:Free 与 Go 默认,Plus 及以上可选 | Claude Code |
| API 模型 ID | gpt-5.6-terra |
claude-sonnet-5 |
发起您的首个 API 调用
两者是不同的 SDK,不只是改个模型字符串。两段示例足够短,差异一目了然。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-terra", # swap for gpt-5.6-sol or gpt-5.6-luna
input="Refactor this pytest fixture to avoid module-level state.",
)
print(response.output_text)
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-sonnet-5", # no temperature/top_p/top_k on this model
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this pytest fixture to avoid module-level state."}],
)
print(message.content.text)
如果您在迁移既有的 Anthropic 代码,务必先移除 temperature、top_p、top_k 以及任何手动扩展思考配置,因为 Sonnet 5 会返回 400,而不是忽略它们。
关于 Anthropic 侧的完整设置流程,请参见我们的Claude API 完整指南。若要开始使用 GPT 侧,请从我们的Working with the OpenAI API 课程入手。
结语
一句话结论:Terra 更适合终端智能体与工具密集型流水线;Sonnet 5 更适合大提示与希望更小调参面的团队。
更有意思的是,两家都将中端作为免费默认,却在“中端模型该拒绝什么”上做了相反选择。OpenAI 为 Terra 训练了网络安全能力,并将最锋利的能力置于身份验证与硬件通行密钥之后;Anthropic 则让 Sonnet 5 根本不做这件事,还在其上层叠了防护。两种路径都没有显而易见的正确答案,也都为正当工作增添了真实的摩擦。
如果您想自己构建判断依据,而非阅读他人的基准表,我建议从我们的AI 基础技能路径开始。
常见问题
GPT-5.6 Terra 和 Claude Sonnet 5 哪个更适合编码?
取决于编码工作的类型。在 SWE-Bench Pro 上,两者在仓库级修复方面基本打平:Terra 为 63.4%,Sonnet 5 为 63.2%。但在终端与 CLI 工作流上,GPT-5.6 Terra 领先明显:Terminal-Bench 2.1 得分 87.4%,对比 Sonnet 5 的 80.4%。如果您的智能体在 Shell 中运行,选 Terra;若是通用代码库推理,两者皆可。
GPT-5.6 Terra 与 Claude Sonnet 5 的费用是多少?
GPT-5.6 Terra 的价格为每 100 万输入 token $2.00、每 100 万输出 token $12.00(2026 年 7 月 30 日下调 20% 后)。Claude Sonnet 5 的标准价为 $3.00/$15.00,首发定价 $2.00/$10.00 至 2026 年 8 月 31 日。Terra 对超过 272K 输入 token 的请求收取长上下文附加费(输入 2 倍、输出 1.5 倍,作用于整个请求),而 Sonnet 5 在 100 万 token 内维持平价。
GPT-5.6 Terra 与 Claude Sonnet 5 的上下文窗口是多少?
GPT-5.6 Terra 具有 1,050,000 token 的上下文窗口与 128,000 token 的输出上限。Claude Sonnet 5 具有 100 万 token 的上下文窗口与 128K 的输出上限。两者的窗口对大多数工作负载都已足够。
Claude Sonnet 5 能做网络安全工作吗?
Claude Sonnet 5 未针对网络安全任务进行刻意训练。在与 Mozilla 合作、基于 Firefox 147 漏洞的利用开发评测中,其得分为 0.0%。Anthropic 为其默认启用实时网络安全防护。对多数产品团队而言,这是一种特性而非弱点,因为能稳定拒绝利用生成的模型更安全。若您需要防御性网络安全能力,GPT-5.6 Terra 在 CTF 中得分 91.8%,在 SEC-Bench Pro 中得分 57.7%。
300K+ token 的大提示下,哪个模型更便宜?
尽管对大多数工作流而言 GPT-5.6 Terra 整体更便宜,但在超大提示上 Claude Sonnet 5 更便宜。GPT-5.6 Terra 当输入超过 272K token 时,会对整个请求加收 2 倍输入与 1.5 倍输出的长上下文附加费;Sonnet 5 未公布长上下文附加费,因此在 100 万 token 内维持标准费率。