跳至内容

GPT-5.6 Terra vs Claude Sonnet 5:基准测试、定价与使用建议

GPT-5.6 Terra 与 Claude Sonnet 5 是 OpenAI 与 Anthropic 的中端默认模型,输入价格相差不到 1 美元。本文比较其编码得分、长上下文定价等方面。
更新 2026年8月5日  · 15分钟

用 AI 探索

在 ChatGPT 中打开在 Claude 中打开在 Perplexity 中打开

如果您要为整天运行的智能体选择中端模型,目前最明显的两个候选是 GPT-5.6 Terra 和 Claude Sonnet 5。两者都是各自厂商提供给免费用户的默认模型,都提供约 100 万 token 的上下文窗口,且输入 token 价格相差不到 1 美元。

本文将从编码与终端智能体、知识型工作、网络安全姿态、长上下文行为、API 控制面和定价等方面,对 GPT-5.6 Terra 与 Claude Sonnet 5 进行对比,帮助您选择更适合自己工作负载的模型。若需分别更深入了解各模型,请参见我们的 GPT-5.6 家族指南Claude Sonnet 5 指南

要点速览

  • Terra 更适合以终端为驱动的编码智能体和工具密集的流水线,它的 token 效率特性在此类场景中能发挥实效。
  • Sonnet 5 在长上下文与文档密集型任务中更从容,因为其费率在整个窗口内保持不变。
  • 若您的智能体主要在 Shell 中运行、每轮调用很多工具,或您希望 8 月之后更便宜的输出 token,请选 GPT-5.6 Terra。
  • 若您发送超大提示词、需要可预测的按 token 计费,或您刻意选择会拒绝利用性工作(exploit work)的模型,请选 Claude Sonnet 5。

什么是 GPT-5.6 Terra?

GPT-5.6 Terra 是 OpenAI GPT-5.6 家族的中间层级,于 2026 年 7 月 9 日与旗舰 Sol 和最便宜的 Luna 一同全面开放。OpenAI 将 Terra 定位为日常工作的均衡之选,并指出其大致对应于早期 GPT-5 家族的 mini 层级。它提供 1,050,000 token 的上下文窗口、128,000 token 的最大输出上限,以及 2026 年 2 月 16 日的知识截止。

让 Terra 不只是便宜的两个看点:它从 Responses API 继承了可编程工具调用(Programmatic Tool Calling),允许模型编写并运行小型内存程序来协调工具,而非每次都将工具响应往返模型处理。此外,OpenAI 于 2026 年 7 月 30 日将 Terra 的价格下调 20%,从发布时的 $2.50/$15 降至每 100 万 token $2.00/$12。

我们在GPT-5.6 Sol、Terra 与 Luna 指南中介绍了整个家族;若想了解旗舰层级的应用案例,我们关于GPT-5.6 Sol 协助否证麦克斯韦猜想的文章值得一读。另有旗舰级别的对比,请参见Claude Opus 5 vs GPT-5.6 Sol

什么是 Claude Sonnet 5?

Claude Sonnet 5 是 Anthropic 的中端模型,于 2026 年 6 月 30 日发布,官方称其为迄今最具“智能体性”的 Sonnet。Anthropic 的说法是,它能进行规划、驱动浏览器与终端,并以此前需要 Opus 级别模型的自主性完成任务,在推理、工具使用、编码与知识工作方面接近 Opus 4.8 的水平,但价格更低。

它是 Free 与 Pro 方案的默认模型,并附带一组有意设计的限制:temperaturetop_ptop_k 被移除,手动扩展思考会返回 400 错误,自适应思考默认开启。它还采用了新的分词器,相比 Sonnet 4.6,在相同文本上大约多产出 30% 的 token;Anthropic 通过截至 2026 年 8 月 31 日的首发定价进行抵消。

我们在Claude Sonnet 5 指南中解读了首发数据,并在Claude Opus 5 vs Claude Sonnet 5中将其与旗舰对比。

GPT-5.6 Terra vs Claude Sonnet 5:正面对比

在进入各项能力前,先看两者的总体形态。

特性 GPT-5.6 Terra Claude Sonnet 5
厂商与发布时间 OpenAI,2026 年 7 月 9 日全面开放 Anthropic,2026 年 6 月 30 日
定位 中端 中端
上下文窗口 1,050,000 个 token 100 万个 token
最大输出 128K 个 token 128K 个 token
每 100 万 token 价格 $2.00 输入 / $12.00 输出 $3.00 输入 / $15.00 输出(至 2026-08-31 为 $2.00/$10.00)
长上下文附加费 输入超 272K token 后,输入 2 倍、输出 1.5 倍(作用于整个请求) 未公布;至 100 万保持平价
标志性功能 Responses API 中的可编程工具调用 可选力度的自适应思考
网络安全姿态 为网络安全训练;防御能力在 Trusted Access 后 未针对网络安全训练;默认开启安全防护
免费层 ChatGPT Work 与 Codex 的 Free 与 Go 默认 Free 与 Pro 的默认
API 模型 ID gpt-5.6-terra claude-sonnet-5

编码与终端智能体

通常,代码库内的编程更偏向 Anthropic,而终端工作更偏向 OpenAI。

这一分野仍然成立:在 Terminal-Bench 2.1 上,Terra 达到 87.4%,而 Sonnet 5(Anthropic 的发布材料)为 80.4%,命令行工作流上差距 7 个百分点。值得注意的是,在 OpenAI 的同一评测中,Terra 也领先 Claude Opus 4.8(78.9%)与 Claude Fable 5(83.1%)。

但目前,两款竞品的中端模型在仓库级编码方面旗鼓相当。SWE-Bench Pro(在真实仓库上进行多步修复)中,OpenAI 报告 Terra 为 63.4%,Anthropic 报告 Sonnet 5 为 63.2%。

基准 GPT-5.6 Terra Claude Sonnet 5 备注
SWE-Bench Pro 63.4% 63.2% 厂商各自报告;基本打平
Terminal-Bench 2.1 87.4% 80.4% 厂商报告;Terra 在编码方面的最大已发布领先
Artificial Analysis Coding Agent Index v1.1 77.4 未公布 独立指数;Terra 高于 Fable 5 的 77.2

Anthropic 自己的表述也支持这种分化。Sonnet 5 的编码故事更重在“执行到底”而非峰值分数:早期测试者称它会把 Sonnet 4.6 停下的任务完成,并且不经要求就检查自己的输出。

如果您的智能体长期待在 Shell 中,Terra 更有优势;若长期深入代码库推理故障,基准显示您在同级模型间做选择。

Terra 与 Sonnet 5 在仓库编码上打平,Terra 领先终端

知识型工作与专业任务

两家都报告了 GDPval-AA v2(专业产出质量的 Elo 式量表),数值接近,难分伯仲。OpenAI 给 Terra 打分 1,593 Elo;Anthropic 给 Sonnet 5 打分 1618。OpenAI 在同评测中给 Claude Opus 4.8 打分 1600 Elo,Anthropic 给同一模型 1615,因此 Terra 与 Sonnet 5 之间 25 分的差距落在方法学噪音内。

Terra 在“Agents' Last Exam”(覆盖 55 个领域的长流程专业工作评测)上有一项未被回应的主张。Terra 得分 50.4%,高于 GPT-5.5(46.9%)、Claude Opus 4.8(45.2%)与 Claude Fable 5(40.5%)。Anthropic 未报告 Sonnet 5 在该评测的成绩,因此将其视为 OpenAI 的“主场”更合适,而非定论。

唯有计算机使用这一项,我建议您完全不要直接比较。OpenAI 报告 Terra 在 OSWorld 2.0 上为 50.2%,而 Anthropic 报告 Sonnet 5 在 OSWorld-Verified 上为 81.2%。二者是不同的数据集与评分方式,且 Anthropic 明确为此次发布调整了 OSWorld-Verified 的运行方式,把两个数字并列没有意义。

Terra 在该领域的实际优势是 token 核算。Notion 报告称,许多运行 GPT-5.5 的智能体在 Terra 上以一半成本、少用 16% 的 token 也能达到同等效果;Clio 报告称,可编程工具调用在多步文档分析中将提示 token 减少了 38%,且质量不变。这些是厂商与合作伙伴的说法,而非独立测量,但它们明确指出了变化点。

网络安全:两种相反的下注

这是对比中差距最大的部分,出于设计决策,而非能力偶然。

OpenAI 为 GPT-5.6 家族进行了网络安全训练:Terra 在夺旗(CTF)挑战中得分 91.8%,在 SEC-Bench Pro 得分 57.7%,在 ExploitBench 得分 52.9%,在 ExploitGym 得分 23.2%。其中两项超过了前旗舰 GPT-5.5(SEC-Bench Pro 45.8%、ExploitBench 47.9%)。

Anthropic 则走了相反方向。Sonnet 5 并未针对网络安全任务进行刻意训练,在与 Mozilla 合作、基于 Firefox 147 漏洞的利用开发评测中,它从未产出可用利用,得分 0.0%。Anthropic 为 Sonnet 5 默认启用实时网络安全防护,并建议在需要放松护栏的网络安全工作中使用 Opus 4.8。

对大多数读者而言,这更是 Sonnet 5 的“特性”而非弱点。如果您构建的产品里,模型尝试生成利用会带来风险,那么一个能稳定拒绝此类请求的模型更安全。若您从事防御性安全工作,Terra 位于 OpenAI 的 Daybreak Trusted Access for Cyber 项目之内,且个人成员需在 9 月 1 日前启用硬件绑定的通行密钥,才能继续访问网络安全能力最强的模型。

也需要提示 OpenAI 一侧的摩擦成本。OpenAI 表示,GPT-5.6 Sol 的网络安全防护会屏蔽大约比以往模型多 10 倍的潜在有害活动,并在 ChatGPT 与 Codex 中加入了“在较低能力模型上重试”的选项,正是因为良性请求也会被挡。Anthropic 一侧的 Reddit 讨论也有类似抱怨:Sonnet 5 会拦截良性的安全教学内容,说明两家都未完全解决“过度阻拦”。

上下文窗口与长上下文工作

名义上,两者相同:Terra 公布的 上下文窗口为 1,050,000 token,输出上限 128,000;Sonnet 5 为 100 万窗口、128K 输出上限。不同在于:当您真的把窗口填满,会发生什么。

Terra 公布了跨窗口的检索分数。在 OpenAI MRCR v2 的 8-needle 评测中,它在 256K-512K 区间得分 89.6%,在 512K-100 万区间为 72.5%,接近 Sol 的 91.5% 与 73.8%,且远高于 Luna 的 41.3%。这意味着在 512K 文档内,模型大约能在 9/10 的情形下找到隐藏细节,是进行知识提取的可靠助手。Anthropic 未在首发时公布 Sonnet 5 可比的“针”检索数据。

计费行为才是更重要的差异。Terra 对超过 272K 输入 token 的提示,整个请求按输入 2 倍、输出 1.5 倍计价,并非只对超出部分加价。Sonnet 5 未公布长上下文附加费,因此在整个窗口内保持标准费率。我会在定价一节给出具体数字,因为这会改变哪一方更便宜。

控制面:力度、思考与 API 约束

两者都提供“推理力度”调节,但在其余可控项上分歧明显。

Sonnet 5 完全移除了 temperaturetop_ptop_k,调用这些参数会返回 400 错误。手动扩展思考同样返回 400;您只能使用默认开启的自适应思考,或完全关闭思考。

Sonnet 5 也不支持在 Anthropic 平台上的 Priority Tier,这会影响当下依赖其在 Opus 或 Sonnet 4.6 上提供时延保证的团队。Anthropic 提升了 Chat、CoworkClaude Code 与 Claude 平台的速率限制,以吸收更高力度带来的更重 token 用量。

Terra 则在另一个方向上拥有更广的控制面。值得关注的特性:

  • Responses API 的可编程工具调用,在内存中运行协调程序,并与“零数据留存”兼容。

  • Responses API 的多智能体测试版,允许模型并发运行子智能体,并在一次请求中综合其成果。

  • max 努力度,拥有 GPT-5.6 访问权限的任一用户均可在 ChatGPT WorkCodex 中切换。

  • 显式缓存断点,最短缓存寿命 30 分钟,缓存读取九折计费,缓存写入为未缓存输入费率的 1.25 倍。

  • 函数调用、结构化输出、托管 Shell、代码解释器与计算机使用均在 Responses API 上提供,但不支持微调。

需要注意的一点不对称:OpenAI 的 ultra 设置会并行协调四个智能体,但所有已发布的 ultra 基准都属于 Sol,而非 Terra。在有人发布 Terra Ultra 的数据之前,不要假定中端也能获得相同的多智能体增益。

定价:您实际要花多少钱

Terra 与 Sonnet 5 目前在输入价格上相差不到 1 美元,决定您账单的将是工作负载形态,而非标价。

token 费率并排

费率 GPT-5.6 Terra Claude Sonnet 5
输入,每 100 万 token $2.00 $3.00(至 2026-08-31 为 $2.00)
输出,每 100 万 token $12.00 $15.00(至 2026-08-31 为 $10.00)
长上下文附加费 输入超 272K 后,输入 2 倍、输出 1.5 倍(作用于整个请求) 未公布;至 100 万保持平价
思考 token 未另行公布费率 按输出 token 计费
免费层访问 ChatGPT Work 与 Codex 的 Free 与 Go 默认 Free 与 Pro 的默认

Terra 的 $2.00/$12.00 反映了 2026 年 7 月 30 日 OpenAI 的 20% 价格下调(发布时为 $2.50/$15.00)。Terra 的缓存输入读取为每 100 万 $0.20;Anthropic 支持 Sonnet 5 的提示缓存,但在发布材料中未单列 Sonnet 专属费率。

由于 Anthropic 按输出费率为思考 token 计费,将 Sonnet 5 运行在超高力度会直接放大您最昂贵的费用项。这是最容易冲破基于输入量预估的预算的方式。

真实工作负载要花多少钱

公式很简单:(体量 ÷ 100 万)× 费率,然后在输入与输出上求和。我在标准费率下计算了三种工作负载形态,分别隔离了两者真实差异的机制。

工作负载 GPT-5.6 Terra Claude Sonnet 5 差额
重生成:100 万入 / 400 万出 $50 $63 Sonnet 5 多 $13(+26%)
检索,低于阈值:1000 万入 / 100 万出,单次均低于 272K $32 $45 Sonnet 5 多 $13(+41%)
检索,高于阈值:1000 万入 / 100 万出,单次均高于 272K $58 $45 Terra 多 $13(+29%)

第三行是关键发现。第二行与第三行的总体体量不变,仅单次请求大小变化,而 Terra 的 272K 附加费将 41% 的成本优势转为 29% 的成本劣势。若您经常一次性塞入 30 万 token 的合同时长或仓库上下文,Terra 更低的标价会产生误导。

在 9 月之前购买时,“重生成”一行也会反转。按 Sonnet 5 的首发 $2.00/$10.00 费率,该工作负载花费 $42,对比 Terra 的 $50,Sonnet 5 便宜 $8,直到标准费率在 2026 年 9 月 1 日生效。Anthropic 设定该首发窗口,旨在让从 Sonnet 4.6 迁移基本成本持平,这一点在做预算前需要牢记。

272K 输入以下 Terra 更便宜;以上则 Sonnet 更划算

为何同一任务成本不同

这些费率只有在两模型为同一任务消耗相同 token 数时才等于账单,而现实中往往不同。Terra 与 Sonnet 5 使用不同厂商的分词器,即使文本相同,在模型响应前的输入 token 计数也不同。

两家都未公布跨模型的 token 计数对比,因此我无法给出调整后的数值。目前仅有的前代说法,并不能直接说明 Terra 与 Sonnet 5 的关系:

  • Anthropic 文档称 Sonnet 5 的新分词器相较 Sonnet 4.6 大约多出 30% 的 token;以及
  • Notion 报告称 Terra 相较 GPT-5.5 少用 16% 的 token。

我的建议是,将上表视为费率比较而非费用预测,并在承诺前用具有代表性的样本测量您自身的 token 计数。Sonnet 5 的分词器变化尤其在发布时让团队措手不及,Simon Willison 的评测与云咨询公司都将其列为迁移中最大的意外。

何时选择 GPT-5.6 Terra 或 Claude Sonnet 5

以下是我预期大多数读者会遇到的场景与对应建议。

用例 推荐 理由
终端与 CLI 编码智能体 GPT-5.6 Terra Terminal-Bench 2.1 为 87.4%,对比 Sonnet 5 的 80.4%。
仓库级缺陷修复 皆可 SWE-Bench Pro 的 63.4% vs 63.2% 打平;按价格与生态选。
超大上下文(30 万+ token) Claude Sonnet 5 无长上下文附加费,而 Terra 超 272K 收 2 倍输入。
每轮多次工具调用的工具密集流水线 GPT-5.6 Terra Clio 的文档流程中,可编程工具调用将提示 token 降低 38%。
防御性安全与漏洞分流 GPT-5.6 Terra CTF 91.8%,可通过 Trusted Access for Cyber 访问。
将利用生成视为风险的产品 Claude Sonnet 5 在 Firefox 利用开发评测中得分 0.0%,且默认开启网络安全防护。
2026 年 9 月前的重生成工作负载 Claude Sonnet 5 首发 $2/$10 费率下,100 万入/400 万出月度比 Terra 便宜 $8。
需要自定义采样参数的工作负载 GPT-5.6 Terra Sonnet 5 会以 400 错误拒绝 temperaturetop_ptop_k

在这些情况下选择 GPT-5.6 Terra…

  • 您的智能体常驻 Shell。Terminal-Bench 2.1 上 7 个点的差距,是两者间已发布的编码差异中最大的一项。
  • 您每轮要调用很多工具。可编程工具调用将中间数据排除在模型上下文之外;PlayCo 报告在结构化场景构建中总 token 降低 63.5%、模型轮次减少 50.1%。
  • 您从事防御性网络安全工作。Terra 在 SEC-Bench Pro 得分 57.7%,在 ExploitBench 得分 52.9%,与 Sonnet 5 的有意拒绝不在同一量级。
  • 您需要更便宜的输出 token。2026 年 8 月之后,Sonnet 5 的输出为每 100 万 $15,对比 Terra 的 $12。
  • 您希望有公开的长上下文检索指标,例如 MRCR v2 的 512K-100 万区间 72.5%。

在这些情况下选择 Claude Sonnet 5…

  • 您的提示或文件上下文很大。至 100 万 token 的平价胜过 Terra 的 272K 悬崖,按 1000 万输入的月度,这会带来 29% 的差异。
  • 您需要一个“按设计就会拒绝网络安全工作”的模型。Anthropic 自评认为,Sonnet 5 的网络安全能力显著弱于 Opus 4.8 与 Mythos 5,这对多数产品团队而言正是期望行为。
  • 您已在 Claude 生态中。Sonnet 5 是 Free 与 Pro 的默认,并可在 Claude Code 中运行。
  • 您更偏好“一个旋钮而非一排设置”。自适应思考加力度等级,比“力度 + max + ultra + 工具调用模式”的面更易把握。

若成本是硬约束,三种示例工作负载能最快帮您定位:重生成月 $50 对 $63;阈值以下检索 $32 对 $45;单次超 272K 输入后 $58 对 $45。

如何上手 GPT-5.6 Terra 与 Claude Sonnet 5

两款模型现已普遍可用,且都是各自厂商赠送给免费用户的默认模型,试用只需时间成本。

使用界面 GPT-5.6 Terra Claude Sonnet 5
消费者应用与层级 ChatGPT Work:Free 与 Go 默认;Plus、Pro、Business、Enterprise 可选 Claude 应用:Free 与 Pro 默认;Max、Team、Enterprise 可用
一方 API OpenAI API,经 Responses 与 Chat Completions Claude 平台上的 Claude API
云平台 Amazon Bedrock(GA)与 Microsoft Foundry(GA,含 APAC Data Zone);尚未在 Google Vertex 上线 Claude Platform(AWS)与 Microsoft Foundry 上的 Claude;Google Vertex 标注为即将推出
编码智能体 Codex:Free 与 Go 默认,Plus 及以上可选 Claude Code
API 模型 ID gpt-5.6-terra claude-sonnet-5

发起您的首个 API 调用

两者是不同的 SDK,不只是改个模型字符串。两段示例足够短,差异一目了然。

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-5.6-terra",  # swap for gpt-5.6-sol or gpt-5.6-luna
    input="Refactor this pytest fixture to avoid module-level state.",
)
print(response.output_text)
from anthropic import Anthropic

client = Anthropic()
message = client.messages.create(
    model="claude-sonnet-5",  # no temperature/top_p/top_k on this model
    max_tokens=1024,
    messages=[{"role": "user", "content": "Refactor this pytest fixture to avoid module-level state."}],
)
print(message.content.text)

如果您在迁移既有的 Anthropic 代码,务必先移除 temperaturetop_ptop_k 以及任何手动扩展思考配置,因为 Sonnet 5 会返回 400,而不是忽略它们。

关于 Anthropic 侧的完整设置流程,请参见我们的Claude API 完整指南。若要开始使用 GPT 侧,请从我们的Working with the OpenAI API 课程入手。

结语

一句话结论:Terra 更适合终端智能体与工具密集型流水线;Sonnet 5 更适合大提示与希望更小调参面的团队。

更有意思的是,两家都将中端作为免费默认,却在“中端模型该拒绝什么”上做了相反选择。OpenAI 为 Terra 训练了网络安全能力,并将最锋利的能力置于身份验证与硬件通行密钥之后;Anthropic 则让 Sonnet 5 根本不做这件事,还在其上层叠了防护。两种路径都没有显而易见的正确答案,也都为正当工作增添了真实的摩擦。

如果您想自己构建判断依据,而非阅读他人的基准表,我建议从我们的AI 基础技能路径开始。

常见问题

GPT-5.6 Terra 和 Claude Sonnet 5 哪个更适合编码?

取决于编码工作的类型。在 SWE-Bench Pro 上,两者在仓库级修复方面基本打平:Terra 为 63.4%,Sonnet 5 为 63.2%。但在终端与 CLI 工作流上,GPT-5.6 Terra 领先明显:Terminal-Bench 2.1 得分 87.4%,对比 Sonnet 5 的 80.4%。如果您的智能体在 Shell 中运行,选 Terra;若是通用代码库推理,两者皆可。

GPT-5.6 Terra 与 Claude Sonnet 5 的费用是多少?

GPT-5.6 Terra 的价格为每 100 万输入 token $2.00、每 100 万输出 token $12.00(2026 年 7 月 30 日下调 20% 后)。Claude Sonnet 5 的标准价为 $3.00/$15.00,首发定价 $2.00/$10.00 至 2026 年 8 月 31 日。Terra 对超过 272K 输入 token 的请求收取长上下文附加费(输入 2 倍、输出 1.5 倍,作用于整个请求),而 Sonnet 5 在 100 万 token 内维持平价。

GPT-5.6 Terra 与 Claude Sonnet 5 的上下文窗口是多少?

GPT-5.6 Terra 具有 1,050,000 token 的上下文窗口与 128,000 token 的输出上限。Claude Sonnet 5 具有 100 万 token 的上下文窗口与 128K 的输出上限。两者的窗口对大多数工作负载都已足够。

Claude Sonnet 5 能做网络安全工作吗?

Claude Sonnet 5 未针对网络安全任务进行刻意训练。在与 Mozilla 合作、基于 Firefox 147 漏洞的利用开发评测中,其得分为 0.0%。Anthropic 为其默认启用实时网络安全防护。对多数产品团队而言,这是一种特性而非弱点,因为能稳定拒绝利用生成的模型更安全。若您需要防御性网络安全能力,GPT-5.6 Terra 在 CTF 中得分 91.8%,在 SEC-Bench Pro 中得分 57.7%。

300K+ token 的大提示下,哪个模型更便宜?

尽管对大多数工作流而言 GPT-5.6 Terra 整体更便宜,但在超大提示上 Claude Sonnet 5 更便宜。GPT-5.6 Terra 当输入超过 272K token 时,会对整个请求加收 2 倍输入与 1.5 倍输出的长上下文附加费;Sonnet 5 未公布长上下文附加费,因此在 100 万 token 内维持标准费率。

主题

在 DataCamp 学习使用 Claude 与 GPT!

Tracks

AI 基础知识

10小时
探索 AI 基础,学习如何在工作中有效利用 AI,并深入了解 ChatGPT 等模型,以驾驭快速变化的 AI 领域。
查看详情Right Arrow
开始课程
查看更多Right Arrow