Anthropic 尚未发布 Opus 5 与 Sonnet 5 的直接对比基准。每篇发布文章都将各自模型与其前代以及 Opus 4.8 比较。因此,下面的数字只讲述了部分情况。其余部分仍是您在任何 Opus 与 Sonnet 组合之间都会做的判断:您实际需要多高的“上限”,以及您愿意为此支付多少。
什么是 Claude Opus 5?
Opus 5 是 Anthropic 的顶级模型,于 2026 年 7 月 24 日发布,定价为每百万输入 token 收费 5 美元、每百万输出 token 收费 25 美元。Anthropic 称其在 Frontier-Bench 和 GDPval-AA 上达到业内领先水准,并在价格减半的情况下接近更大的 Fable 5 模型。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。
其突出的特性是自我校验:检查自身输出、在没有数据源时构建测试框架、对不良指令提出异议而非盲从。
什么是 Claude Sonnet 5?
Sonnet 5 是 Anthropic 的中档模型,于 2026 年 6 月 30 日发布。Anthropic 将其描述为迄今为止最具代理性的 Sonnet,性能接近 Opus 4.8,但价格更低。它是 Free 和 Pro 方案的默认模型,并可用于 Max、Team、Enterprise 以及 API。
定价:截至 2026 年 8 月 31 日,每百万输入 token 收费 2 美元、每百万输出 token 收费 10 美元;随后恢复为标准价 3/15 美元。
分层差异的实际意义
这一点在发布文章里并未明说,因为这只是 Anthropic 模型序列的一般规律,并非此二者特有。
Opus 是“天花板”模型
当犯错代价高昂、任务需要长时间自主运行且中途无人复核,或问题确属全新而非模型曾见过的一千种变体之一时,您会选择它。跨多文件的深度重构、含糊的研究问题、长时间的代理性运行且错误会累积——这是 Opus 的用武之地。您付费的目的,是让模型在错误变成您问题之前先把它们揪出来。
Sonnet 是“主力干将”
它的构想是足够快、足够便宜,能持续运行:聊天助理、高吞吐量分类、迭代式编码(反正您每隔几步都会介入审查)、对时延敏感的应用。判断力的上限较低,但对大量真实工作而言,您很少会碰到这个上限。多数团队的日常使用应以 Sonnet 为主,对确实需要的任务再选择性调用 Opus。
就 Sonnet 5 而言,Anthropic 试图把中档模型的“天花板”推得比以往更高——这就是“迄今最具代理性的 Sonnet”以及“在部分任务上接近 Opus 4.8”这类表述的背景。阅读下方基准时要记住:Sonnet 5 不只是便宜,它比早期的 Sonnet 更接近 Opus 阶梯。
官方数据实际揭示了什么
价格
这是最清晰、最不含糊的差异。Sonnet 5 的费率为 2/10 美元(至 8 月 31 日)或标准 3/15 美元,对比 Opus 5 的固定 5/25 美元——按定价窗口不同,Sonnet 5 的成本约为 Opus 5 的 40–60%。
对齐度
这是两篇发布文章里唯一直接点名对比的地方。Anthropic 的自动化审计发现,Opus 5 “比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵循 Claude 的宪章”——这是明确陈述的结果,而非推断。Opus 5 在该审计中得分 2.3,是其迄今最安全的分数。Sonnet 5 相比其前代有所提升(更少幻觉、更少逢迎、对提示注入的劫持抵抗更好),但 Anthropic 也指出其失配行为率仍高于 Opus 4.8。
网络安全
两款模型都未进行有意的网络安全专项训练,但落点不同。
Opus 5 在漏洞发现方面接近 Mythos 5,尽管在将其转化为利用上略有落后。Sonnet 5 则更靠后:Anthropic 直言 Sonnet 5 的网络能力“明显弱于 Opus 4.8 和 Mythos 5”,并且在一次 Firefox 利用开发评估中,它从未产出完整可用的利用(成功率 0.0%,仅在部分尝试上略优于 Sonnet 4.6)。
如果您的场景与网络安全有任何关联,这个差距是实实在在的,而且明显偏向 Opus 5。
编码与知识型工作
两篇文章采用的基准集不同,因此没有干净的分数线可比。
Opus 5 在 Frontier-Bench v0.1 上较 Opus 4.8 提升超过一倍,并在 CursorBench 3.2 上以半价将与 Fable 5 的差距缩小到 0.5% 以内。Sonnet 5 则被描述为在高投入设置下,接近 Opus 4.8 于 BrowseComp 与 OSWorld-Verified 的表现。
结合前述分层逻辑解读:Sonnet 5 在 Anthropic 选择突出的具体任务上接近,但 Opus 5 的领先看起来更大且更广。对此应视为方向性信息,而非精确测量。
如何选择
在以下情况下选 Opus 5:
任务风险高、运行时间长或确属新问题;涉及生命科学、化学,或复杂多步的代理性工作;您需要当前对齐度最高的模型;任何与网络安全相关的内容都在范围内。
在以下情况下选 Sonnet 5:
量级大、时延关键,或任务边界清晰到无需 Opus 的判断上限;您使用的是 Free 或 Pro,且它已是默认;每 token 成本是最主要的约束。
两者皆否,若:
您需要在更少防护下进行网络安全相关工作。Opus 5 会自动回落到 Opus 4.8,而 Sonnet 5 则整体落后于 Opus 4.8。
结语
这里的决策核心,与任何 Opus 与 Sonnet 的选择类似:这个任务需要“天花板”,还是只需稳定规模化完成?Sonnet 5 把这块天花板推得比以往的 Sonnet 更高,这也是其发布的真正看点。但在 Anthropic 唯一将两者放在同一指标下给出数字之处——对齐度审计——Opus 5 领先,而网络安全方面的结论也指向同一方向。批量场景默认用 Sonnet 5;当任务经不起错误答案时,再选择 Opus 5。