Anthropic 尚未发布 Opus 5 与 Sonnet 5 的直接对比基准。每篇发布说明都只将新模型与其前代以及 Opus 4.8 比较。因此,下面的数据只讲清了故事的一部分。其余部分与以往任何一次 Opus 与 Sonnet 的取舍相同:您到底需要多高的上限,以及愿意为此支付多少。
什么是 Claude Opus 5?
Opus 5 是 Anthropic 的顶级模型,发布于 2026 年 7 月 24 日,定价为每百万输入 Token 5 美元、每百万输出 Token 25 美元。Anthropic 称其在 Frontier-Bench 和 GDPval-AA 上达到最先进水平,并且以一半价格接近更大规模的 Fable 5。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。
其最大亮点是自我校验:自查结果、在没有数据馈送时构建测试框架、对错误指令提出异议而非一味服从。
什么是 Claude Sonnet 5?
Sonnet 5 是 Anthropic 的中端模型,发布于 2026 年 6 月 30 日。Anthropic 将其描述为至今“最具代理性”的 Sonnet,性能接近 Opus 4.8,价格更低。它是 Free 和 Pro 方案的默认模型,也可在 Max、Team、Enterprise 以及 API 中使用。
定价:截至 2026 年 8 月 31 日,每百万输入 Token 2 美元、每百万输出 Token 10 美元;之后标准价为 3/15 美元。
分层差异:更务实的理解
这部分在发布说明里不会直说,因为这是 Anthropic 产品线的一般规律,而非这一对模型的特例。
Opus 是“上限”模型
当出错代价高、任务需长时间自主运行且中途无人检查,或问题是真正新颖而非模型已见过成千上万次变体时,您就该选它。跨多文件的深度重构、含糊的研究问题、长时段的代理性执行且错误会累积——这些都是 Opus 的适用场景。您付费购买的是它在错误成为您问题之前就把它们揪出来的能力。
Sonnet 是“主力干将”
它的定位是足够快、足够便宜,能持续运行:聊天助手、大规模分类、您会每隔几步就审阅的迭代式编码、对时延敏感的应用。它的判断上限更低,但对大量真实工作来说,您很少会碰到这个上限。大多数团队的日常应以 Sonnet 为主,只有在确实需要时才调用 Opus。
具体到 Sonnet 5,Anthropic 明显试图把中端模型的上限比以往抬得更高——这便是“至今最具代理性的 Sonnet”以及其在部分任务上接近 Opus 4.8 的由来。读下面的基准数据时要带着这个背景:Sonnet 5 不只是便宜,而是更便宜且比早期 Sonnet 更接近 Opus 档位。
发布数据实际说明了什么
价格
这是最清晰、最不含糊的差异。Sonnet 5 在(至 8 月 31 日)2/10 美元或标准 3/15 美元,对比 Opus 5 的固定 5/25 美元——按定价窗口不同,Sonnet 5 的成本约为 Opus 5 的 40–60%。
对齐度
这是两篇发布说明唯一直接相互点名的地方。Anthropic 的自动审计发现,Opus 5 “比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵循 Claude 的宪章”——这是明确陈述的结果,不是推断。Opus 5 在该审计中得分 2.3,是其迄今最安全的分数。Sonnet 5 较其前代有改进(更低的幻觉倾向、更少逢迎、更能抵御提示注入劫持),但 Anthropic 也指出其失配行为率仍高于 Opus 4.8。
网络安全
两者都未进行刻意的网络安全训练,但最终表现并不相同。
Opus 5 在发现漏洞方面接近 Mythos 5,尽管在将其转化为利用上的能力稍显落后。Sonnet 5 则更靠后:Anthropic 明确表示 Sonnet 5 的网络安全能力“明显弱于 Opus 4.8 和 Mythos 5”,且在一次 Firefox 利用开发评测中,它从未产出完整可用的利用(成功率 0.0%,只是在部分尝试上略优于 Sonnet 4.6)。
若您的用例与网络安全沾边,这一差距确实存在,且明显偏向 Opus 5。
编码与知识型工作
两篇发布说明使用的基准集合不同,因此没有可以直接对齐的分数线。
Opus 5 在 Frontier-Bench v0.1 上较 Opus 4.8 提升逾一倍,并以一半成本在 CursorBench 3.2 上与 Fable 5 的差距缩小至 0.5% 以内。Sonnet 5 则被描述为在高投入设置下接近 Opus 4.8 于 BrowseComp 与 OSWorld-Verified 的表现。
结合前述分层逻辑来看:在 Anthropic 选取突出的具体任务上,Sonnet 5 靠得较近,但 Opus 5 的胜出更大也更广。对此应将其视为方向性信号,而非精确测量。
如何选择
在以下情况选择 Opus 5:
任务高风险、长时运行或真正新颖;涉及生命科学、化学,或复杂的多步骤代理性工作;需要当前最一致对齐的模型;任何与网络安全相关的范围都在内。
在以下情况选择 Sonnet 5:
需要高吞吐、对时延敏感,或任务定义明确到无需 Opus 的判断上限;您使用的是 Free 或 Pro,且它已为默认;每 Token 成本是主要约束。
两者皆非,若:
您需要在降低护栏的情况下开展网络安全相关工作。Opus 5 会自动回退至 Opus 4.8,而 Sonnet 5 则直接落后于 Opus 4.8。
结语
这里的决策要点,与任何一次 Opus 对 Sonnet 的选择本质相同:这个任务需要“上限”,还是只需要可规模化、稳定完成?Sonnet 5 把中端的上限推得比以往更高,这正是其发布的真正看点。但在 Anthropic 唯一将两者拉到同一把尺子上量化的指标——对齐审计中——Opus 5 领先,而网络安全的结论也指向同一方向。批量场景默认选 Sonnet 5;当任务无法承受错误答案时,伸手去拿 Opus 5。