Courses
到目前为止,2026 年可谓是 Agent 式 AI 的一年。模型的迭代催生了大量用于 Agent 工作的工具,从个人 AI 助手到编码代理不一而足。这个领域的主要玩家包括 Google 的 Gemini、OpenAI 的 GPT 系列,以及深受开发者青睐的 Anthropic 模型。
本文将对 Claude Opus 4.7 与 Gemini 3.1 Pro 进行对比,包括各类基准测试与价格。最后,我会给出一个选择标准,帮助您判断哪款模型更适合您的工作流。
什么是 Claude Opus 4.7?
正如我们在Opus 4.7 文章中所述,Claude Opus 4.7 是 Anthropic 最新的旗舰模型,是其前代Claude Opus 4.6的更新版。它专为复杂的 Agent 工作流和多步推理而设计,在 Agent 式编码、视觉推理与工具使用方面表现更佳。
Claude Opus 4.7 的主要特性与能力
Opus 4.7 的核心功能之一是任务预算,允许您为代理在每个任务中可消耗的代币数量设定财政约束。当代理自主运行时,这能通过迫使其优化并遵守预算来避免意外费用。
Claude Opus 4.7 具有 100 万代币的上下文窗口和 128K 的输出代币。这意味着它可以在保留完整任务上下文的同时执行长时间任务,尤其适合在大型代码库中进行探索。
该模型的视觉能力也有所提升,支持最高 3.75 兆像素的图像。因此,其在视觉推理方面较 Opus 4.6 更出色,非常适合从高分辨率图表中提取数据等任务。
Opus 4.7 还新增了 xhigh 推理强度,位于 high 与 max 之间,以在编码与 Agent 任务上提供最佳效果。您也可以使用 high 以稍低的思考强度。Anthropic 还在 Claude Code 中引入了 /ultrareview,用于对代码变更进行评审并捕捉缺陷。

可能会让部分人意外的是,自适应思考(Adaptive Thinking)现在默认不显示思考过程。您可以将 thinking.display 设置为 summarized 来恢复简要版推理内容。
在基准方面,Opus 4.7 的成绩为:
- SWE-bench Verified:87.6%
- 更难的 SWE-bench Pro 变体:64.3%
- OSWorld(衡量计算机自主使用):78%
- MCP Atlas(多工具工作流编排):77.3%
Claude Opus 4.7 发布时,以 57 分位居Artificial Analysis Intelligence Index 榜首。在以 GDPval-AA 衡量的真实 Agent 工作中也以 1,753 Elo 领先。其后,GPT-5.5 在这两项上都实现了反超。
学习如何构建一个 Streamlit 基准应用,测试 Opus 4.7 的自我批判记忆是否确实能在 high、xhigh 与 max 思考强度下提升编码表现,请参阅我们的Claude Opus 4.7 实战基准教程。
Claude Opus 4.7 的优缺点
Anthropic 的模型以编码能力著称,Opus 4.7 的基准也印证了这一点。不过,Opus 系列价格并不便宜,因此任务预算这一功能尤为实用,特别适合运行长时、Agent 式工作流的用户。
该模型还可通过多家云服务商获取,如 Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry,便于在现有供应商体系中集成。
Opus 4.7 还配备了新分词器,使得与上一代 Opus 的实际成本对比略显困难。不过,据 Artificial Analysis Intelligence 称,运行该指数时,Opus 4.7 的输出代币比 Opus 4.6 少约 35%。

了解 Anthropic 目前最佳的公开模型 Claude Opus 4.7 的能力,并通过我们的Claude Opus 4.7 API 教程构建一个可将图表转换为原始数据的数据科学工具。
什么是 Gemini 3.1 Pro?
Gemini 3.1 Pro 是 Google DeepMind 目前的旗舰推理模型,采用基于 Transformer 的专家混合架构。Gemini 3.1 Pro 发布时,以领先 Opus 4.6 四分的成绩登顶 Artificial Analysis Intelligence Index,如今与 Opus 4.7 并列,得分为 57。
如需进一步了解 Gemini 3.1 Pro,请查看我们的《使用 Gemini 3.1 Pro 构建》文章,介绍如何用 Gemini 3.1 Pro 搭建生产级应用。
Gemini 3.1 Pro 的主要特性与能力
不同于Gemini 3 Pro 的两档思考强度,Gemini 3.1 Pro 提供 3 档思考强度:low、medium 与 high。low 兼顾速度与代币优化,medium 取平衡,high 会产生更多思考代币、响应最慢,适合需要复杂推理的任务。
Gemini 3.1 Pro 也支持 100 万代币的输入上下文窗口,但输出窗口较小,约为 65K 代币。它支持多模态,涵盖音频、PDF、文本与图像。
来看基准。以下两个方面是 Gemini 3.1 Pro 的强项:
- 在 ARC-AGI-2 上以 77.1% 领跑。
- 在 MCP Atlas 上得分 73.9%,衡量多工具工作流的协调能力。

据 Artificial Analysis Intelligence 称,Gemini 3.1 Pro Preview 的代币利用效率较高,运行其指数时使用了约 5700 万代币,相比 Opus 4.6 更省。
在 Artificial Analysis 的编码指数上,Gemini 3.1 Pro 领先 Opus 4.7,但在Agent 指数上落后于后者。
Gemini 3.1 Pro 的优缺点
Gemini 3.1 Pro 的定价相当诱人,尤其适合需要大量代币的任务。Google 还提供批处理定价五折优惠,在不需要实时结果的情况下尤其合适。
不足之处在于,Gemini 3.1 Pro 的 65K 输出窗口仅为 Opus 4.7(128K)的一半。
Claude Opus 4.7 与 Gemini 3.1 Pro 正面比较
在分别展开各类目之前,先给出一份速查表。
|
Claude Opus 4.7 |
Gemini 3.1 Pro |
|
|
发布日期 |
2026 年 4 月 16 日 |
2026 年 2 月 19 日 |
|
上下文窗口 |
100 万代币 |
100 万代币 |
|
最大输出 |
128K 代币 |
65K 代币 |
|
SWE-bench Verified |
87.6% |
80.6% |
|
SWE-bench Pro |
64.3% |
54.2% |
|
ARC-AGI-2 |
75.8% |
77.1% |
|
GPQA Diamond |
94.2%(并列) |
94.3%(并列) |
|
MCP Atlas |
77.3% |
73.9% |
|
OSWorld |
78.0% |
暂无公开成绩 |
|
视觉 |
2576px / 3.75MP |
多模态(视频、音频、PDF) |
|
输入定价 |
$5/百万代币 |
$2/百万代币 |
|
输出定价 |
$25/百万代币 |
$12/百万代币 |
Agent 与计算机使用表现
Opus 4.7 在 Agent 工作方面非常强大,尤其在于它允许您控制代理可使用的代币数量。Gemini 3.1 Pro 暂无类似系统;您需要通过思考强度来控制代币用量。
Opus 4.7 在 OSWorld 计算机自主使用基准上取得 78% 的成绩,这与GPT 5.5 的 78.7% 不相上下,而 Gemini 3.1 Pro 暂无公开 OSWorld 成绩。在 MCP Atlas 上,Opus 4.7 以 77.3% 领先 Gemini 的 73.9%。这些数据使得 Opus 4.7 成为生产级 Agent 系统的理想选择。
编码基准
接下来看看在编程方面,尤其是测试真实 GitHub 问题的 SWE-bench Verified 上,哪款模型表现更好。
Opus 4.7 取得 87.6%,而 Gemini 3.1 Pro 为 80.6%。在更难的 SWE-bench Pro 上,Opus 4.7 为 64.3%,Gemini 为 54.2%(GPT 5.5 为 58.6%)。数据表明,Opus 4.7 目前是全球最强的编码模型。
在 Terminal-Bench 2.0(测试模型在终端中的编码能力)上,Opus 4.7 为 69.4%,Gemini Pro 为 68.5%,而新的 GPT 5.5 为 82.7%。该基准上 GPT-5.5 显著领先,而我们的两款模型基本打平。
推理与科学任务
在推理与科学任务上,哪款模型更好?我们来看看。我不会使用各家都能拿高分的 GPQA Diamond,而是参考 ARC-AGI-2,该项衡量的是流体智力,即模型解决未见过的抽象推理问题的能力。
Gemini 3.1 Pro 为 77.1%,Opus 4.7 为 75.8%,GPT 5.5 为 85.0%,因此该项上 GPT 5.5 明显领先,其次是 Gemini 3.1 Pro。
在“人类最后的考试”上(旨在衡量研究生水平的科学、数学与人文学科推理),无论是否使用工具,Opus 4.7 都领先于 Gemini 3.1 Pro:
- 无工具:Opus 4.7 以 46.9% 领先,其后是 Gemini 3.1 Pro(44.4%)与 GPT 5.5 Pro(43.1%)。
- 使用工具:GPT 5.5 Pro 以 57.2% 领先,其后是 Opus 4.7(54.7%)与 Gemini 3.1 Pro(51.4%)。
成本与代币效率
Opus 4.7 的价格为每百万输入代币 $5、每百万输出代币 $25;Gemini 3.1 Pro 的价格为每百万输入代币 $2、每百万输出代币 $12。Gemini 要便宜得多,加之 50% 的批处理定价折扣,对于需要大量代币的任务,性价比非常高。
还需指出的是,Opus 4.7 的新分词器让其与上一代 Opus 的成本对比变得略微困难。
上下文窗口与输出能力
两款模型均支持 100 万输入代币,能够在单次提示中吞吐整套代码库与长篇研究文档。
在输出代币方面,Opus 4.7 支持 128K,Gemini 3.1 Pro 支持 65,536。因此,对于需要产生更多输出代币的工作流,Opus 更有优势。

了解 Opus 4.7 与 GPT 5.4 的对比,请参阅我们的《Opus 4.7 vs. GPT-5.4》教程,其对两者在编码、Agent 工作流与长上下文任务方面进行了比较,并分析了相关基准。
Claude Opus 4.7 是否优于 Gemini 3.1 Pro?
这就引出了关键问题:两者之中,您该选哪一个?
如果满足以下情况,您应选择 Claude Opus 4.7……
- 您在构建 Agent 式编码流水线,而 SWE-bench Pro 上 10 个百分点的差距会直接转化为更少的线上失败运行。
- 您需要任务预算,让长时间的自主循环更可控且无需额外监控逻辑。
- 您的流水线会产生较长输出,而 128K 的输出上限十分关键,几乎是 Gemini 3.1 Pro 的两倍。
- 您希望在复杂 Agent 工作流中拿到 MCP Atlas 上最强的多工具编排成绩。
- 您已在 Anthropic 生态中(如 Claude Code、Amazon Bedrock 或 Claude API),迁移成本高于价格差异。
如果满足以下情况,您应选择 Gemini 3.1 Pro……
- 您的代币量使 2.5 倍的输入成本差异具有实质影响;以每月 5 亿代币计,差额为每月 $1,500。
- 您需要在单次 API 调用中原生接收视频、音频或 PDF 输入,而无需单独的预处理步骤。
- 您基于 Google 基础设施构建,并希望通过 Vertex AI 与单一供应商合作。
- 抽象视觉推理是您的主要用例。Opus 在 ARC-AGI-2 上以 75.8% 落后于 Gemini 的 77.1%。
结语
Claude Opus 4.7 与 Gemini 3.1 Pro 都是强大的模型。选择哪一个取决于您的预算与目标任务。Opus 在 Agent 任务上占优,但如果预算有限,Gemini 3.1 Pro 也是强有力的候选,尤其考虑到其更便宜的代币与五折批处理定价。
Anthropic 继续在最佳编码模型上保持领先,使其非常适合需要复杂推理与编程的 Agent 任务。相比之下,Google 以显著更低的价格提供前沿推理模型。 各大厂商(包括 OpenAI)之间的竞争,正在于谁能提供既擅长 Agent、又足够通用的最佳模型。
鉴于 Opus 系列价格不菲,引入任务预算是个好迹象。我不惊讶于其他厂商在后续版本中也会集成这一能力,这有助于让长时间运行的 Agent 任务成本更可预测。
如需进一步了解如何使用 AI 工具,建议查看我们的最佳免费 AI 工具指南。若要系统提升 AI 编码技能,欢迎学习我们的《面向开发者的 AI 辅助编码》课程,让 AI 助手在您的开发工作流中更可靠。
最后,您还可以通过我们的《使用 LangChain 开发 LLM 应用》课程,学习如何在 LangChain 中使用大语言模型、提示、链与代理来构建 AI 驱动的应用。
Claude Opus 4.7 与 Gemini 3.1 Pro 常见问题
Claude Opus 4.7 是否优于 Gemini 3.1 Pro?
取决于具体用例。Opus 4.7 在编码基准上领先(SWE-bench Verified 为 87.6% vs 80.6%)、Agent 工具使用(MCP Atlas 为 77.3% vs 73.9%)以及输出能力(128K vs 65K 代币)。
什么是 Claude Opus 4.7 中的任务预算?
任务预算是您为整个 Agent 循环设定的代币上限,覆盖思考、工具调用、工具返回与最终输出。Claude 会跟踪预算消耗,并据此调整其工作。
Gemini 3.1 Pro 与 Claude Opus 4.7 的价格对比如何?
Gemini 3.1 Pro 的价格为每百万输入代币 $2、每百万输出代币 $12。Claude Opus 4.7 为每百万输入代币 $5、每百万输出代币 $25,因此在输入端 Gemini 便宜 2.5 倍。Gemini 还提供五折的批处理 API,将异步任务的输入成本降至每百万代币 $1。
Claude Opus 4.7 与 Gemini 3.1 Pro 在 SWE-bench 基准上如何比较?
Gemini 3.1 Pro 在 SWE-bench Verified 上为 80.6%,SWE-bench Pro 为 54.2%。Claude Opus 4.7 在 SWE-bench Verified 上为 87.6%,SWE-bench Pro 为 64.3%。在 Pro 变体上 10 个百分点的差距,是两者在编码任务中最有意义的区别。
哪款模型的上下文窗口更长?
Claude Opus 4.7 与 Gemini 3.1 Pro 均支持 100 万代币的输入上下文窗口。输出方面,Opus 4.7 最高支持 128,000 代币,约为 Gemini 3.1 Pro 的 65,536 代币的两倍。如果您需要在一次生成中输出长文档或复杂的多文件代码,Opus 4.7 的输出上限更高。