跳至内容

Claude Opus 4.8 vs Gemini 3.5 Flash:基准与使用场景对比

在 MCP Atlas、SWE-bench Pro 和 GDPval 基准上比较 Claude Opus 4.8 与 Gemini 3.5 Flash,并结合价格与速度,帮助您为工作选择合适的模型。
更新 2026年6月9日  · 9分钟

用 AI 探索

在 ChatGPT 中打开在 Claude 中打开在 Perplexity 中打开

具身代理型(Agentic)工作流定义了 2026 年上半年,尤其是在编程领域:模型接收单次提示并将任务完成。如今的竞争同时在三个维度展开:能力、速度与价格。Anthropic 与 Google 的押注明显不同。

本文比较两款近期发布的模型:Google 在 I/O 上宣布的 Gemini 3.5 Flash,以及 Anthropic 于 5 月 28 日发布的 Claude Opus 4.8。它们并非同一档位:一个是快速低价的“驮马”,另一个是高端旗舰。正是这道鸿沟让对比有价值,因为它迫使我们思考:在什么情况下“硬实力”值得为之付费。

本文将从基准测试、成本与速度三个方面进行比较,并给出各自适用的工作类型。您也可以查看我们更深入的 Gemini 3.5 Flash 综述与 Claude Opus 4.8 专文。

要点速览

  • 总体而言,Opus 4.8 能力更强。它在 Artificial Analysis Intelligence Index(61.4)、GDPval-AA(1,890 Elo)和 Humanity's Last Exam 上领先。
  • Gemini 3.5 Flash 更便宜更快:百万 tokens 定价为 $1.50/$9,而 Opus 4.8 为 $5/$25;输出速度为每秒 192.2 个 token,而 Opus 为 66.8。
  • Gemini 3.5 Flash 支持多模态输入(视频、音频、PDF),而 Opus 4.8 仅支持文本与图像。
  • 当任务质量与幻觉风险带来真实成本时选 Opus 4.8;若是高吞吐、多模态、成本敏感的流水线,选 Gemini 3.5 Flash。

什么是 Claude Opus 4.8?

Claude Opus 4.8 是 Anthropic 的旗舰模型,也是 Opus 4.7 的继任者,面向复杂推理与长时程代理式编程。目前它以 61.4 分领跑 Artificial Analysis Intelligence Index。

它同样领跑 GDPval-AA 排行,这一榜单按不同行业的真实任务为模型打分;并在全新的 ITBench-AA 基准上领先,该基准测试代理如何基于事故快照诊断 Kubernetes 事故的根因。

核心特性与能力

重点规格:

  • 100 万 token 的上下文窗口,最高可输出 128K token
  • 自适应思考为唯一支持的思考模式
  • 努力程度参数现默认全局为高,包含 Claude Code

Opus 4.8 还新增了快速模式,目前为研究预览,输出 tokens 每秒可提升至最高 2.5 倍,定价为百万输入/输出 tokens $10/$50。尽管是标准 Opus 4.8 价格的两倍,但仅为 Opus 4.7 快速模式价格的三分之一。

Messages API 现支持在 messages 数组中接收 system 条目,因此您可在任务进行中更新 Claude 的指令,而无需重启会话。您可以在不破坏提示缓存的情况下推送权限、token 预算或环境上下文。

可缓存提示的最小长度也从 Opus 4.7 的 4,096 tokens 降至 1,024 tokens,较短提示现在也可缓存。

相较 Opus 4.7,按 Artificial Analysis 的数据,多项基准出现提升:

  • Terminal-Bench Hard:+6.6 分
  • τ²-Bench Telecom(技术支持场景模拟):+5.8 分
  • IFBench(精确指令遵循):+3.6 分

它也在 Humanity's Last Exam 上名列前茅,无工具得分 49.8%,启用工具为 57.9%。

优缺点

在代理式工作上,Opus 4.8 是本次对比中最强的选项。它在 Artificial Analysis Agentic Index(涵盖编程等任务)中位列第一。

代价是价格。定价沿用 Opus 4.7:百万输入/输出 tokens $5/$25,对于高吞吐工作而言不菲。采样控制依然不可用:temperaturetop_ptop_k 若设置将报错。

什么是 Gemini 3.5 Flash?

Gemini 3.5 Flash 是 Google 最新的模型,主打在接近前沿的质量下实现高速,我们在 Gemini 3.5 Flash 综述中已有覆盖。它在 Terminal-Bench 2.1 上得分 76.2%,在 GDPval-AA 上达到 1,656 Elo。

核心特性与能力

Flash 可接收文本、图像、视频、音频与 PDF 作为输入,并全面支持思考级别。核心功能集包括:

  • 约 100 万 token 的输入上下文(1,048,576 tokens),输出上限为 65,536 tokens
  • 批量 API 与提示缓存
  • 代码执行与函数调用
  • 搜索锚定与结构化输出

在基准上,它在 MCP Atlas(多工具代理协调)中达 83.6%,在 CharXiv Reasoning(多模态理解)中达 84.2%。在 Artificial Analysis Intelligence Index 上排名第 7,就 Flash 级别而言相当强;在 Agentic Index 上排名第 6,接近 Opus 4.7。

Gemini 3.5 Flash 还原生支持 Antigravity 多代理框架。本次发布对 Antigravity 的界面进行了重构,更接近 OpenAI Codex 与 Cursor 应用。

优缺点

Flash 的主打是“单位美元的智能”:在 Artificial Analysis Intelligence Index 上得分 55,而输入百万 tokens 定价 $1.50、输出 $9,以这个价格具备的能力相当罕见。

原生多模态输入也是卖点,涵盖视频与音频。其四级思考系统(minimal、low、medium、high)也比 Opus 4.8 的单一努力设置提供了更细的成本与性能控制。

但最亮眼的是代理工具使用。Flash 在 MCP Atlas 上拿下 83.6%,本次对比中多工具协调最佳,甚至领先 Opus 4.8 的 82.2%。Flash 级别模型在该基准上胜过 Anthropic 最新旗舰,这种跨档碾压并不常见。

需要注意两点:在 Intelligence Index 的跑分中,Flash 生成了 7,300 万 tokens,而平均为 3,500 万,因此它输出冗长,而冗长会增加输出计费。首 token 延迟为 18.88 秒,对该级别而言偏高,可比模型大致在 2 秒左右。

如需了解其与 OpenAI 旗舰的对比,请参阅我们的 Gemini 3.5 Flash vs. GPT-5.5 文章。

Claude Opus 4.8 vs Gemini 3.5 Flash:正面对比

进入分项之前,先给出一张速查表。

属性 Claude Opus 4.8 Gemini 3.5 Flash
发布日期 2026 年 5 月 28 日 2026 年 5 月 19 日
上下文窗口 100 万 tokens 100 万 tokens
最大片段输出 128K 65,536
Intelligence Index(AA) 61.4 55
GDPval-AA Elo 1,890 1,656
输出速度 66.8 tokens/sec 192.2 tokens/sec
输入模态 文本、图像 文本、图像、视频、音频、PDF
输入价格 $5 / 100 万 tokens $1.50 / 100 万 tokens
输出价格 $25 / 100 万 tokens $9 / 100 万 tokens
思考模式 仅自适应 Minimal / low / medium / high

代理与编程表现

Opus 4.8 的代理能力更强,但 Flash 的差距小于其档位所暗示。Opus 4.8 以 1,890 Elo 领先 GDPval-AA,Flash 为 1,656,因而更擅长知识型工作。

MCP Atlas 则出人意料。Flash 在这一多工具协调基准上得分 83.6%,小幅领先 Opus 4.8 的 82.2%。Flash 级别模型在代理工具使用上超越 Anthropic 最新旗舰,是本次对比中对 Flash 最有力的论据。

SWE-bench Pro 的结果相反。该基准测试模型解决真实软件工程工单的能力,Opus 4.8 得分 69.2%,仅次于 Anthropic 的内部 Mythos 预览。Flash 为 55.0%,落后于 Opus,幅度与档位差异相符,但本身也值得关注:它超过了 Gemini 3.1 Pro 的 54.2%,说明这代 Flash 已追上上一代的 Pro 档。

在 Terminal-Bench Hard 上,Opus 4.8 得分 58.3%,Flash 为 40.9%,因此在基于终端的软件工程、系统管理与数据处理任务上,Opus 更合适。当您需要并行执行多条编码回路、且速度与成本比顶级准确性更重要时,Flash 则更具优势。

推理与科学任务

在学术推理方面,Opus 4.8 显著领先。它在 Humanity's Last Exam 上以 57.9% 领先 Flash 的 40.25%,更适合数学、科学与人文类工作。

多模态输入支持

这一项 Flash 取胜。Opus 4.8 可读文本与图像;Flash 还可读视频、音频与 PDF。若您的流水线涉及这些格式,在二者之中只有 Flash 能处理。

速度与时延

Flash 的输出速度约为 Opus 的三倍。Artificial Analysis 测得其每秒输出 192.2 个 token,而 Opus 4.8 为 66.8。

成本与 token 效率

输出 tokens 的差距最明显:Opus 4.8 为每百万 $25,Flash 为 $9,Opus 约贵 2.8 倍。在高吞吐流水线上,这个差异会迅速放大。

上下文窗口与输出容量

两者输入均支持 100 万 tokens,差异在输出端。Opus 4.8 单次可写至 128K tokens,而 Flash 为 65,536,几乎翻倍。对于长代码合成、长文档生成或单次输出规模较大的代理回路,这一空间尤为重要。

您该选哪一个模型?

归根结底,取决于您是为能力买单还是为吞吐买单。我的划分如下。

在以下情况下选择 Claude Opus 4.8……

  • 任务完成质量有直接后果。其 1,890 的 GDPval-AA Elo 与在 AA-Omniscience 上低于 Google 与 OpenAI 模型的幻觉率,使其在高精度知识工作中更安全。
  • 您需要 128K 输出 tokens 的单次大规模生成,几乎是 Flash 65,536 的两倍。
  • 您已在 Anthropic 生态(Claude Code 或 API)中构建,切换成本高。
  • 您的代理回路运行足够长,以至于会话中途的 system 消息很重要;现在 Messages API 可在不中断提示缓存的情况下,于任务中途更新权限、token 预算或上下文。

在以下情况下选择 Gemini 3.5 Flash……

  • 您的流水线需要接入视频、音频或 PDF。
  • 您需要高输出量,$9 对比每百万 $25 会改变成本计算。
  • 您想要最强的多工具协调成绩,Flash 在 MCP Atlas 上以 83.6% 领先,甚至高于 Opus 4.8 的 82.2%。
  • 您基于 Google 基础设施(Antigravity 或 Vertex AI)构建,并希望单一供应商。
  • 需要细粒度成本控制,Flash 的四级思考优于 Opus 4.8 的单一努力设置。

Flash 与旗舰模型的下一步

本次 Flash 模型较以往 Flash 版本更昂贵,Google 因此招致批评。Flash 与 Opus 档位之间的能力差距仍然显著,这削弱了以接近旗舰的价格购买 Flash 模型的理由。 更有意思的赛道是,能在保持像 Cursor 的 Composer 2.5 那样低价的同时,真正擅长编码与代理工作的“小模型”。

Anthropic 的快速模式是在代理式编码上最值得关注的方向,但价格会拖累采用。以 $10/$50 的定价,对于运行长回路的开发者而言难以接受,能否被广泛使用取决于 Anthropic 是否会重新考虑这个数字。

Anthropic 一直聚焦编码,因此我不认为其会在短期内追随 Google 进入视频与音频输入领域。这为 Google 打开了一个窗口,但前提是它能推出在代理任务上胜过 Opus 的 Flash 或旗舰模型。目前尚未做到。

结语

如果任务质量与幻觉风险会带来真实成本,例如在金融或医疗领域,请选择 Opus 4.8。若您要优化吞吐、成本或多模态输入,Gemini 3.5 Flash 更合适。

我的看法是:二者并不真正争夺同一类工作。多数团队在用一句话描述工作负载后,就会知道自己站在哪一边。更难的问题在于,Google 是否能在不失去价格优势的情况下,缩小能力差距——而这正是让 Flash 值得使用的关键。Google 已在内部运行 Gemini 3.5 Pro,而相较 Flash,这一版本更有可能对 Opus 4.8 形成真正压力。

如果您想提升在自身工作流中让 AI 助手更可靠的技能,建议从我们的 AI-Assisted Coding for Developers 课程开始。若要用提示、链与代理构建 LLM 应用,我们的 Developing LLM Applications with LangChain 课程是稳妥的下一步。

Claude Opus 4.8 vs Gemini 3.5 Flash 常见问答

Claude Opus 4.8 是否整体优于 Gemini 3.5 Flash?

若看整体智能基准,答案是肯定的。Opus 4.8 在 Artificial Analysis Intelligence Index 上得分 61.4,而 Flash 为 55。但“更好”取决于使用场景。Flash 更快、更便宜,并支持 Opus 4.8 不支持的视频、音频与 PDF 输入。

Gemini 3.5 Flash 支持哪些输入格式?

Gemini 3.5 Flash 支持文本、图像、视频、音频与 PDF 输入。Claude Opus 4.8 仅支持文本与图像。

两款模型的定价如何比较?

Claude Opus 4.8 的价格为每百万输入 tokens $5、每百万输出 tokens $25。Gemini 3.5 Flash 为每百万输入 tokens $1.50、每百万输出 tokens $9。缓存命中价格为 Opus 4.8 的每百万 $0.50,Flash 为每百万 $0.15。

什么是 GDPval-AA?它与 Opus 4.8 和 Gemini 3.5 Flash 的关系为何重要?

GDPval-AA 是 Artificial Analysis 面向真实世界知识型任务的核心代理性能基准,以 Elo 计分。Opus 4.8 以 1,890 Elo 领先,Flash 为 1,656。与传统基准相比,它更适合评估模型在生产级代理场景中的表现。

哪款模型的输出窗口更大?

Claude Opus 4.8 支持 128K 的最大片段输出,约为 Gemini 3.5 Flash 的 65,536 的两倍。对于生成长文档、大型代码文件,或需要单次大规模输出的工作流,Opus 4.8 更合适。

Gemini 3.5 Flash 是否支持“思考”设置?

是的。Flash 具备四个思考级别:minimal、low、medium 与 high,默认是 medium。Claude Opus 4.8 仅使用自适应思考,不支持扩展思考预算。

主题

与 DataCamp 一起学习 AI!

Courses

Claude 模型入门

3小时
12.4K
学习如何通过 Anthropic API 使用 Claude,解决实际任务并构建 AI 驱动的应用。
查看详情Right Arrow
开始课程
查看更多Right Arrow