Google 在九月底的最后时刻宣布了 Gemini 4 Argon。Argon 是 Google 首款 Gemini 4 模型,也是新的前沿能力。它在 OpenAI 于九月初发布 GPT-6 Astra 四周后到来,后者是 OpenAI 的新旗舰。
Google 的发布表格显示,Argon 在大多数项目上领先 Astra,且价格只是 Astra 的一小部分。但有个比任何基准都更要紧的问题:Argon 还未普遍开放。Google 正先向经过审查的网络安全团队推出,尚未给出面向开发者或消费者的日期。
要点速览
- 在 Google 自家的基准表中,Gemini 4 Argon 在大多数项目上胜过 GPT-6 Astra,优势主要体现在法律、金融与业务流程任务。
- 在最难的软件工程、科学终端操作和电脑使用方面,GPT-6 Astra 仍占上风。
- Argon 的起步价是 Astra 的五分之一,即便按标准价计算也不到其一半。
- 但您现在还无法使用 Argon:访问权限仅限于 Google 信任的网络防御者,其次才是付费 API 客户和 AI Ultra 订阅用户。
- 因此,如果您需要今天就能用于生产的前沿模型,请选择 GPT-6 Astra。
什么是 Gemini 4 Argon?
Gemini 4 Argon 是 Google DeepMind 在九月底宣布的全新前沿模型,也是 Gemini 4 代中的首款模型。
Google 打造 Argon 旨在支撑对长链路、多步骤工作的深度推理。为此,它将输出上限提升到 100 万 tokens,使模型能在一次推理中走通难题。
什么是 GPT-6 Astra?
GPT-6 Astra 是 OpenAI 于九月初发布的旗舰模型,位于 GPT-6 系列之巅,高于 GPT-6.1 Sol 和 GPT-6 Luna。
OpenAI 将其定位为应对最严苛工作的最强模型,覆盖复杂推理、编码、电脑使用和科研。
Gemini 4 Argon vs GPT-6 Astra:正面比较
在 Google 的发布表格所列的 19 项基准中,Argon 有 14 项高于 Astra,Astra 赢下 4 项,另有 1 项打平。所有数据都来自 Google 自家的表格,因此更像是 Google 为 Argon 做的论证,而非独立排名。下表是我从中挑选的一些更知名、有趣且与此次发布更相关的测试。
| 项目 | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68.9% | 63.1% |
| AutomationBench | 51.3% | 41.4% |
| Vals Finance Agent v2 | 65.4% | 53.5% |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% |
| DeepSWE v1.1 | 77.9% | 74.1% |
| FrontierSWE v2 | 55.0% | 65.5% |
| Terminal-bench 4.0 | 57.4% | 58.2% |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% |
| OSWorld-2.0(离线子集) | 69.2% | 72.6% |
| 最大输出 tokens | 1M | 128K |
| 可用性 | 仅限受信任的网络防御者 | 普遍可用 |
下文各维度承接上表的其余信息。
知识型工作:法律、金融与业务流程
这是 Argon 领先最明显之处,也是 Google 此次发布的主打方向。
在用于测试法律检索与撰写的 Harvey's Legal Agent Benchmark 上,Argon 得分 19.6%,而 Astra 为 5.4%。虽然两者分数都不高,但完成任务数量多出三倍多,是整张表中相对差距最大的项目。
这一走势在金融研究与业务自动化上同样成立,Argon 领先约 10 至 12 个百分点。如果这些结果在实际使用中站得住脚,Argon 会是处理文档密集型法律与金融工作的更强模型。
编码与软件工程
编码方面各有胜负,取决于您所指的工程类型。
Argon 在 DeepSWE v1.1(测试真实代码库中的长周期任务)上领先,并在 Vibe Code Bench(评估构建可运行应用)上小幅压过 Astra。

Astra 在 FrontierSWE v2 上明显领先,双方在 Terminal-bench 4.0 上相差不到 1 个百分点。
Google 自身的示例偏向大型迁移,包括将 Google 代码库中的 C 与 C++ 迁移至 Rust。
不过,在表中最难的工程基准上,Astra 仍然领先。
长上下文与视觉理解
随着输入变长,Argon 的优势逐步拉开。
在 GraphWalks(测试跨长上下文的图结构推理)上,两者在 128K tokens 以内较为接近,但在 256K 到 1M tokens 区间,Argon 得分更高。
在长视频理解的 LVBench 上,Argon 也领先,而图表阅读(Chartography)方面几乎打成平手。
对需要向模型输入整份合同、代码库或录音的人来说,这是除可用性之外最实际的差异。
科学、数学与电脑使用
Astra 在科学终端操作上守住优势,在 Terminal-Bench Science 0.1 上领先 10 分以上。Argon 领先于生物研究基准 LABBench 2 和数学基准 RiemannBench。在电脑使用方面,Astra 领先 OSWorld-2.0,而 Argon 领先 Agent's Last Exam,因此这一类目并无绝对胜者。
可用性与安全性
Astra 是您今天就能部署的那一个。Argon 目前仅向 Google 的 Fairwind 计划(受信任的网络防御者)及内部团队开放。Google 表示下一步将向付费 API 客户与 Google AI Ultra 订阅用户开放,但未给出日期。
Argon 的网络安全故事也有两面。Google 将其在无网络安全护栏的情况下提供给经过审查的防御者;同时,它在测试修复真实安全漏洞的 CWE-bench v1 上与 Astra 并列第一。
对其他用户而言,Google 表示 Argon 将拒绝有害的网络与 CBRN 请求,并运行监控器,可在模型超出用户意图时停止执行。
定价:您实际要付多少钱
按起步价计算,Argon 的成本是 Astra 的五分之一;按标准价计算也不到其一半,但 Google 尚未说明起步价持续多久。
Token 费率对比
| 费率 | Gemini 4 Argon(起步) | Gemini 4 Argon(标准) | GPT-6 Astra |
|---|---|---|---|
| 输入,每 100 万 tokens | $2.00 | $4.00 | $10.00 |
| 输出,每 100 万 tokens | $10.00 | $20.00 | $50.00 |
| 缓存输入读取,每 100 万 tokens | $0.10(较输入优惠 95%) | 未公布 | $1.00 |
| 长上下文附加费 | 未公布 | 未公布 | 超过 272K 个输入 tokens:整次请求输入与缓存 2 倍、输出 1.5 倍 |
输入与输出的倍数一致:按起步价为 Astra 的 0.2 倍,按标准价为 0.4 倍。两家厂商都将推理计作输出,这对 Argon 的影响更大,因为 Google 将其输出上限提高到 100 万 tokens,目的正是让它能“想”更久。
即使按标准价计算,Argon 的成本也远低于 Astra 的一半。悬而未决的是长提示的费用,目前只有 Astra 公布了对应定价。
真实工作负载要花多少
| 工作负载 | Gemini 4 Argon(起步) | Gemini 4 Argon(标准) | GPT-6 Astra |
|---|---|---|---|
| 均衡助理:100 万入 / 25 万出 | $4.50 | $9.00 | $22.50 |
| 检索,单次请求低于 272K:1000 万入 / 100 万出 | $30 | $60 | $150 |
| 检索,单次请求高于 272K:1000 万入 / 100 万出 | 未公布 | 未公布 | $275 |
各合计为(用量 ÷ 100 万)× 费率,并按标准价在输入与输出上分别累加。
- 均衡助理:按起步价每月节省 $18(80%),按标准价节省 $13.50(60%)。
- 低于 272K 的检索:同样是 80% 与 60% 的节省,在开始显著的规模下分别为 $120 或 $90 每月。
- 高于 272K 的检索:Astra 的附加费将成本推高至 $275。Google 尚未说明 Argon 是否有长上下文分层,因此等 Argon 的定价页上线时,这一行需要重点关注。
两家使用的分词器不同,且都未公布针对同一工作负载的 token 统计,因此请将这些合计视为费率对比,而非账单。
何时选择 Gemini 4 Argon 或 GPT-6 Astra
目前,分野在于可用性而非基准:Astra 已普遍可用,Argon 仅限经过审查的网络防御者。一旦 Argon 开放,其 0.2 倍至 0.4 倍的价格系数会使其成为知识型工作优先测试的默认选项。
在以下情况下选择 Gemini 4 Argon…
- 您的工作侧重法律研究、财务分析或业务自动化。这些是它在 Google 表中领先最明显的项目,其中法律差距最大。
- 您会输入非常长的内容。在 256K 到 1M tokens 的跨上下文推理上,它比 Astra 稳得多,并在长视频上领先。
- 您希望以前沿质量获得更具性价比的价格。即便按标准价计算,每个 token 成本也远低于 Astra 的一半。
在以下情况下选择 GPT-6 Astra…
- 您今天就需要。Astra 已在 ChatGPT、OpenAI API、Azure、Bedrock、GitHub Copilot 与 OpenRouter 中可用,而 Argon 还没有公开 API。
- 您最难的工作是软件工程或科学计算。它在 FrontierSWE v2 和 Terminal-Bench Science 上均领先 Argon 超过 10 分。
- 您在桌面应用上运行“电脑使用”型代理。它在 OSWorld-2.0 上领先,尽管 Argon 在 Agent's Last Exam 上取胜,仍建议在您的具体任务上测试。
结语
如果您这周就需要一款前沿模型,GPT-6 Astra 是可行之选。如果您的工作偏向法律、金融或长文档分析,并且可以等待,请在 Gemini 4 Argon 开放当天计划进行测试。若您订阅我们的每周通讯 The Median,我们会在第一时间通知您:
这场 Argon 对 Astra 的比较颇耐人寻味。Google 发布了 Argon,并给出一张基准表显示其在多数项目上胜过 OpenAI,同时价格压过 Astra。但对于大多数人而言,它仍然无从下手。
Google 押注其领先优势能撑到开放之时。
常见问题
Gemini 4 Argon 比 GPT-6 Astra 更强吗?
在 Google 自家的基准表中,Gemini 4 Argon 在 19 项基准里有 14 项高于 GPT-6 Astra,其最大优势体现在法律、金融、业务自动化以及长上下文工作。GPT-6 Astra 在 FrontierSWE v2、Terminal-Bench Science 0.1、OSWorld-2.0 与 Terminal-bench 4.0 上领先。所有分数均来自 Google,因此仍需独立测试验证。
我现在可以使用 Gemini 4 Argon 吗?
除非您在 Google 面向受信任网络防御者的 Fairwind 计划中,否则还不行。Google 表示付费 API 客户与 Google AI Ultra 订阅用户将是下一批获得访问的对象,但尚未给出日期,也未公布 API 模型 ID。
Gemini 4 Argon 相比 GPT-6 Astra 的价格如何?
Gemini 4 Argon 的起步价为每 100 万输入 tokens 收费 $2、每 100 万输出 tokens 收费 $10,之后分别升至 $4 与 $20。GPT-6 Astra 的价格为 $10 与 $50,因此 Argon 在起步价阶段是 Astra 的五分之一,在标准价阶段为其 40%。Google 尚未说明起步期会持续多久。
编码方面,Gemini 4 Argon 和 GPT-6 Astra 哪个更好?
各有优劣。Gemini 4 Argon 在 Google 表中的 DeepSWE v1.1 与 Vibe Code Bench 上领先,而 GPT-6 Astra 在 FrontierSWE v2 上领先约 10 分,并在 Terminal-bench 4.0 上小幅领先 Argon。针对最难的工程任务,Astra 目前的公开结果更强。
Gemini 4 Argon 的输出上限是多少?
Google 将 Gemini 4 Argon 的输出上限提升至 100 万 tokens,早期 Gemini 模型为 64K,因此它可以在一次推理中走通长问题。GPT-6 Astra 的最大输出为 128K tokens。