跳至内容

Gemini 4 Argon vs. GPT-6 Astra:基准、定价与使用建议

Google 的表格显示,Gemini 4 Argon 在法律、金融与长上下文工作上领先 GPT-6 Astra,价格仅为五分之一。Astra 仍在高难编码上占优,且目前可用。
已更新 2026年10月2日  · 8分钟 阅读

使用 AI 探索

ChatGPTClaudePerplexity

Google 在九月底的最后时刻宣布了 Gemini 4 Argon。Argon 是 Google 首款 Gemini 4 模型,也是新的前沿能力。它在 OpenAI 于九月初发布 GPT-6 Astra 四周后到来,后者是 OpenAI 的新旗舰。

Google 的发布表格显示,Argon 在大多数项目上领先 Astra,且价格只是 Astra 的一小部分。但有个比任何基准都更要紧的问题:Argon 还未普遍开放。Google 正先向经过审查的网络安全团队推出,尚未给出面向开发者或消费者的日期。

要点速览

  • 在 Google 自家的基准表中,Gemini 4 Argon 在大多数项目上胜过 GPT-6 Astra,优势主要体现在法律、金融与业务流程任务。
  • 在最难的软件工程、科学终端操作和电脑使用方面,GPT-6 Astra 仍占上风。
  • Argon 的起步价是 Astra 的五分之一,即便按标准价计算也不到其一半。
  • 但您现在还无法使用 Argon:访问权限仅限于 Google 信任的网络防御者,其次才是付费 API 客户和 AI Ultra 订阅用户。
  • 因此,如果您需要今天就能用于生产的前沿模型,请选择 GPT-6 Astra。

什么是 Gemini 4 Argon?

Gemini 4 Argon 是 Google DeepMind 在九月底宣布的全新前沿模型,也是 Gemini 4 代中的首款模型。

Google 打造 Argon 旨在支撑对长链路、多步骤工作的深度推理。为此,它将输出上限提升到 100 万 tokens,使模型能在一次推理中走通难题。

什么是 GPT-6 Astra?

GPT-6 Astra 是 OpenAI 于九月初发布的旗舰模型,位于 GPT-6 系列之巅,高于 GPT-6.1 Sol 和 GPT-6 Luna。

OpenAI 将其定位为应对最严苛工作的最强模型,覆盖复杂推理、编码、电脑使用和科研。

Gemini 4 Argon vs GPT-6 Astra:正面比较

在 Google 的发布表格所列的 19 项基准中,Argon 有 14 项高于 Astra,Astra 赢下 4 项,另有 1 项打平。所有数据都来自 Google 自家的表格,因此更像是 Google 为 Argon 做的论证,而非独立排名。下表是我从中挑选的一些更知名、有趣且与此次发布更相关的测试。

项目 Gemini 4 Argon GPT-6 Astra
Vals Index 68.9% 63.1%
AutomationBench 51.3% 41.4%
Vals Finance Agent v2 65.4% 53.5%
Harvey's Legal Agent Benchmark 19.6% 5.4%
DeepSWE v1.1 77.9% 74.1%
FrontierSWE v2 55.0% 65.5%
Terminal-bench 4.0 57.4% 58.2%
Terminal-Bench Science 0.1 57.6% 68.1%
OSWorld-2.0(离线子集) 69.2% 72.6%
最大输出 tokens 1M 128K
可用性 仅限受信任的网络防御者 普遍可用

下文各维度承接上表的其余信息。

知识型工作:法律、金融与业务流程

这是 Argon 领先最明显之处,也是 Google 此次发布的主打方向。

在用于测试法律检索与撰写的 Harvey's Legal Agent Benchmark 上,Argon 得分 19.6%,而 Astra 为 5.4%。虽然两者分数都不高,但完成任务数量多出三倍多,是整张表中相对差距最大的项目。

这一走势在金融研究与业务自动化上同样成立,Argon 领先约 10 至 12 个百分点。如果这些结果在实际使用中站得住脚,Argon 会是处理文档密集型法律与金融工作的更强模型。

编码与软件工程

编码方面各有胜负,取决于您所指的工程类型。

Argon 在 DeepSWE v1.1(测试真实代码库中的长周期任务)上领先,并在 Vibe Code Bench(评估构建可运行应用)上小幅压过 Astra。

Astra 在 FrontierSWE v2 上明显领先,双方在 Terminal-bench 4.0 上相差不到 1 个百分点。

Google 自身的示例偏向大型迁移,包括将 Google 代码库中的 C 与 C++ 迁移至 Rust。

不过,在表中最难的工程基准上,Astra 仍然领先。

长上下文与视觉理解

随着输入变长,Argon 的优势逐步拉开。

在 GraphWalks(测试跨长上下文的图结构推理)上,两者在 128K tokens 以内较为接近,但在 256K 到 1M tokens 区间,Argon 得分更高。

在长视频理解的 LVBench 上,Argon 也领先,而图表阅读(Chartography)方面几乎打成平手。

对需要向模型输入整份合同、代码库或录音的人来说,这是除可用性之外最实际的差异。

科学、数学与电脑使用

Astra 在科学终端操作上守住优势,在 Terminal-Bench Science 0.1 上领先 10 分以上。Argon 领先于生物研究基准 LABBench 2 和数学基准 RiemannBench。在电脑使用方面,Astra 领先 OSWorld-2.0,而 Argon 领先 Agent's Last Exam,因此这一类目并无绝对胜者。

可用性与安全性

Astra 是您今天就能部署的那一个。Argon 目前仅向 Google 的 Fairwind 计划(受信任的网络防御者)及内部团队开放。Google 表示下一步将向付费 API 客户与 Google AI Ultra 订阅用户开放,但未给出日期。

Argon 的网络安全故事也有两面。Google 将其在无网络安全护栏的情况下提供给经过审查的防御者;同时,它在测试修复真实安全漏洞的 CWE-bench v1 上与 Astra 并列第一。

对其他用户而言,Google 表示 Argon 将拒绝有害的网络与 CBRN 请求,并运行监控器,可在模型超出用户意图时停止执行。

定价:您实际要付多少钱

按起步价计算,Argon 的成本是 Astra 的五分之一;按标准价计算也不到其一半,但 Google 尚未说明起步价持续多久。

Token 费率对比

费率 Gemini 4 Argon(起步) Gemini 4 Argon(标准) GPT-6 Astra
输入,每 100 万 tokens $2.00 $4.00 $10.00
输出,每 100 万 tokens $10.00 $20.00 $50.00
缓存输入读取,每 100 万 tokens $0.10(较输入优惠 95%) 未公布 $1.00
长上下文附加费 未公布 未公布 超过 272K 个输入 tokens:整次请求输入与缓存 2 倍、输出 1.5 倍

输入与输出的倍数一致:按起步价为 Astra 的 0.2 倍,按标准价为 0.4 倍。两家厂商都将推理计作输出,这对 Argon 的影响更大,因为 Google 将其输出上限提高到 100 万 tokens,目的正是让它能“想”更久。

即使按标准价计算,Argon 的成本也远低于 Astra 的一半。悬而未决的是长提示的费用,目前只有 Astra 公布了对应定价。

真实工作负载要花多少

工作负载 Gemini 4 Argon(起步) Gemini 4 Argon(标准) GPT-6 Astra
均衡助理:100 万入 / 25 万出 $4.50 $9.00 $22.50
检索,单次请求低于 272K:1000 万入 / 100 万出 $30 $60 $150
检索,单次请求高于 272K:1000 万入 / 100 万出 未公布 未公布 $275

各合计为(用量 ÷ 100 万)× 费率,并按标准价在输入与输出上分别累加。

  • 均衡助理:按起步价每月节省 $18(80%),按标准价节省 $13.50(60%)。
  • 低于 272K 的检索:同样是 80% 与 60% 的节省,在开始显著的规模下分别为 $120 或 $90 每月。
  • 高于 272K 的检索:Astra 的附加费将成本推高至 $275。Google 尚未说明 Argon 是否有长上下文分层,因此等 Argon 的定价页上线时,这一行需要重点关注。

两家使用的分词器不同,且都未公布针对同一工作负载的 token 统计,因此请将这些合计视为费率对比,而非账单。

何时选择 Gemini 4 Argon 或 GPT-6 Astra

目前,分野在于可用性而非基准:Astra 已普遍可用,Argon 仅限经过审查的网络防御者。一旦 Argon 开放,其 0.2 倍至 0.4 倍的价格系数会使其成为知识型工作优先测试的默认选项。

在以下情况下选择 Gemini 4 Argon…

  • 您的工作侧重法律研究、财务分析或业务自动化。这些是它在 Google 表中领先最明显的项目,其中法律差距最大。
  • 您会输入非常长的内容。在 256K 到 1M tokens 的跨上下文推理上,它比 Astra 稳得多,并在长视频上领先。
  • 您希望以前沿质量获得更具性价比的价格。即便按标准价计算,每个 token 成本也远低于 Astra 的一半。

在以下情况下选择 GPT-6 Astra…

  • 您今天就需要。Astra 已在 ChatGPT、OpenAI API、Azure、Bedrock、GitHub Copilot 与 OpenRouter 中可用,而 Argon 还没有公开 API。
  • 您最难的工作是软件工程或科学计算。它在 FrontierSWE v2 和 Terminal-Bench Science 上均领先 Argon 超过 10 分。
  • 您在桌面应用上运行“电脑使用”型代理。它在 OSWorld-2.0 上领先,尽管 Argon 在 Agent's Last Exam 上取胜,仍建议在您的具体任务上测试。

结语

如果您这周就需要一款前沿模型,GPT-6 Astra 是可行之选。如果您的工作偏向法律、金融或长文档分析,并且可以等待,请在 Gemini 4 Argon 开放当天计划进行测试。若您订阅我们的每周通讯 The Median,我们会在第一时间通知您:

这场 Argon 对 Astra 的比较颇耐人寻味。Google 发布了 Argon,并给出一张基准表显示其在多数项目上胜过 OpenAI,同时价格压过 Astra。但对于大多数人而言,它仍然无从下手。

Google 押注其领先优势能撑到开放之时。

常见问题

Gemini 4 Argon 比 GPT-6 Astra 更强吗?

在 Google 自家的基准表中,Gemini 4 Argon 在 19 项基准里有 14 项高于 GPT-6 Astra,其最大优势体现在法律、金融、业务自动化以及长上下文工作。GPT-6 Astra 在 FrontierSWE v2、Terminal-Bench Science 0.1、OSWorld-2.0 与 Terminal-bench 4.0 上领先。所有分数均来自 Google,因此仍需独立测试验证。

我现在可以使用 Gemini 4 Argon 吗?

除非您在 Google 面向受信任网络防御者的 Fairwind 计划中,否则还不行。Google 表示付费 API 客户与 Google AI Ultra 订阅用户将是下一批获得访问的对象,但尚未给出日期,也未公布 API 模型 ID。

Gemini 4 Argon 相比 GPT-6 Astra 的价格如何?

Gemini 4 Argon 的起步价为每 100 万输入 tokens 收费 $2、每 100 万输出 tokens 收费 $10,之后分别升至 $4 与 $20。GPT-6 Astra 的价格为 $10 与 $50,因此 Argon 在起步价阶段是 Astra 的五分之一,在标准价阶段为其 40%。Google 尚未说明起步期会持续多久。

编码方面,Gemini 4 Argon 和 GPT-6 Astra 哪个更好?

各有优劣。Gemini 4 Argon 在 Google 表中的 DeepSWE v1.1 与 Vibe Code Bench 上领先,而 GPT-6 Astra 在 FrontierSWE v2 上领先约 10 分,并在 Terminal-bench 4.0 上小幅领先 Argon。针对最难的工程任务,Astra 目前的公开结果更强。

Gemini 4 Argon 的输出上限是多少?

Google 将 Gemini 4 Argon 的输出上限提升至 100 万 tokens,早期 Gemini 模型为 64K,因此它可以在一次推理中走通长问题。GPT-6 Astra 的最大输出为 128K tokens。

主题