Google は9月末に Gemini 4 Argon を発表しました。Argon は Google の最初の Gemini 4 モデルであり、新たな最前線です。これは、9月初旬に OpenAI が発表した新フラッグシップ GPT-6 Astra の4週間後に登場しました。
Google の発表資料では、多くの項目で Argon が Astra を上回り、価格は Astra の一部に過ぎません。ただし、ベンチマーク以上に重要な注意点があります。Argon はまだ一般提供されていないのです。まずは審査済みのサイバーセキュリティチーム向けに段階的に提供されており、開発者や一般消費者向けの提供時期は示されていません。
要点
- Google のベンチマーク表では、法務・金融・業務自動化で先行し、Gemini 4 Argon が多くの項目で GPT-6 Astra を上回っています。
- GPT-6 Astra は、最難度のソフトウェアエンジニアリング、科学系のターミナル作業、コンピュータ操作で優位を保っています。
- Argon の初期価格は Astra の5分の1、標準価格でも半額未満です。
- ただし Argon はまだ利用できません。アクセスは Google の信頼済みサイバー防衛チームに限定されており、有料 API 顧客と AI Ultra 購読者がその次です。
- したがって、今日すぐに本番で最前線モデルが必要なら GPT-6 Astra を選んでください。
Gemini 4 Argon とは?
Gemini 4 Argon は、9月末に発表された Google DeepMind の新たな最前線モデルです。Gemini 4 世代の最初のモデルでもあります。
Google は、複数ステップにわたる長い作業で深い推論を維持できるように Argon を設計しました。その裏付けとして、出力上限を 100 万トークンに引き上げ、難問を1回の実行で推論し切れるようにしています。
GPT-6 Astra とは?
GPT-6 Astra は、9月初旬にリリースされた OpenAI のフラッグシップモデルです。 GPT-6.1 Sol や GPT-6 Luna を上回る、GPT-6 ファミリーの最上位に位置づけられています。
OpenAI は、複雑な推論やコーディングからコンピュータ操作、リサーチに至るまで、最も要求の高い作業に最も適したモデルとして位置付けています。
Gemini 4 Argon と GPT-6 Astra:項目別の比較
Google の発表表にある19のベンチマーク中、Argon は14で Astra を上回り、Astra の勝ちは4、引き分けが1です。いずれも Google 自身のデータであり、独立したランキングではない点には注意してください。ここでは、今回の発表に関して広く知られ、興味深く、関連性が高いと考えるテストに絞って抜粋しています。
| 項目 | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68.9% | 63.1% |
| AutomationBench | 51.3% | 41.4% |
| Vals Finance Agent v2 | 65.4% | 53.5% |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% |
| DeepSWE v1.1 | 77.9% | 74.1% |
| FrontierSWE v2 | 55.0% | 65.5% |
| Terminal-bench 4.0 | 57.4% | 58.2% |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% |
| OSWorld-2.0 (offline subset) | 69.2% | 72.6% |
| 最大出力トークン数 | 1M | 128K |
| 提供状況 | 信頼済みのサイバー防衛チームのみ | 一般提供中 |
以下の各セクションで、表の残りの項目を補足します。
ナレッジワーク:法務・金融・業務ワークフロー
ここが Argon のリードが最も大きく、Google が発表で狙いを定めた領域です。
法務調査と起案を評価する Harvey's Legal Agent Benchmark では、Argon が 19.6%、Astra は 5.4%。両者とも絶対値は低いものの、達成タスク数が3倍超という点で、相対的な差は表中で最大です。
この傾向は金融リサーチや業務自動化でも続き、Argon はおおむね 10〜12 ポイントの差をつけています。一般提供後に実使用で検証されれば、ドキュメント中心の法務・金融業務には Argon が優勢と言えそうです。
コーディングとソフトウェアエンジニアリング
コーディングは分が割れ、どのタイプのエンジニアリングかによって異なります。
実在コードベースでの長期タスクを測る DeepSWE v1.1 では Argon がリードし、実用アプリの構築を評価する Vibe Code Bench でも Astra をわずかに上回ります。

一方で FrontierSWE v2 では Astra が明確に勝ち、Terminal-bench 4.0 では両者は1ポイント差の接戦です。
Google の事例は、大規模な移行に寄っており、社内コードベースでの C/C++ から Rust への移行などが含まれます。
ただし、表中で最も難度の高いエンジニアリング系ベンチマークでは、依然として Astra が先行しています。
長文コンテキストと視覚理解
入力が長くなるほど Argon が抜け出します。
長いコンテキストに分散したグラフ構造の推論を測る GraphWalks では、128K トークンまでは拮抗しますが、256K〜1M では Argon が上回ります。
長尺動画の理解を測る LVBench でも Argon がリードし、Chartography によるチャート読解はほぼ互角です。
契約書一式やコードベース、長時間の録音をモデルに投入する場合、提供状況の次に実務的な差となるのがここです。
科学・数学・コンピュータ操作
科学系のターミナル作業では Astra が優位で、Terminal-Bench Science 0.1 で 10 ポイント以上の差をつけています。Argon は生物学系の LABBench 2 と数学の RiemannBench でリード。コンピュータ操作では、Astra が OSWorld-2.0 をリードし、Argon は Agent's Last Exam をリードと、どちらか一方の独壇場というわけではありません。
提供状況と安全性
本日導入できるのは Astra です。Argon は現在、Google の Fairwind Program に参加する信頼済みサイバー防衛チームと社内チームに限定されており、有料 API 顧客と Google AI Ultra 購読者が次とされていますが、時期は未公表です。
Argon のサイバー面の位置づけには両義性もあります。Google は、サイバー用のガードレールなしで、審査済みの防衛側にまず提供し、実在の脆弱性修正を測る CWE-bench v1 では Astra と同率首位です。
それ以外のユーザーに対しては、Argon は有害なサイバーおよび CBRN のリクエストを拒否し、モデルが利用者の意図を逸脱した際に実行を停止できるモニタを走らせるとしています。
料金:実際に支払う額
Argon の初期価格は Astra の5分の1、標準価格でも半額未満ですが、初期価格がいつまで続くかは公表されていません。
トークン単価の比較
| 項目 | Gemini 4 Argon(初期) | Gemini 4 Argon(標準) | GPT-6 Astra |
|---|---|---|---|
| 入力(100万トークンあたり) | $2.00 | $4.00 | $10.00 |
| 出力(100万トークンあたり) | $10.00 | $20.00 | $50.00 |
| キャッシュ済み入力の読み取り(100万トークンあたり) | $0.10(入力の95%引き) | 非公開 | $1.00 |
| 長文コンテキストの追加料金 | 非公開 | 非公開 | 入力が272Kトークン超:リクエスト全体で入力とキャッシュは2倍、出力は1.5倍 |
倍率は入力・出力で一貫しており、初期は Astra の 0.2 倍、標準は 0.4 倍です。両社とも「推論」を出力として課金します。Argon はより長く考えられるよう出力上限を 1M に引き上げているため、この差は Argon にとってより重要です。
標準単価でも、Argon のコストは Astra の半分を大きく下回ります。未確定なのは長文プロンプトで、料金を公開しているのは今のところ Astra のみです。
実運用での費用感
| ワークロード | Gemini 4 Argon(初期) | Gemini 4 Argon(標準) | GPT-6 Astra |
|---|---|---|---|
| バランス型アシスタント:入100万/出25万 | $4.50 | $9.00 | $22.50 |
| 検索(各リクエストが272K未満):入1000万/出100万 | $30 | $60 | $150 |
| 検索(各リクエストが272K超):入1000万/出100万 | 非公開 | 非公開 | $275 |
各合計は、(ボリューム ÷ 100万)× 単価 を入力・出力で合算したもの(標準単価換算)です。
- バランス型アシスタント: 初期単価で月 $18(80%)の節約、標準単価でも $13.50(60%)の節約。
- 検索(272K未満): 同じく 80%/60% の節約で、$120 または $90/月と、効いてくる規模感。
- 検索(272K超): Astra は追加料金で $275 に。Argon に長文向けの料金階層があるかは未公表のため、Argon の料金ページ公開後に要確認の行です。
両社は異なるトークナイザを使っており、共通ワークロードでのトークン数は未公開です。したがって、ここでの合計は請求額そのものではなく、あくまで単価比較として扱ってください。
Gemini 4 Argon と GPT-6 Astra、どちらを選ぶべきか
現時点の分かれ目はベンチマークではなく提供状況です。Astra は一般提供中、Argon は審査済みサイバー防衛向けの限定提供です。Argon が開放されたら、0.2〜0.4倍という価格差から、ナレッジワークではまず Argon を試すのが定石になるでしょう。
Gemini 4 Argon を選ぶなら…
- 業務が法務調査・財務分析・業務自動化中心。 Google の表で最も差が開いている領域で、特に法務は最大の差です。
- 非常に長い入力を与える。 256K〜1M トークンにわたる推論で Astra より粘り強く、長尺動画でもリードします。
- 最前線の品質を価格面で重視する。 標準単価でも、トークンあたりのコストは Astra の半分を大きく下回ります。
GPT-6 Astra を選ぶなら…
- 今日すぐに必要。 Astra は ChatGPT、OpenAI API、Azure、Bedrock、GitHub Copilot、OpenRouter で利用可能。Argon はまだ公開 API がありません。
- 最も難しい作業がソフトウェアエンジニアリングや科学計算。 FrontierSWE v2 と Terminal-Bench Science でいずれも 10 ポイント超の差でリードしています。
- デスクトップアプリ上でコンピュータ操作エージェントを動かす。 OSWorld-2.0 でリード。ただし Argon は Agent's Last Exam で勝っているため、自身のタスクで検証してください。
まとめ
今週中に最前線モデルが必要なら、選択肢は GPT-6 Astra です。業務が法務・金融・長文ドキュメント分析で、待てるのであれば、Gemini 4 Argon が開放された当日に試す計画を立ててください。最新情報は、週刊ニュースレター The Median に登録いただければお知らせします。
Argon と Astra の比較は興味深いものです。Google は Argon を発表し、多くの指標で OpenAI を上回り、価格でも Astra を下回るとする表を示しました。しかし、多くの人にとっては、まだ使う術がありません。
Google は、アクセスが広がるまでリードを維持できると賭けています。
FAQs
Gemini 4 Argon は GPT-6 Astra より優れていますか?
Google のベンチマーク表では、19 項目中 14 で Gemini 4 Argon が GPT-6 Astra を上回り、法務・金融・業務自動化・長文コンテキストでの作業に最大のリードがあります。GPT-6 Astra は FrontierSWE v2、Terminal-Bench Science 0.1、OSWorld-2.0、Terminal-bench 4.0 で上回っています。いずれのスコアも Google 提供のため、独立検証は今後も必要です。
Gemini 4 Argon はもう使えますか?
いいえ。Google の信頼済みサイバー防衛向けプログラム(Fairwind Program)に参加していない限り使えません。Google は次に有料 API 顧客と Google AI Ultra 購読者に提供するとしていますが、日時や API のモデル ID は未公表です。
料金は Gemini 4 Argon と GPT-6 Astra でどれくらい違いますか?
Gemini 4 Argon の初期単価は、入力 100 万トークンあたり $2、出力 100 万トークンあたり $10 で、その後は $4 と $20 に上がります。GPT-6 Astra はそれぞれ $10 と $50 のため、Argon は初期単価で Astra の 5 分の 1、標準単価で 40% の水準です。初期期間がどのくらい続くかは公表されていません。
コーディングには Gemini 4 Argon と GPT-6 Astra のどちらが良いですか?
割れています。Google の表では、Gemini 4 Argon は DeepSWE v1.1 と Vibe Code Bench で優位、GPT-6 Astra は FrontierSWE v2 で約 10 ポイントのリード、Terminal-bench 4.0 では僅差で Argon を上回ります。最難度のエンジニアリングでは、現状 Astra の公開結果が強いと言えます。
Gemini 4 Argon の出力上限は?
Google は Gemini 4 Argon の出力上限を、従来の Gemini モデルの 64K から 100 万トークンへ引き上げ、長い課題でも 1 回で推論できるようにしました。GPT-6 Astra の最大出力は 128K トークンです。