O Google anunciou o Gemini 4 Argon no finzinho de setembro. O Argon é o primeiro modelo da linha Gemini 4 e representa a nova fronteira. Ele chega quatro semanas depois do GPT-6 Astra, novo carro-chefe da OpenAI desde o começo de setembro.
A tabela de lançamento do Google coloca o Argon à frente do Astra na maioria dos itens, por uma fração do preço do Astra. Mas há um detalhe que pesa mais do que qualquer benchmark: o Argon ainda não está disponível para o público. O Google está liberando primeiro para equipes de cibersegurança verificadas, sem data para desenvolvedores ou consumidores.
Resumo
- Na própria tabela do Google, o Gemini 4 Argon supera o GPT-6 Astra na maior parte dos benchmarks, com destaque para tarefas jurídicas, financeiras e de automação de negócios.
- O GPT-6 Astra mantém a vantagem nas tarefas mais difíceis de engenharia de software, trabalho científico em terminal e uso de computador.
- O preço de lançamento do Argon é um quinto do Astra, e o preço padrão ainda é menos da metade.
- Mas você ainda não pode usar o Argon: o acesso está restrito às equipes de defesa cibernética de confiança do Google; depois virão clientes pagos da API e assinantes do AI Ultra.
- Então, escolha o GPT-6 Astra se você precisa de um modelo de ponta em produção hoje.
O que é o Gemini 4 Argon?
O Gemini 4 Argon é o novo modelo de fronteira do Google DeepMind, anunciado no fim de setembro. É o primeiro modelo da geração Gemini 4.
O Google desenvolveu o Argon para sustentar raciocínio profundo em trabalhos longos e com múltiplas etapas. Isso é viabilizado por um limite de saída elevado para 1M tokens, permitindo que o modelo raciocine sobre um problema difícil em uma única passada.
O que é o GPT-6 Astra?
O GPT-6 Astra é o modelo carro-chefe da OpenAI, lançado no começo de setembro. Ele fica no topo da família GPT-6, acima do GPT-6.1 Sol e do GPT-6 Luna.
A OpenAI o posiciona como seu modelo mais capaz para trabalhos exigentes, do raciocínio complexo e codificação ao uso de computador e pesquisa.
Gemini 4 Argon vs. GPT-6 Astra: comparação lado a lado
Dos 19 benchmarks na tabela do Google, o Argon pontua acima do Astra em 14, o Astra vence 4 e há um empate. Todos vêm da própria tabela do Google, então leia como o argumento do Google a favor do Argon, não como um ranking independente. Eu reduzi a tabela para destacar os testes mais conhecidos, interessantes e relevantes para este lançamento.
| Recurso | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68,9% | 63,1% |
| AutomationBench | 51,3% | 41,4% |
| Vals Finance Agent v2 | 65,4% | 53,5% |
| Harvey's Legal Agent Benchmark | 19,6% | 5,4% |
| DeepSWE v1.1 | 77,9% | 74,1% |
| FrontierSWE v2 | 55,0% | 65,5% |
| Terminal-bench 4.0 | 57,4% | 58,2% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% |
| OSWorld-2.0 (subconjunto offline) | 69,2% | 72,6% |
| Máximo de tokens de saída | 1M | 128K |
| Disponibilidade | Apenas defensores cibernéticos de confiança | Disponível para uso geral |
Cada dimensão abaixo detalha o restante da tabela.
Trabalho do conhecimento: jurídico, finanças e fluxos de negócios
Aqui a vantagem do Argon é mais ampla, e foi onde o Google mirou no lançamento.
No Harvey's Legal Agent Benchmark, que testa pesquisa e redação jurídicas, o Argon marca 19,6% contra 5,4% do Astra. A pontuação é baixa para ambos, mas completar mais do que o triplo de tarefas é a maior diferença relativa de toda a tabela.
O padrão se repete em pesquisa financeira e automação de negócios, onde o Argon lidera por algo entre 10 e 12 pontos. Se as alegações se confirmarem quando as pessoas puderem usar, o Argon é o modelo mais forte para trabalhos pesados em documentos nas áreas jurídica e financeira.
Codificação e engenharia de software
Em código, há divisão — depende do tipo de engenharia.
O Argon lidera no DeepSWE v1.1, que testa tarefas de longo horizonte em bases de código reais, e supera por pouco o Astra no Vibe Code Bench, que avalia a construção de apps funcionais.

O Astra vence com folga no FrontierSWE v2, e os dois ficam a menos de um ponto no Terminal-bench 4.0.
Os exemplos do próprio Google apontam para grandes migrações, incluindo C e C++ para Rust em bases de código internas.
Para o benchmark de engenharia mais difícil da tabela, porém, o Astra ainda está na frente.
Contexto longo e compreensão visual
O Argon se destaca à medida que as entradas ficam mais longas.
No GraphWalks, que testa raciocínio sobre estruturas de grafos distribuídas em um contexto extenso, os dois ficam próximos até 128K tokens, mas de 256K a 1M tokens o Argon pontua mais alto.
O Argon também lidera no LVBench para compreensão de vídeos longos, enquanto a leitura de gráficos no Chartography fica quase empatada.
Para quem alimenta o modelo com contratos inteiros, bases de código ou gravações, esta é a diferença mais prática depois da disponibilidade.
Ciência, matemática e uso de computador
O Astra se mantém firme no trabalho científico em terminal, liderando o Terminal-Bench Science 0.1 por mais de 10 pontos. O Argon lidera o LABBench 2, um benchmark de biologia, e o RiemannBench em matemática. No uso de computador, o Astra lidera o OSWorld-2.0, enquanto o Argon lidera o Agent's Last Exam — então nenhum domina a categoria.
Disponibilidade e segurança
O Astra é o que você consegue colocar em produção hoje. O Argon está limitado ao Fairwind Program do Google para defensores cibernéticos de confiança, além de times internos do Google, e a empresa diz que clientes pagos da API e assinantes do Google AI Ultra virão em seguida, sem data definida.
A proposta de cibersegurança do Argon também tem dois lados. O Google está liberando-o para defensores verificados sem barreiras específicas de segurança, e ele empata com o Astra em primeiro lugar no CWE-bench v1, que testa a correção de vulnerabilidades reais.
Para todo o restante, o Google diz que o Argon vai recusar solicitações nocivas de ciber e CBRN e opera monitores que podem interromper a execução quando o modelo extrapola a intenção do usuário.
Preços: quanto você realmente paga
O Argon custa um quinto do Astra no preço de lançamento e menos da metade no preço padrão, mas o Google não disse por quanto tempo o preço promocional dura.
Tarifas por token, lado a lado
| Tarifa | Gemini 4 Argon (lançamento) | Gemini 4 Argon (padrão) | GPT-6 Astra |
|---|---|---|---|
| Entrada, por 1M de tokens | US$ 2,00 | US$ 4,00 | US$ 10,00 |
| Saída, por 1M de tokens | US$ 10,00 | US$ 20,00 | US$ 50,00 |
| Leitura de cache, por 1M de tokens | US$ 0,10 (95% de desconto sobre a entrada) | Não publicado | US$ 1,00 |
| Tarifa para contexto longo | Não publicado | Não publicado | Acima de 272K tokens de entrada: 2x entrada e cache, 1,5x saída para todo o request |
O múltiplo é uniforme em entrada e saída: 0,2x do Astra nas tarifas de lançamento e 0,4x nas tarifas padrão. Ambos cobram o raciocínio como saída, o que pesa mais para o Argon, já que o Google elevou o limite de saída para 1M tokens justamente para ele pensar por mais tempo.
Mesmo nas tarifas padrão, o Argon sai por bem menos da metade do custo do Astra. A dúvida fica nos prompts longos, onde só o Astra publicou preços.
Quanto custa um workload real
| Carga de trabalho | Gemini 4 Argon (lançamento) | Gemini 4 Argon (padrão) | GPT-6 Astra |
|---|---|---|---|
| Assistente balanceado: 1M in / 250K out | US$ 4,50 | US$ 9,00 | US$ 22,50 |
| Retrieval, cada request abaixo de 272K: 10M in / 1M out | US$ 30 | US$ 60 | US$ 150 |
| Retrieval, cada request acima de 272K: 10M in / 1M out | Não publicado | Não publicado | US$ 275 |
Cada total é (volume ÷ 1M) × tarifa, somado entre entrada e saída, nas tarifas padrão.
- Assistente balanceado: o Argon economiza US$ 18 por mês (80%) nas tarifas de lançamento e US$ 13,50 (60%) nas tarifas padrão.
- Retrieval abaixo de 272K: a mesma economia de 80% e 60%, em uma escala que começa a pesar: US$ 120 ou US$ 90 por mês.
- Retrieval acima de 272K: a sobretaxa do Astra eleva o custo para US$ 275. O Google não informou se o Argon terá uma faixa para contexto longo, então esta é a linha para conferir quando a página de preços do Argon for ao ar.
Os fornecedores usam tokenizadores diferentes e nenhum publicou contagem de tokens para uma mesma carga de trabalho, então trate esses totais como comparação de tarifas, não como uma fatura.
Quando escolher Gemini 4 Argon vs. GPT-6 Astra
Por enquanto, a bifurcação é disponibilidade, não benchmark: o Astra está disponível para uso geral, e o Argon está limitado a defensores cibernéticos verificados. Quando o Argon abrir, seu múltiplo de preço entre 0,2x e 0,4x deve torná-lo o padrão a ser testado para trabalho do conhecimento.
Escolha o Gemini 4 Argon se…
- Seu trabalho é pesquisa jurídica, análise financeira ou automação de negócios. Essas são suas maiores vantagens na tabela do Google, e o gap em jurídico é o mais amplo.
- Você fornece entradas muito longas. Ele se sustenta muito melhor que o Astra ao raciocinar entre 256K e 1M tokens e lidera em vídeo longo.
- Preço importa com qualidade de fronteira. Mesmo nas tarifas padrão, ele custa bem menos da metade do Astra por token.
Escolha o GPT-6 Astra se…
- Você precisa hoje. O Astra está no ChatGPT, na OpenAI API, no Azure, no Bedrock, no GitHub Copilot e no OpenRouter, enquanto o Argon ainda não tem API pública.
- Seu trabalho mais difícil é engenharia de software ou computação científica. Ele lidera o Argon no FrontierSWE v2 e no Terminal-Bench Science por mais de 10 pontos cada.
- Você roda agentes que usam aplicativos de desktop. Ele lidera o OSWorld-2.0, embora o Argon vença no Agent's Last Exam — então teste nas suas tarefas.
Considerações finais
Se você precisa de um modelo de ponta esta semana, o GPT-6 Astra é a opção. Se seu trabalho é jurídico, financeiro ou de análise de documentos longos, e você pode esperar, planeje testar o Gemini 4 Argon no dia em que ele abrir. Vamos te avisar quando isso acontecer se você assinar o The Median, nosso boletim semanal:
Esta comparação, Argon versus Astra, é curiosa. O Google lançou o Argon com uma tabela de benchmarks mostrando que ele supera a OpenAI na maioria dos itens, com um preço que fica abaixo do Astra. Mas também não há como a maior parte das pessoas usá-lo.
O Google está apostando que sua vantagem se sustenta até a chegada do acesso geral.
FAQs
O Gemini 4 Argon é melhor que o GPT-6 Astra?
Na própria tabela do Google, o Gemini 4 Argon pontua acima do GPT-6 Astra em 14 de 19 benchmarks, com as maiores vantagens em jurídico, finanças, automação de negócios e trabalho com contexto longo. O GPT-6 Astra lidera no FrontierSWE v2, no Terminal-Bench Science 0.1, no OSWorld-2.0 e no Terminal-bench 4.0. Todas as pontuações vêm do Google, então ainda são necessários testes independentes.
Já posso usar o Gemini 4 Argon?
Não, a menos que você faça parte do Fairwind Program do Google para defensores cibernéticos de confiança. O Google diz que clientes pagos da API e assinantes do Google AI Ultra terão acesso em seguida, mas não informou data nem publicou o ID do modelo na API.
Quanto o Gemini 4 Argon custa em comparação ao GPT-6 Astra?
O Gemini 4 Argon estreia a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, subindo depois para US$ 4 e US$ 20. O GPT-6 Astra custa US$ 10 e US$ 50, então o Argon sai por um quinto do preço do Astra nas tarifas de lançamento e por 40% nas tarifas padrão. O Google não disse por quanto tempo dura o período promocional.
Qual é melhor para programar: Gemini 4 Argon ou GPT-6 Astra?
É dividido. O Gemini 4 Argon lidera no DeepSWE v1.1 e no Vibe Code Bench na tabela do Google, enquanto o GPT-6 Astra lidera o FrontierSWE v2 por cerca de 10 pontos e supera o Argon no Terminal-bench 4.0. Para as tarefas de engenharia mais difíceis, o Astra tem hoje o resultado publicado mais forte.
Qual é o limite de saída do Gemini 4 Argon?
O Google elevou o limite de saída do Gemini 4 Argon para 1M de tokens, acima dos 64K dos modelos Gemini anteriores, para que ele consiga raciocinar sobre problemas longos em uma única passada. A saída máxima do GPT-6 Astra é de 128K tokens.