Google anunció Gemini 4 Argon a finales de septiembre. Argon es el primer modelo de la serie Gemini 4 y marca la nueva frontera. Llega cuatro semanas después de GPT-6 Astra, el nuevo buque insignia de OpenAI desde principios de septiembre.
En la tabla de lanzamiento de Google, Argon supera a Astra en la mayoría de métricas y cuesta una fracción del precio de Astra. Pero hay un matiz más importante que cualquier benchmark: Argon aún no está disponible de forma general. Google lo está desplegando primero a equipos de ciberseguridad verificados, sin fecha para desarrolladores o consumidores.
TL;DR
- En la tabla de benchmarks de Google, Gemini 4 Argon supera a GPT-6 Astra en la mayoría de pruebas, con ventaja en tareas legales, finanzas y flujos de trabajo empresariales.
- GPT-6 Astra mantiene ventaja en ingeniería de software al límite, trabajo científico en terminal y uso de ordenador.
- El precio de lanzamiento de Argon es una quinta parte del de Astra, y su tarifa estándar sigue siendo menos de la mitad.
- Pero aún no puedes usar Argon: el acceso está limitado a los equipos de ciberdefensa de confianza de Google; después irán los clientes de API de pago y suscriptores de AI Ultra.
- Así que, si necesitas un modelo de frontera en producción hoy, elige GPT-6 Astra.
¿Qué es Gemini 4 Argon?
Gemini 4 Argon es el nuevo modelo de frontera de Google DeepMind, anunciado a finales de septiembre. Es el primer modelo de la generación Gemini 4.
Google ha creado Argon para sostener razonamiento profundo en trabajos largos y multietapa. Lo respalda con un límite de salida ampliado a 1M de tokens para que el modelo pueda razonar problemas complejos en una sola pasada.
¿Qué es GPT-6 Astra?
GPT-6 Astra es el modelo insignia de OpenAI, lanzado a principios de septiembre. Se sitúa en la cúspide de la familia GPT-6 por encima de GPT-6.1 Sol y GPT-6 Luna.
OpenAI lo posiciona como su modelo más capaz para el trabajo más exigente, desde razonamiento complejo y programación hasta uso de ordenador e investigación.
Gemini 4 Argon vs GPT-6 Astra: comparación directa
De los 19 benchmarks en la tabla de lanzamiento de Google, Argon puntúa por encima de Astra en 14, Astra gana 4 y hay un empate. Todos proceden de la tabla de Google, así que léelos como el argumento de Google a favor de Argon, no como un ranking independiente. He recortado esa tabla para quedarme con las pruebas más conocidas, interesantes y relevantes para este lanzamiento.
| Función | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68.9% | 63.1% |
| AutomationBench | 51.3% | 41.4% |
| Vals Finance Agent v2 | 65.4% | 53.5% |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% |
| DeepSWE v1.1 | 77.9% | 74.1% |
| FrontierSWE v2 | 55.0% | 65.5% |
| Terminal-bench 4.0 | 57.4% | 58.2% |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% |
| OSWorld-2.0 (subset offline) | 69.2% | 72.6% |
| Tokens máximos de salida | 1M | 128K |
| Disponibilidad | Solo ciberdefensores de confianza | Disponibilidad general |
Cada dimensión a continuación desarrolla el resto de la tabla.
Trabajo del conocimiento: legal, finanzas y flujos de negocio
Aquí es donde la ventaja de Argon es mayor y donde Google ha centrado su lanzamiento.
En Harvey's Legal Agent Benchmark, que evalúa investigación y redacción jurídica, Argon logra un 19,6% frente al 5,4% de Astra. Es una puntuación baja para ambos, pero completar más del triple de tareas es la mayor diferencia relativa de toda la tabla.
El patrón se mantiene en investigación financiera y automatización empresarial, donde Argon saca unos 10 a 12 puntos. Si estos datos se confirman cuando la gente pueda usarlo, Argon es el modelo más sólido para trabajos legales y financieros con muchos documentos.
Programación e ingeniería de software
En código, hay reparto y depende del tipo de ingeniería.
Argon lidera en DeepSWE v1.1, que mide tareas de largo recorrido en bases de código reales, y supera por poco a Astra en Vibe Code Bench, que puntúa la construcción de apps funcionales.

Astra gana con claridad en FrontierSWE v2, y en Terminal-bench 4.0 están a menos de un punto.
Los ejemplos de Google se inclinan hacia migraciones a gran escala, incluido C y C++ a Rust en bases de código internas.
Para el benchmark de ingeniería más exigente de la tabla, aun así, Astra sigue por delante.
Contexto largo y comprensión visual
Argon se despega a medida que las entradas son más largas.
En GraphWalks, que evalúa razonamiento sobre grafos repartidos en un contexto extenso, ambos van parejos hasta 128K tokens, pero de 256K a 1M tokens, Argon obtiene mejores resultados.
Argon también lidera en LVBench para comprensión de vídeo largo, mientras que la lectura de gráficos en Chartography queda prácticamente en empate.
Para quien cargue contratos completos, bases de código o grabaciones en un modelo, esta es la diferencia más práctica tras la disponibilidad.
Ciencia, matemáticas y uso de ordenador
Astra mantiene el tipo en trabajo científico en terminal, con más de 10 puntos de ventaja en Terminal-Bench Science 0.1. Argon lidera LABBench 2, un benchmark de biología, y RiemannBench en matemáticas. En uso de ordenador, Astra va por delante en OSWorld-2.0 mientras Argon gana en Agent's Last Exam, así que ninguna domina esta categoría.
Disponibilidad y seguridad
Astra es el que puedes desplegar hoy. Argon está limitado por ahora al Fairwind Program de Google para ciberdefensores de confianza, además de equipos internos, y Google dice que después vendrán los clientes de API de pago y suscriptores de Google AI Ultra, sin fecha.
La historia de ciberseguridad de Argon tiene dos caras. Google lo lanza a defensores verificados sin barreras de seguridad específicas, y empata con Astra en el primer puesto de CWE-bench v1, que evalúa la corrección de vulnerabilidades reales.
Para el resto, Google afirma que Argon rechazará solicitudes dañinas de ciberataques y CBRN y ejecuta monitores que pueden detener la ejecución cuando el modelo se excede de la intención del usuario.
Precios: lo que realmente pagas
Argon cuesta una quinta parte de Astra con el precio de lanzamiento y menos de la mitad con la tarifa estándar, pero Google no ha dicho cuánto durará el precio introductorio.
Tarifas por token, lado a lado
| Tarifa | Gemini 4 Argon (lanzamiento) | Gemini 4 Argon (estándar) | GPT-6 Astra |
|---|---|---|---|
| Entrada, por 1M de tokens | $2.00 | $4.00 | $10.00 |
| Salida, por 1M de tokens | $10.00 | $20.00 | $50.00 |
| Lectura de caché de entrada, por 1M de tokens | $0.10 (95% menos que entrada) | No publicado | $1.00 |
| Recargo por contexto largo | No publicado | No publicado | Más de 272K tokens de entrada: 2x en entrada y caché, 1.5x en salida para toda la petición |
El multiplicador es uniforme en entrada y salida: 0,2x frente a Astra con tarifas de lanzamiento y 0,4x con las estándar. Ambos proveedores facturan el razonamiento como salida, lo que pesa más en Argon, ya que Google elevó su límite de salida a 1M de tokens precisamente para que pueda pensar más tiempo.
Incluso con tarifas estándar, Argon queda muy por debajo de la mitad del coste de Astra. La incógnita son los prompts largos, donde solo Astra ha publicado precios.
Cuánto cuesta una carga de trabajo real
| Carga de trabajo | Gemini 4 Argon (lanz.) | Gemini 4 Argon (estándar) | GPT-6 Astra |
|---|---|---|---|
| Asistente equilibrado: 1M in / 250K out | $4.50 | $9.00 | $22.50 |
| Recuperación, cada petición por debajo de 272K: 10M in / 1M out | $30 | $60 | $150 |
| Recuperación, cada petición por encima de 272K: 10M in / 1M out | No publicado | No publicado | $275 |
Cada total es (volumen ÷ 1M) × tarifa, sumado entre entrada y salida, a tarifas estándar.
- Asistente equilibrado: Argon ahorra $18 al mes (80%) con tarifas de lanzamiento y $13.50 (60%) con tarifas estándar.
- Recuperación por debajo de 272K: el mismo 80% y 60% de ahorro, ya a una escala relevante: $120 o $90 al mes.
- Recuperación por encima de 272K: el recargo de Astra eleva el coste a $275. Google no ha dicho si Argon tendrá un tramo de contexto largo, así que esta es la fila a revisar cuando publiquen su página de precios.
Los dos proveedores usan tokenizadores distintos y ninguno ha publicado recuentos de tokens para una carga de trabajo compartida, así que toma estos totales como una comparación de tarifas, no como una factura.
Cuándo elegir Gemini 4 Argon vs GPT-6 Astra
Por ahora, la clave es la disponibilidad, no los benchmarks: Astra está disponible de forma general y Argon está limitado a ciberdefensores verificados. Cuando Argon se abra, su multiplicador de precio entre 0,2x y 0,4x lo convertirá en el candidato por defecto para trabajos de conocimiento.
Elige Gemini 4 Argon si…
- Tu trabajo es investigación legal, análisis financiero o automatización de negocio. Ahí están sus mayores ventajas en la tabla de Google, y la diferencia en legal es la más grande de todas.
- Le das entradas muy largas. Se mantiene mucho mejor que Astra al razonar entre 256K y 1M tokens, y lidera en vídeo largo.
- El precio importa manteniendo calidad de frontera. Incluso con tarifas estándar, cuesta bastante menos de la mitad que Astra por token.
Elige GPT-6 Astra si…
- Lo necesitas hoy. Astra está en ChatGPT, la API de OpenAI, Azure, Bedrock, GitHub Copilot y OpenRouter, mientras que Argon aún no tiene API pública.
- Tu trabajo más duro es ingeniería de software o computación científica. Supera a Argon en FrontierSWE v2 y Terminal-Bench Science por más de 10 puntos cada uno.
- Ejecutas agentes que usan apps de escritorio. Lidera OSWorld-2.0, aunque Argon gana en Agent's Last Exam, así que prueba con tus propias tareas.
Reflexión final
Si necesitas un modelo de frontera esta semana, GPT-6 Astra es la opción. Si tu trabajo es legal, finanzas o análisis de documentos largos y puedes esperar, planifica probar Gemini 4 Argon el día que se abra. Te avisaremos en cuanto ocurra si te suscribes a The Median, nuestro boletín semanal:
Esta comparación, Argon frente a Astra, es interesante. Google ha lanzado Argon con una tabla de benchmarks que muestra que supera a OpenAI en la mayoría de métricas y con un precio por debajo del de Astra. Pero, al mismo tiempo, la mayoría aún no puede usarlo.
Google apuesta a que su ventaja aguantará hasta que llegue el acceso.
Preguntas frecuentes
¿Es Gemini 4 Argon mejor que GPT-6 Astra?
En la tabla de benchmarking de Google, Gemini 4 Argon puntúa por encima de GPT-6 Astra en 14 de 19 pruebas, con sus mayores ventajas en legal, finanzas, automatización de negocio y trabajo de contexto largo. GPT-6 Astra lidera en FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 y Terminal-bench 4.0. Todas las puntuaciones provienen de Google, así que aún hacen falta pruebas independientes.
¿Puedo usar Gemini 4 Argon ya?
No, a menos que formes parte del Fairwind Program de Google para ciberdefensores de confianza. Google dice que después tendrán acceso los clientes de API de pago y los suscriptores de Google AI Ultra, pero no ha dado fecha ni ha publicado un ID de modelo para la API.
¿Cuánto cuesta Gemini 4 Argon frente a GPT-6 Astra?
Gemini 4 Argon se lanza con $2 por millón de tokens de entrada y $10 por millón de tokens de salida, y luego sube a $4 y $20. GPT-6 Astra cuesta $10 y $50, así que Argon vale una quinta parte del precio de Astra en lanzamiento y el 40% con la tarifa estándar. Google no ha dicho cuánto durará el periodo introductorio.
¿Cuál es mejor para programar, Gemini 4 Argon o GPT-6 Astra?
Está repartido. Gemini 4 Argon lidera en DeepSWE v1.1 y Vibe Code Bench en la tabla de Google, mientras que GPT-6 Astra lidera FrontierSWE v2 por unos 10 puntos y supera por poco a Argon en Terminal-bench 4.0. Para las tareas de ingeniería más difíciles, Astra tiene por ahora el resultado publicado más fuerte.
¿Cuál es el límite de salida de Gemini 4 Argon?
Google elevó el límite de salida de Gemini 4 Argon a 1M de tokens, desde 64K en modelos Gemini anteriores, para que pueda razonar problemas largos en una sola pasada. El máximo de salida de GPT-6 Astra es 128K tokens.