Curso
Nota: Pocas semanas después del lanzamiento de Gemini 3.7 Flash, Google lanzó Gemini 3.8 Flash. Míralo en acción en nuestro tutorial de la API de Gemini 3.8 Flash.
Google ha presentado Gemini 3.7 Flash, su modelo más capaz dentro de la gama Flash hasta la fecha, orientado de lleno a la programación y a flujos de trabajo agentic. El lanzamiento llega mientras el buque insignia Gemini 3.5 Pro sigue retrasado, algo que Reuters señaló como una prueba de si DeepMind puede mantener el ritmo frente a Anthropic y OpenAI.
Las cifras de portada son agresivas. Gemini 3.7 Flash logra un 43,6% en FrontierCode 1.1 Main (frente al 34,4% de 3.6 Flash), alcanza 1588 Elo en Code Arena para desarrollo web y sale con un precio de introducción de $0,75 por 1M de tokens de entrada y $3,75 por 1M de tokens de salida, la mitad del coste inicial de 3.6 Flash.
En este artículo, repaso todas las novedades de Gemini 3.7 Flash: sus funciones, los benchmarks y pruebas prácticas que puedes ejecutar tú mismo. Para profundizar en los modelos rivales con los que compite, consulta nuestras guías de GPT-5.6 Terra vs Claude Sonnet 5 y cómo aprender Claude.
En pocas palabras
- Gemini 3.7 Flash es el modelo Flash más capaz de Google, orientado a programación y flujos agentic, con una ventana de contexto de 1M de tokens.
- Precio de introducción de $0,75/1M de entrada y $3,75/1M de salida hasta el 31 de diciembre de 2026; después $1,50/$7,50 estándar.
- Lidera en FrontierCode 1.1 (43,6%), GDP.pdf (34,0%), Harvey LAB-AA (90,7%) y GDM-MRCR long context (97,0%) frente a Claude Sonnet 5 y GPT-5.6 Terra.
- GPT-5.6 Terra aún lidera en DeepSWE, Terminal-bench y evals agentic de OSWorld.
- Disponible a través de la API de Gemini, Google Antigravity, Gemini Enterprise y Gemini Spark.
¿Qué es Gemini 3.7 Flash?
Gemini 3.7 Flash es el modelo de trabajo de gama media de Google, presentado como su modelo Flash más capaz para programación compleja, flujos agentic y ejecución fiable en varios pasos. Llega tras Gemini 3.6 Flash, lanzado tres semanas antes, y Google atribuye la mejora de calidad al feedback de desarrolladores y a cambios algorítmicos.
El modelo está disponible de forma general a través de la API de Gemini con una ventana de contexto de 1M de tokens (1.048.576 tokens de entrada) y un límite de 65.536 tokens de salida. Acepta entradas de texto, imagen, vídeo, audio y PDF, y devuelve solo texto. Google expone niveles de razonamiento ajustables en bajo, medio y alto; la API devuelve un error si solicitas el ajuste no compatible minimal.
El titular más revelador es DeepSWE v1.1, una evaluación de ingeniería de software de largo recorrido, donde 3.7 Flash obtiene un 65,3% frente al 34,4% de su predecesor en FrontierCode y solo un 48,6% de 3.6 Flash en el propio DeepSWE. Es un salto grande de una generación a otra para un modelo que además ha bajado de precio, algo poco habitual.
¿Qué hay de nuevo en Gemini 3.7 Flash?
La clave: un modelo Flash más capaz a menor precio, con mejor seguimiento de instrucciones y menos necesidad de supervisión en bucles agent. Estos son los cambios que más importan en la práctica.
Mejor programación y resolución de incidencias
Puedes encargar a Gemini 3.7 Flash tareas más duras de depuración y refactorización y esperar mayor precisión al primer intento. Google reporta un 43,6% en FrontierCode 1.1 Main para calidad de código lista para producción (frente al 34,4% de 3.6 Flash) y un 65,3% en DeepSWE v1.1 para ingeniería de software de largo recorrido.
Para los ingenieros en activo, la lectura práctica es: menos reintentos. Según Google, el modelo se adapta mejor a bloqueos y sigue las instrucciones con más fidelidad, lo que reduce la supervisión manual que hace que los modelos baratos salgan caros en tiempo real.
Generación más rápida de apps web y UI
Gemini 3.7 Flash crea maquetas funcionales y apps web con todas las funciones en menos prompts que 3.6 Flash. En el ranking de desarrollo web de Code Arena obtiene 1588 Elo frente a 1538 de 3.6 Flash y 1541 de Claude Sonnet 5.
El modelo también puede ajustar la UI a una referencia de entrada, ya sea una captura de pantalla, una imagen o un sistema de diseño completo. Si le pasas un mockup de una página de precios, prioriza respetar ese diseño antes que improvisar un layout genérico.
Mejor ejecución agent en varios pasos
El modelo dedica más esfuerzo al planificado y a las llamadas a herramientas, justo donde suelen fallar los modelos baratos. En AutomationBench, una evaluación privada de flujos de trabajo empresariales reales, 3.7 Flash anota un 30,4% frente al 17,0% de 3.6 Flash y al 10,7% de Claude Sonnet 5.
Las herramientas integradas disponibles vía API incluyen caché, ejecución de código, búsqueda de archivos, llamada a funciones, grounding con búsqueda, grounding con Google Maps, salidas estructuradas y contexto por URL. El control del ordenador está presente pero en vista previa; no lo usaría aún en agentes en producción.
Mejor trabajo con documentos y conocimiento
Gemini 3.7 Flash maneja campos densos en conocimiento como finanzas, derecho y biociencias con mejor razonamiento y comprensión documental. En el benchmark GDP.pdf para comprensión experta de PDF logra un 34,0% frente al 22,0% de 3.6 Flash, y en Harvey LAB-AA para flujos legales complejos alcanza un 90,7%.
Si tu trabajo consiste en extraer respuestas estructuradas de memorias anuales densas o contratos, este es el lanzamiento que merece la pena probar. El modelo sigue generando solo texto, así que no creará los gráficos que lea, solo los describirá o resumirá.
Precio más bajo para escalar agentes
El precio de introducción reduce a la mitad el coste de ejecutar agentes basados en Flash frente a las tarifas de lanzamiento de 3.6 Flash. Hasta el 31 de diciembre de 2026, pagas $0,75 por 1M de tokens de entrada y $3,75 por 1M de tokens de salida.
- Entrada: $0,75 por 1M de tokens (introductorio), sube a $1,50 por 1M el 1 de enero de 2027
- Salida: $3,75 por 1M de tokens (introductorio), sube a $7,50 por 1M el 1 de enero de 2027
En comparación, Claude Sonnet 5 se sitúa en $2,00 de entrada y $10,00 de salida en la propia tabla de Google, y GPT-5.6 Terra en $2,00 de entrada y $12,00 de salida. En precio por token, 3.7 Flash rebaja ampliamente a ambos.
Benchmarks de Gemini 3.7 Flash
La tabla de benchmarks de Google enfrenta Gemini 3.7 Flash con 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra y Muse Spark 1.2. El patrón es consistente: 3.7 Flash supera a su predecesor en casi todas las evaluaciones y se bate con rivales más caros, aunque GPT-5.6 Terra lo adelanta en varias evals de programación agentic.
Gemini 3.7 Flash frente al campo, de un vistazo
Así se alinean los números clave de los cuatro modelos en la tabla de Google.
| Métrica | Gemini 3.7 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|
| Precio de entrada / 1M | $0.75 | $2.00 | $2.00 |
| Precio de salida / 1M | $3.75 | $10.00 | $12.00 |
| FrontierCode 1.1 Main | 43,6% | 42,7% | 41,3% |
| DeepSWE v1.1 | 65,3% | 53,8% | 69,6% |
| Terminal-bench 2.1 | 85,8% | 80,4% | 87,4% |
| GDP.pdf | 34,0% | 28,0% | 24,7% |
| GDM-MRCR v2 (128k) | 97,0% | 81,5% | 93,5% |
FrontierCode 1.1 Main
FrontierCode 1.1 Main mide la calidad del código de producción, por lo que premia código correcto y listo para desplegar, no solo sintácticamente válido.
Gemini 3.7 Flash anota un 43,6%, por delante de Claude Sonnet 5 con 42,7%, GPT-5.6 Terra con 41,3% y su propio predecesor 3.6 Flash con 34,4%.
Que un modelo de la gama Flash lidere a ambos rivales de vanguardia en calidad de código de producción es el resultado más llamativo del lanzamiento, especialmente costando un tercio por token.
DeepSWE v1.1
DeepSWE v1.1 evalúa ingeniería de software de largo recorrido: tareas multiarchivo que requieren mantener contexto durante muchos pasos.
Aquí, 3.7 Flash consigue 65,3%, un gran salto desde el 48,6% de 3.6 Flash, pero GPT-5.6 Terra lidera con 69,6%, y Claude Sonnet 5 queda en 53,8%.
La lectura: 3.7 Flash ha cerrado gran parte de la brecha con Terra en programación de largo recorrido, pero no la supera. Si necesitas el techo absoluto en codificación agentic multiarchivo, Terra sigue ganando esa eval concreta.
Terminal-bench 2.1 y 3.0
Terminal-bench mide programación agentic en terminal, donde el modelo maneja la línea de comandos para completar tareas.
En Terminal-bench 2.1, 3.7 Flash logra 85,8% frente a 78,0% de 3.6 Flash y 80,4% de Claude Sonnet 5, aunque GPT-5.6 Terra lidera con 87,4%.
La versión más reciente, Terminal-bench 3.0 para capacidades agent generales, es más dura para todos: 3.7 Flash obtiene 14,9%, muy por encima de 3.6 Flash (5,4%), prácticamente empatado con Claude Sonnet 5 (14,6%) y por detrás de Terra (20,8%).
Estas cifras absolutas tan bajas son un recordatorio útil de lo que aún falta para lograr una fiabilidad general de los agentes.
GDP.pdf y Harvey LAB-AA
GDP.pdf evalúa la comprensión experta de documentos PDF, y Harvey LAB-AA evalúa flujos legales complejos.
Gemini 3.7 Flash lidera ambas: 34,0% en GDP.pdf frente a 28,0% de Claude Sonnet 5 y 24,7% de GPT-5.6 Terra; y 90,7% en Harvey LAB-AA frente a 90,1% de Sonnet 5 y 85,2% de Terra.
Si tu carga de trabajo es análisis legal o financiero intensivo en documentos, aquí el modelo más barato de la tabla también resulta ser el más preciso, una combinación poco común.
GDM-MRCR v2 long context
GDM-MRCR v2 (8-needle) mide recuperación en contexto largo, comprobando si el modelo encuentra varias piezas de información enterradas en una entrada extensa.
Con media 128k, 3.7 Flash marca 97,0%, por delante de 3.6 Flash (91,8%), Claude Sonnet 5 (81,5%) y GPT-5.6 Terra (93,5%).
Con una ventana de contexto de 1M de tokens y la mejor recuperación 8-needle de la tabla, 3.7 Flash es una gran opción para pipelines que cargan documentos grandes o transcripciones largas en una sola llamada.
Cuando comparamos Terra y Sonnet 5, la recuperación en contexto largo fue una de las diferencias más claras entre ambos, y 3.7 Flash ahora se sitúa por encima de los dos en este rango.
Dónde sigue liderando GPT-5.6 Terra
Merece la pena ser claros con las derrotas.
GPT-5.6 Terra supera a Gemini 3.7 Flash en DeepSWE v1.1 (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%), Terminal-bench 3.0 (20,8% vs 14,9%) y OSWorld-2.0 en uso agentic del ordenador (50,2% vs 47,9%).
El patrón: Terra mantiene una ligera ventaja en las evals agentic y de terminal más exigentes, mientras 3.7 Flash gana en calidad de código de producción, comprensión documental y recuperación en contexto largo. Qué te conviene depende de si tu cuello de botella es la fiabilidad del agente o el coste.

Precios y disponibilidad de Gemini 3.7 Flash
Gemini 3.7 Flash ya está disponible de forma general en varios productos de Google.
El ID del modelo en la API es gemini-3.7-flash, y puedes empezar a construir en Google AI Studio, Android Studio o en el entorno agent-first Google Antigravity.
- Desarrolladores: API de Gemini vía Google AI Studio y Android Studio; flujos agent en Google Antigravity
- Empresas: Gemini Enterprise Agent Platform y la app Gemini Enterprise
- Personas usuarias: Gemini Spark, el agente personal 24/7 en la app Gemini, para suscriptores de Google AI Pro y Ultra en más de 160 países
El precio es de $0,75 por 1M de tokens de entrada y $3,75 por 1M de tokens de salida hasta el 31 de diciembre de 2026. El 1 de enero de 2027 aplicarán las tarifas estándar de $1,50 en entrada y $7,50 en salida. Ten en cuenta que este modelo no admite generación de audio, generación de imágenes ni la Live API, y que el uso del ordenador está solo en vista previa.
Conclusiones
Gemini 3.7 Flash demuestra que Google está lanzando rápido y bajando precios mientras su buque insignia Gemini 3.5 Pro sigue retrasado.
Publicar un modelo Flash mejorado tres semanas después de 3.6 Flash, y a la mitad de coste por token, suena a una estrategia para ganar en la gama media, donde vive la mayor parte del volumen en producción.
Sinceramente, este es el modelo al que acudiría si tu carga de trabajo es comprensión de documentos, código web y de apps para producción o recuperación en contexto largo: supera a Claude Sonnet 5 y GPT-5.6 Terra en estos frentes y cuesta una fracción.
Si tu cuello de botella es la programación agentic más dura en terminal, Terra mantiene una ligera ventaja en DeepSWE y Terminal-bench, pagando más por ese techo.
Con los cambios en la dirección de DeepMind y el retraso del modelo Pro, Google se apoya en Flash para demostrar que sigue en la carrera. En la tabla de benchmarks que acaba de publicar, ese argumento se sostiene en gran medida para un modelo de gama media.
Si quieres ensuciarte las manos con modelos así, te recomiendo empezar por nuestro itinerario de aprendizaje AI Fundamentals para construir base antes de conectar Gemini 3.7 Flash a tus propios pipelines de agentes.
Preguntas frecuentes
¿En qué se diferencia Gemini 3.7 Flash de Gemini 3.6 Flash?
Gemini 3.7 Flash mejora a 3.6 Flash en casi todos los benchmarks publicados por Google, incluidos FrontierCode 1.1 Main (43,6% vs 34,4%), DeepSWE v1.1 (65,3% vs 48,6%), comprensión de documentos GDP.pdf (34,0% vs 22,0%) y AutomationBench (30,4% vs 17,0%). Además, llega a mitad de precio por token respecto al lanzamiento de 3.6 Flash. Ambos comparten ventana de contexto de 1M de tokens.
¿Dónde puedo acceder a Gemini 3.7 Flash?
Los desarrolladores pueden usarlo mediante la API de Gemini en Google AI Studio y Android Studio, o en el entorno centrado en agentes Google Antigravity, con el ID de modelo gemini-3.7-flash. Las empresas lo obtienen a través de Gemini Enterprise Agent Platform y la app Gemini Enterprise. Las personas usuarias pueden acceder vía Gemini Spark para suscriptores de Google AI Pro y Ultra en más de 160 países.
¿Cuánto cuesta Gemini 3.7 Flash?
Hasta el 31 de diciembre de 2026, el precio de introducción es $0,75 por 1M de tokens de entrada y $3,75 por 1M de tokens de salida. A partir del 1 de enero de 2027, el precio estándar sube a $1,50 por 1M de entrada y $7,50 por 1M de salida. Esto rebaja a Claude Sonnet 5 y GPT-5.6 Terra, que figuran con $2,00 de entrada en la tabla de Google.
¿Qué estándares de seguridad sigue Gemini 3.7 Flash?
Gemini 3.7 Flash incorpora salvaguardas Frontier Safety actualizadas contra usos indebidos en dominios CBRN (químico, biológico, radiológico y nuclear) y ciberofensivos. Google informa de un rendimiento similar a 3.6 Flash en evaluaciones de seguridad y tono, con pocas negativas injustificadas. También cumplió los umbrales de seguridad infantil de Google durante las pruebas de red teaming.
¿Es mejor Gemini 3.7 Flash que GPT-5.6 Terra para programar?
Depende de la tarea. Gemini 3.7 Flash lidera en calidad de código de producción en FrontierCode 1.1 (43,6% vs 41,3%), mientras que GPT-5.6 Terra lidera en codificación de largo recorrido DeepSWE v1.1 (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%) y uso agentic del ordenador en OSWorld. Terra mantiene una ligera ventaja en las evals agentic más duras, pero 3.7 Flash cuesta una fracción.
Escritora y editora de contenidos en el ámbito de la tecnología educativa. Comprometido con la exploración de tendencias de datos y entusiasmado con el aprendizaje de la ciencia de datos.


