Ir al contenido principal

Gemini 3: el LLM más potente de Google

Descubre Gemini 3 Pro, el LLM más potente de Google, que lidera los benchmarks en todas las categorías. Además, conoce el modo Gemini 3 Deep Think y Google Antigravity.
Actualizado 23 sept 2026  · 13 min leer

Explorar con IA

ChatGPTClaudePerplexity

Apenas unas horas después de que xAI presentara Grok 4.1, Google ha ido un paso más allá y ha anunciado Gemini 3. Este último modelo de Gemini es el más inteligente de Google hasta la fecha y ya está disponible en la app de Gemini, así como en AI Studio y Vertex AI. 

Gemini 3 también empezará a impulsar de inmediato el modo de IA en la búsqueda, y Google ha anunciado el modo Gemini 3 Deep Think y Google Antigravity, una nueva plataforma de desarrollo con agentes. 

En este artículo, repaso todo lo que ha anunciado Google, qué supone para el panorama de los LLM y pruebo en primera persona el nuevo modelo Gemini 3 para ver de qué es capaz. También puedes consultar nuestra guía de la API de Gemini 3 para un proyecto práctico, echar un vistazo a Google Antigravity con nuestro tutorial y nuestra guía para crear un proyecto Gemini 3 Flash.

¿Qué es Gemini 3 Pro? 

Gemini 3 Pro es el último y más avanzado modelo de lenguaje de gran tamaño de Google. Ya está disponible a través de la app de Gemini, AI Studio y Vertex AI. La compañía lo presenta como su modelo más inteligente hasta la fecha, con mejoras en razonamiento, programación y tareas multimodales. 

Este nuevo modelo se asienta sobre el éxito de Gemini 2.5 Pro, lanzado hace apenas siete meses. Gemini 3 se ha encaramado al primer puesto del ranking de LMArena, desbancando a Grok 4.1 en cuestión de horas. 

Google afirma que Gemini 3 Pro tiene un razonamiento a nivel de doctorado, y el modelo presume de nuevas puntuaciones altas en varios benchmarks de IA, como Humanity’s Last Exam, GPQA Diamond y MathArena Apex. Este impresionante conjunto de resultados hace que supere a modelos como el nuevo GPT-5.1 de OpenAI y Claude Sonnet 4.5 de Anthropic. 

Novedades de Gemini 3

Entonces, ¿qué aporta Gemini 3 respecto a su predecesor y al resto de modelos recién llegados? Además del gran salto en rendimiento, Google asegura que con Gemini 3 puedes "aprender, crear y planificar cualquier cosa". Palabras mayores. Veamos las nuevas funciones para entender qué significa: 

Rendimiento mejorado 

Una de las características estrella del nuevo Gemini 3 es su rendimiento de primera. Incluso sin el modo Deep Think, esta versión lidera la clasificación del benchmark Humanity’s Last Exam, con una puntuación del 37,2% sin herramientas (41% con Deep Think) frente al 26,5% de GPT-5.1. 

Gemini 3 no solo destaca en texto. Con un 23,4% en MathArena Apex, es el modelo de vanguardia con mayor puntuación en matemáticas. Del mismo modo, en Video-MMMU, un benchmark multimodal y multidisciplinar que evalúa la capacidad de los LMM para adquirir conocimientos a partir de vídeos educativos, logra un 87,6%, situándose de nuevo en lo más alto de la tabla. 

Sé que es fácil dejarse llevar por los números de los benchmarks y que la verdadera prueba debería centrarse en la utilidad, pero Gemini 3 Pro es claramente un salto importante en el rendimiento de los LLM.  

¿Qué es el modo Gemini 3 Deep Think?

Como vimos en Gemini 2.5 Pro, el modo Gemini 3 Deep Think utiliza pensamiento en paralelo y aprendizaje por refuerzo para mejorar notablemente las respuestas (a costa de ser más lento). Deep Think hace que Gemini sea más detallado, creativo y "reflexivo".

Con Gemini 3 Deep Think vemos mejoras respecto a Gemini 3 Pro en modo no-think en áreas como razonamiento, conocimiento científico y puzles de razonamiento visual. En teoría, Deep Think debería resolver mejor retos nuevos y poco familiares.  

Deep Think está actualmente en fase de evaluación, lo que significa que se está probando antes de que esté disponible para suscriptores de Google AI Ultra "en las próximas semanas". 

Multimodalidad real

Gemini 3 estrena una arquitectura multimodal que procesa texto, imagen, audio, vídeo y código en una única pila de transformers en lugar de hacerlo con codificadores separados. 

Esta unificación permite un razonamiento verdaderamente entre modalidades. Gemini 3 puede interpretar un boceto y generar código funcional, o analizar un vídeo y explicar sus conceptos científicos. Sus resultados en Video-MMMU y MMMU-Pro confirman un gran salto en comprensión espacial y visual. Al igual que Gemini 2.5 Pro, también tiene una ventana de contexto de un millón de tokens, por lo que puede conectar ideas a través de entradas amplias y diversas.

Creatividad con agentes

Gemini 3 pasa de la generación pasiva a la creación con agentes, impulsada por nuevos avances en uso de herramientas, planificación y vibe coding. La arquitectura del modelo admite bucles de razonamiento de largo alcance que le permiten planificar, ejecutar y validar flujos de trabajo de varios pasos, como programar un juego jugable o crear una interfaz interactiva, todo a partir de un único prompt.

Estas capacidades también se despliegan ahora a través del recién anunciado Google Antigravity, una plataforma de desarrollo donde los agentes tienen acceso directo al editor, la terminal y el navegador. Es el primer lanzamiento de Gemini diseñado para operar como co-desarrollador, usando autonomía estructurada e integración de herramientas en tiempo real para convertir ideas creativas en sistemas funcionales.

¿Aprender, crear y planificar cualquier cosa? 

Google ofrece varios ejemplos de cómo el nuevo modelo puede ayudarte a aprender, crear y planificar. 

El foco está muy puesto en las mejoras multimodales; en la capacidad de Gemini para entender y crear información en texto, imágenes, vídeo, audio y código. 

Con el vibe coding en boca de muchos últimamente, Gemini 3 debería facilitar aún más que los desarrolladores lleven ideas a producción. Google afirma que destaca en generación one-shot, es decir, que puedes obtener resultados de alta calidad con un único prompt. También maneja instrucciones complejas, clave si quieres que tus proyectos se sientan vivos y reactivos.

Gemini 3 está disponible para que los desarrolladores empiecen a crear proyectos con agentes en Google AI Studio, Vertex AI, Gemini CLI y el recién anunciado Google Antigravity (más sobre esto en un momento). 

Una última afirmación, bastante llamativa: Gemini 3 Pro puede mantener el uso de herramientas y la toma de decisiones de forma consistente durante un año simulado de operación. Si tienes una suscripción a Google AI Ultra, podrás acceder de inmediato a la nueva función experimental Gemini Agent, que te ayuda a crear agentes de múltiples pasos capaces de aprovechar estas funciones. 

Ejemplos de Gemini 3 Pro 

Gracias a su ventana de contexto de 1 millón de tokens, Gemini 2.5 Pro ha sido durante mucho tiempo uno de mis favoritos, así que tenía ganas de ver qué puede hacer Gemini 3 con un rendimiento multimodal mejorado en la misma ventana de contexto. Para empezar, aquí van unas pruebas:

Juego sencillo inspirado en Half-Life 3

Como probamos con Gemini 2.5, con un prompt de unas 10 palabras conseguí que Gemini 3 Pro creara un juego de desplazamiento lateral inspirado en Half-Life 3. Este fue el prompt: Make me a simple side-scrolling Half-Life 3-inspired game

Con poco tiempo de “pensamiento” y un tiempo de codificación similar, Gemini 3 Pro (a través de AI Studio) fue capaz de crear algo bastante sólido teniendo en cuenta lo escueto del prompt. Funciona, es un side-scroller y está claramente inspirado en el material original.

Aquí tienes el vídeo del resultado:

Tras ese experimento, quise probar algo más clásico. Concretamente, pensé en el juego del dinosaurio de Chrome que aparece cuando abres el navegador sin conexión a internet. 

Make me a simple side-scrolling game like the Chrome dinosaur that jumps over cactuses when the internet is down.

Y nació Gemini Runner:

Los pequeños detalles me ganaron. Gemini Runner tenía el mismo cielo nocturno estrellado, que ni siquiera estaba en el prompt. Y cuando perdía, decía “Extinct”.

Capacidades multimodales

Para probar las capacidades multimodales, subí un dibujo hecho por un niño de seis años.

Luego le pedí que convirtiera la escena en un juego sencillo. Este fue el prompt que utilicé:

Generate a simple browser game using the elements in this image. Base the game on what’s shown.

Tuve cuidado de no especificar nada de la imagen porque quería ver si era capaz de interpretar el contenido visual y generar un juego a partir de lo que veía.

El resultado fue un pequeño juego llamado Snowy’s Day en el que podías mover el monigote para recoger copos de nieve que caían. 

Como ves, los elementos del juego se extrajeron directamente de la imagen. Me impresionó la fidelidad al espíritu del dibujo, aunque no era el juego más divertido del mundo. Aunque quizá sí lo sea para un niño de seis años.

Un detalle: Gemini entendió que la imagen era nieve. Me sentí un poco mal porque yo pensaba que eran estrellas.

Benchmarks de Gemini 3 

Google ha compartido datos extensos de benchmarks tanto para Gemini 3 Pro como para Gemini Deep Think, y los resultados son impresionantes en todos los frentes. 

Benchmarks de Gemini 3 Pro 

En cuanto a capacidad de razonamiento puro, Gemini 3 Pro muestra lo que Google denomina “razonamiento a nivel de doctorado”. Estos son los resultados más destacados:

Razonamiento visual

El razonamiento visual da un salto enorme. 

  • En ARC-AGI-2, Gemini 3 Pro logra un 31,1%. Es un salto enorme desde el 4,9% de Gemini 2.5 Pro y se sitúa por delante de Claude Sonnet 4.5 y GPT-5.1. 
  • De forma similar, en ScreenSpot-Pro, que evalúa la comprensión de pantallas, Gemini 3 Pro alcanza el 72,7%, arrasando frente a Claude Sonnet 4.5 (36,2%) y GPT-5.1 (3,5%).

Ambos son avances enormes en la capacidad del modelo para entender y razonar sobre información visual.

Matemáticas

Con un 23,4% en MathArena Apex, Gemini 3 Pro arrasa con la competencia. Para ponerlo en contexto: Gemini 2.5 Pro obtuvo un 0,5%, Claude Sonnet 4.5 un 1,6% y GPT-5.1 apenas un 1,0%. Marca un nuevo estándar para modelos de vanguardia en razonamiento matemático.

Planificación a largo plazo

Para medir la planificación a largo plazo existe un benchmark llamado Vending-Bench 2 que simula gestionar durante un año un negocio de máquinas expendedoras. El modelo debe tomar decisiones continuas sobre inventario, precios y demás. Evalúa si una IA puede mantener decisiones coherentes y racionales a lo largo de miles de elecciones secuenciales sin perder sus objetivos ni volverse errática.

En este benchmark, Gemini 3 Pro logra un patrimonio neto medio de 5.478,16 $. Compáralo con Claude Sonnet 4.5 (3.838,74 $) y GPT-5.1 (1.473,43 $). Puede sonar a benchmark rebuscado, pero para agentes de IA que deban gestionar tareas durante días o semanas, esta fiabilidad importa.

Otros benchmarks

Gemini 3 Pro muestra un rendimiento sólido en un amplio abanico de pruebas adicionales. Lidera en comprensión multimodal (MMMU-Pro), comprensión de vídeo (Video-MMMU), razonamiento con gráficos (CharXiv) y programación competitiva (LiveCodeBench Pro).

Una excepción notable: Claude Sonnet 4.5 supera por poco a Gemini 3 Pro en SWE-Bench Verified, un benchmark de ingeniería de software.

Benchmarks del modo Gemini 3 Deep Think

Ahora, veamos los benchmarks de Gemini Deep Think, el modo de razonamiento mejorado que actualmente evalúan los equipos de seguridad antes de que esté disponible para suscriptores de Google AI Ultra en las próximas semanas.

Quizá te preguntes: si Gemini 3 Pro ya lidera los rankings, ¿por qué importa el modo Deep Think? Porque algunos problemas se benefician de un tiempo de razonamiento extendido. Deep Think emplea razonamiento paralelo y prolongado para dedicar más computación a tareas especialmente complejas. Está pensado para tardar más, pero en los problemas más duros, ese tiempo extra se traduce en mejores resultados, como reflejan estos benchmarks:

Resolución de problemas inéditos

El resultado de ARC-AGI-2 es, para mí, el más llamativo. Gemini 3 con modo Deep Think alcanza un 45,1% en ARC-AGI-2. (Es la versión oficial y verificada del benchmark asociada a la competición ARC Prize). En esta prueba, se permitió al modelo escribir y ejecutar código como herramienta de razonamiento, usando la programación para pensar los problemas.

¿Por qué importa? ARC-AGI-2 evalúa específicamente la capacidad del modelo para resolver retos nuevos y desconocidos. Son problemas que nunca ha visto y que no puede resolver por simple patrón a partir del entrenamiento. Históricamente, esto ha sido de lo más difícil para las IAs, así que una buena puntuación sugiere razonamiento genuino y no memorización.

Preguntas extremadamente difíciles

El modo Deep Think logra un 37,5% sin usar herramientas en Humanity’s Last Exam. Y con Deep Think activado, sube al 41,0%. Como referencia, GPT-5.1 obtuvo un 26,5%. 

Este benchmark es fascinante porque está diseñado para evaluar conocimiento y razonamiento en el límite de la comprensión humana. Piensa en problemas extremadamente difíciles que requieren una gran pericia. Que Gemini 3, usando Deep Think, responda correctamente más de un tercio de estas preguntas sugiere que no solo recita información, sino que razona sobre cuestiones muy complejas y ambiguas.

Ciencia a nivel de posgrado

Deep Think consigue una A - 91,9% - en GPQA Diamond, un benchmark de preguntas de ciencia a nivel de posgrado. El propio Deep Think empuja aún más la puntuación hasta el 93,8%. Aunque el 91,9% ya impresiona, lo interesante es que representa una base sobre la que Deep Think aún puede mejorar.

¿Cómo puedo acceder a Gemini 3?

Gemini 3 Pro ya está disponible en múltiples plataformas. Puedes usarlo de inmediato en la app de Gemini. También impulsa el modo de IA en la Búsqueda, así que puede que estés interactuando con Gemini 3 sin darte cuenta.

Si eres desarrollador, puedes acceder a Gemini 3 Pro a través de la API de Gemini en Google AI Studio, Vertex AI y Gemini CLI. También está disponible en la recién anunciada plataforma Google Antigravity y en varias herramientas de terceros como Cursor, GitHub, JetBrains, Manus y Replit.

Los suscriptores de Google AI Ultra tienen acceso a Gemini 3 Pro, junto con la función experimental Gemini Agent para crear agentes de múltiples pasos. Deep Think está actualmente en evaluación con los equipos de seguridad y estará disponible para suscriptores Ultra en las próximas semanas, una vez completadas las evaluaciones adicionales de seguridad.

Para estudiantes, Google ha presentado un plan gratuito de un año que ofrece acceso a Gemini 3 Pro, subidas ilimitadas de imágenes, 2 TB de almacenamiento y herramientas adicionales como NotebookLM.

Cómo está usando Google Gemini 3 

Gemini 3 Pro ya está en marcha y Google ya lo está utilizando en dos funciones clave:

AI Overviews en Google Search 

Google está tan convencido de este nuevo modelo que da el inusual paso de integrarlo directamente en la Búsqueda. Aunque los AI Overviews se han ido extendiendo desde abril, Gemini 3 Pro impulsará estos resúmenes desde el primer día. 

Gemini 3 y Google Antigravity 

Otra parte muy interesante del anuncio es la inclusión de una nueva plataforma de desarrollo con agentes, Google Antigravity. 

Esta herramienta se apoya en el razonamiento, el uso de herramientas y las capacidades de programación con agentes de Gemini 3. Google promete que se sentirá familiar, como un IDE con IA, pero con agentes que pueden acceder directamente al editor, la terminal y el navegador para ayudarte a planificar, escribir y comprobar proyectos complejos por su cuenta. 

Antigravity se conectará con Gemini 3 Pro, el modelo Gemini 2.5 Computer Use para control del navegador y Nano Banana (Gemini 2.5 Image) para edición de imágenes.

Reflexiones finales 

Con este lanzamiento, Google lanza un mensaje claro: ha vuelto a la carrera por el modelo de IA más capaz y lo está distribuyendo rápido y a gran escala en todo su ecosistema. Por especificaciones, es difícil no darles la razón: Gemini 3 Pro se siente como el mejor modelo de IA del mundo en comprensión multimodal.

Google, como siempre, parte con ventaja. Su infraestructura cloud, sus chips a medida y su pila de IA verticalmente integrada se refuerzan mutuamente para ofrecer un rendimiento al alcance de pocos competidores. Como las mejoras abarcan razonamiento, programación, comprensión multimodal y planificación a largo plazo, todo apunta a avances de base en la arquitectura de Gemini con Gemini 3 Pro. Además, parece que Google construye con casos de uso empresariales concretos en mente, así que las formas en que vamos a usar la IA se están diversificando y volviéndose más interesantes a gran velocidad.

Si necesitas ponerte al día con todo lo relacionado con la IA, te recomiendo empezar por el itinerario de habilidades AI Fundamentals.

Gemini 3: preguntas frecuentes

¿Cuál es la diferencia entre Gemini 3 Pro y Gemini 3 Deep Think?

Gemini 3 Pro es el modelo principal disponible en las apps y plataformas para desarrolladores de Google, optimizado para el uso diario. Deep Think es un modo opcional que permite un razonamiento más avanzado y en varios pasos, aunque más lento, disponible para usuarios premium cuando Google complete las pruebas de seguridad.

¿Para qué sirve la ventana de contexto de 1 millón de tokens?

Permite que Gemini 3 procese entradas masivas, como artículos de investigación completos, bases de código enteras o transcripciones de vídeo largas, sin tener que fragmentarlas, logrando un razonamiento más profundo y coherente sobre conjuntos de datos grandes.

¿Cómo puedo probar Gemini 3 Pro gratis?

Gemini 3 Pro está disponible para todos en la app de Gemini y para suscriptores de Google AI Pro y Ultra. También impulsa el modo de IA en la búsqueda. Si eres desarrollador, puedes acceder a la API en AI Studio, así como en la nueva plataforma de desarrollo con agentes, Google Antigravity. Los estudiantes pueden obtener un plan Gemini Pro gratuito de un año, que incluye acceso a Gemini 3 Pro, 2 TB de almacenamiento en Google Drive y subidas ilimitadas de imágenes.

¿Qué es Google Antigravity y en qué se diferencia de AI Studio o Vertex AI?

Antigravity es la nueva plataforma de desarrollo dirigida por agentes de Google, una especie de IDE con IA donde los agentes pueden programar, probar y usar herramientas directamente. AI Studio y Vertex AI son APIs y plataformas para desplegar modelos; Antigravity lleva esas capacidades a un espacio práctico y colaborativo.

¿Por qué importan las puntuaciones de benchmarks para Gemini 3 Pro?

Los benchmarks ofrecen evidencia medible del rendimiento del modelo en razonamiento, programación y multimodalidad. Ayudan a evaluar qué modelo encaja mejor con tus necesidades, aunque las pruebas en casos reales siguen siendo esenciales porque los benchmarks no cubren todos los usos.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritora y editora de contenidos en el ámbito de la tecnología educativa. Comprometido con la exploración de tendencias de datos y entusiasmado con el aprendizaje de la ciencia de datos.


Josef Waples's photo
Author
Josef Waples
Temas
Inteligencia Artificial
Grandes modelos lingüísticos

Aprende con DataCamp

Curso

Creación de agentes de IA con Google ADK

1 h
7.5K
Crea un asistente de atención al cliente paso a paso con el kit de desarrollo de agentes (ADK) de Google.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

¿Qué es Mistral Large 2? Cómo funciona, casos de uso y más

Mistral Large 2 es el último modelo lingüístico de Mistral AI, que compite con modelos como GPT-4o, Llama 3.1 y Claude 3 Opus.
Ryan Ong's photo

Ryan Ong

8 min

blog

Todo lo que sabemos sobre GPT-5

Descubre cómo GPT-5 evolucionará hasta convertirse en un sistema unificado con funciones avanzadas, cuyo lanzamiento está previsto para el verano de 2025, basándose en la última hoja de ruta de OpenAI y en la historia de GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Tutorial de DeepSeek-Coder-V2: Ejemplos, instalación, puntos de referencia

DeepSeek-Coder-V2 es un modelo de lenguaje de código de código abierto que rivaliza con el rendimiento de GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B o Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Tutorial

Guía introductoria para el ajuste preciso de los LLM

El ajuste preciso de los grandes modelos lingüísticos (LLM) ha revolucionado el procesamiento del lenguaje natural (PLN) y ofrece capacidades sin precedentes en tareas como la traducción lingüística, el análisis del sentimiento y la generación de textos. Este enfoque transformador aprovecha modelos preentrenados como el GPT-2 y mejora su rendimiento en dominios específicos mediante el proceso de ajuste preciso.
Josep Ferrer's photo

Josep Ferrer

11 min

Tutorial

Ajuste fino de GPT-3 mediante la API OpenAI y Python

Libere todo el potencial de GPT-3 mediante el ajuste fino. Aprenda a utilizar la API de OpenAI y Python para mejorar este modelo de red neuronal avanzado para su caso de uso específico.
Zoumana Keita 's photo

Zoumana Keita

12 min

Ver MásVer Más