Curso
Cuando el equipo de desarrollo de Google bautizó internamente su modelo de generación de imágenes como "Nano Banana", el nombre se quedó. La versión pro se lanzó el 20 de noviembre de 2025 y corrige problemas que frustraban a quienes trabajaban con generadores de imágenes de IA anteriores.
Este tutorial te explica cómo funciona Nano Banana Pro, te guía por el uso de la API y te ayuda a decidir cuándo usarlo en lugar de la versión no pro.
¿Qué es Nano Banana Pro?
Nano Banana Pro (gemini-3-pro-image-preview) se basa en Gemini 2.5 Flash Image (el Nano Banana original de mi tutorial anterior) con mejoras significativas.

El modelo destaca en cuatro aspectos que a las versiones anteriores se les resistían:
- Renderizado de texto: texto nítido y legible en varios idiomas y tipografías (adiós a las letras deformadas)
- Controles de estudio: ajusta iluminación, ángulos de cámara y profundidad de campo como en un estudio fotográfico
- Consistencia de personajes: mantiene el mismo personaje a través de 5 personas o 14 objetos en escenas distintas
- Conocimiento del mundo real: integración con Google Search para datos precisos en contenido educativo

El modelo admite resoluciones 1K, 2K y 4K con relaciones de aspecto como 1:1, 16:9, 9:16 y 21:9. Cada imagen incluye la marca de agua invisible SynthID. Puedes probarlo gratis desde la app de Gemini, pero el acceso por API requiere configurar la facturación.
Antes de probar nada, necesitas acceso al modelo. Veamos tus opciones.
Cómo acceder a Nano Banana Pro
Puedes probar Nano Banana Pro gratis desde la app de Gemini en gemini.google.com. Solo inicia sesión con tu cuenta de Google y empieza a generar imágenes. El acceso gratuito tiene límites de uso (Google no ha publicado cifras exactas), así que si planeas generar muchas imágenes o crear aplicaciones, necesitarás acceso por API mediante Google AI Studio o Vertex AI. Esto requiere configurar la facturación, pero te da costes previsibles y límites más altos.
Conseguir acceso a la API
Ve a Google AI Studio e inicia sesión. Necesitarás crear o vincular un proyecto de Google Cloud y luego habilitar la facturación (se requiere tarjeta de crédito). Cuando lo tengas, genera una clave de API desde la sección API keys.
Guarda tu clave de API de forma segura. Crea un archivo .env en el directorio del proyecto y añade:
GEMINI_API_KEY=your_key_here
Nunca hagas commit de este archivo al control de versiones. Añade .env a tu .gitignore.
Desglose de precios
El modelo cobra por imagen generada:
- Nivel estándar: 0,134 $ por imagen 1K o 2K, 0,24 $ por imagen 4K
- Nivel por lotes: 0,067 $ por imagen 1K/2K, 0,12 $ por imagen 4K (procesa de forma asíncrona a menor coste)
Como referencia, con 10 $ obtienes aproximadamente 75 imágenes 1K de calidad estándar o 42 imágenes 4K. Generar y editar cuesta lo mismo.
Los límites de tasa varían según tu nivel de cuenta y región (consulta la documentación oficial de precios para los límites actuales). Las empresas pueden acceder al modelo a través de Vertex AI con funciones adicionales de seguridad y cumplimiento.
Con el acceso configurado, vamos a generar tu primera imagen y ver la edición conversacional en acción.
Primeros pasos: tu primera imagen
Es hora de generar imágenes y ver qué hace especial a Nano Banana Pro. Crearemos una escena cósmica impactante, la transformaremos conversacionalmente y luego la combinaremos con varias imágenes de referencia para una composición final.
Configurar tu entorno
Primero, instala los paquetes necesarios:
pip install google-genai python-dotenv pillow
Necesitarás google-genai para trabajar con los modelos Gemini, python-dotenv para cargar tu clave de API desde el archivo .env y pillow para manejar imágenes.
Cómo escribir prompts eficaces
Los buenos prompts para Nano Banana Pro combinan detalles específicos con términos de fotografía o diseño. En lugar de descripciones vagas, incluye elementos visuales concretos y referencias de estilo.
Un prompt sólido suele incluir:
- Detalles del sujeto: objetos, colores y composiciones concretas
- Iluminación: "luz natural suave", "hora dorada", "iluminación lateral dramática"
- Especificaciones de cámara: "poca profundidad de campo", "ángulo bajo", "plano general"
- Descriptores de estilo: "fotografía profesional", "cinematográfico", "diseño minimalista"
Generar tu primera imagen
Este es el código completo para generar una imagen:
import os
from google import genai
from google.genai import types
from dotenv import load_dotenv
# Load API key
load_dotenv()
client = genai.Client(api_key=os.getenv("GOOGLE_API_KEY"))
# Generate image
response = client.models.generate_content(
model="gemini-3-pro-image-preview",
contents="Vast cosmic nebula in deep space. Swirling purple and blue gas clouds with bright star clusters. Ethereal glow. Epic space photography. 16:9 cinematic composition. No planets visible.",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(
aspect_ratio="16:9",
image_size="1K"
),
)
)
# Save the image
for part in response.parts:
if image := part.as_image():
image.save("cosmic_base.png")
print("Image saved!")
Este código sigue el flujo básico de Nano Banana Pro. El método generate_content() se encarga de la generación. El parámetro response_modalities indica al modelo que devuelva texto e imágenes. En image_config controlas la salida: aspect_ratio define las dimensiones (16:9 en panorámico) y image_size la resolución (1K, 2K o 4K). La respuesta llega en partes, que iteras para extraer y guardar la imagen generada.
Esto genera una nebulosa cósmica impactante:

Ahora veamos cómo la edición conversacional transforma esta escena.
Edición conversacional en acción
En lugar de regenerar desde cero, puedes editar imágenes mediante conversación. Vamos a transformar la paleta de color de la nebulosa manteniendo su estructura:
# Load the base image
from PIL import Image
base_image = Image.open("cosmic_base.png")
# Create a chat session for editing
chat = client.chats.create(
model="gemini-3-pro-image-preview",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(
aspect_ratio="16:9",
image_size="1K"
),
)
)
# Edit: Transform colors
response = chat.send_message([
base_image,
"Transform this nebula to warm orange and red tones, like a different type of stellar nursery. Keep the same swirling structure and composition."
])
# Save edited image
for part in response.parts:
if image := part.as_image():
image.save("cosmic_orange.png")
Misma estructura de nebulosa, estado de ánimo completamente distinto:

Mezclar varias imágenes
Nano Banana Pro puede combinar hasta 14 imágenes de referencia manteniendo la consistencia. Vamos a unir nuestra nebulosa naranja con dos elementos adicionales: un cometa dramático y un antiguo monolito alienígena.
Primero, genera las dos imágenes de referencia:
# Generate comet reference
comet_response = client.models.generate_content(
model="gemini-3-pro-image-preview",
contents="Massive comet with bright glowing nucleus and long ion tail streaming behind. Detailed surface texture on comet head. Ethereal blue-white tail against black space. Dramatic cosmic photography.",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
)
)
# Save comet
for part in comet_response.parts:
if image := part.as_image():
image.save("comet.png")
Aquí tienes el cometa:

# Generate ancient alien monolith
monolith_response = client.models.generate_content(
model="gemini-3-pro-image-preview",
contents="Massive ancient alien monolith floating in space. Towering black rectangular obelisk with subtle geometric patterns. Mysterious glowing symbols etched on surface. 2001 Space Odyssey style. Epic scale.",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
)
)
# Save monolith
for part in monolith_response.parts:
if image := part.as_image():
image.save("monolith.png")
Y el antiguo monolito alienígena:

Ahora mezcla los tres elementos en una sola composición. El parámetro contents acepta una lista: tu prompt de texto primero, seguido de todas las imágenes que quieras combinar.
# Load all three images
nebula = Image.open("cosmic_orange.png")
comet = Image.open("comet.png")
monolith = Image.open("monolith.png")
# Blend them into one composition
blend_response = client.models.generate_content(
model="gemini-3-pro-image-preview",
contents=[
"Combine these images into one epic space scene. Place the ancient alien monolith in the right side, towering and mysterious. Show the bright comet with its glowing tail streaking diagonally across the left side. Keep the orange nebula as the dramatic backdrop. Cinematic space composition.",
nebula,
comet,
monolith
],
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
)
)
# Save final composition
for part in blend_response.parts:
if image := part.as_image():
image.save("cosmic_final.png")
La composición final combina los tres elementos sin fisuras:

Ahora que has aprendido a generar imágenes con el nuevo modelo y a aprovechar algunas de sus funciones, veamos sus cuatro diferencias frente a otros modelos.
Qué hace diferente a Nano Banana Pro
Ya has visto la generación básica de imágenes y la edición conversacional. Ahora analicemos cada capacidad en detalle y cómo funciona en la práctica.
Usaremos una función auxiliar para mantener los ejemplos de código limpios:
def generate_image(prompt, filename, aspect_ratio="16:9", size="1K", use_google_search=False):
config = types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(
aspect_ratio=aspect_ratio,
image_size=size
),
)
# Add Google Search grounding if requested
if use_google_search:
config.tools = [{"google_search": {}}]
response = client.models.generate_content(
model="gemini-3-pro-image-preview",
contents=prompt,
config=config
)
for part in response.parts:
if image := part.as_image():
image.save(f"{filename}.png")
return image
Esto reduce la repetición en los ejemplos y te muestra un patrón reutilizable para tus proyectos.
Avance en renderizado de texto
Históricamente, los generadores de imágenes de IA destrozaban el texto, lo que los hacía inútiles para tipografía, branding o diseño de interfaces. Nano Banana Pro soluciona esto.
Aquí tienes un póster de cine con varios elementos de texto:
# Generate movie poster with cast and credits
image = generate_image(
prompt="""Sci-fi movie poster. Large title "STELLAR HORIZON" at top. Actor names "SARAH CHEN" "MARCUS RODRIGUEZ" "AISHA WILLIAMS". Production credits "Directed by James Park" "Produced by Luna Studios" at bottom. Deep space background with nebula. Professional film poster typography. Crisp readable text.""",
filename="movie_poster"
)

Lo mismo funciona para interfaces web con múltiples elementos de texto:
# SaaS website hero section
image = generate_image(
prompt="""Modern SaaS website hero section. Large headline "Automate Your Workflow in Minutes" with subheadline "Connect your tools and boost productivity by 10x". Two buttons "Start Free Trial" and "Watch Demo". Trust badges showing "500K+ Users" "99.9% Uptime" "SOC 2 Certified". Clean typography. Gradient purple to blue background. Professional web design layout.""",
filename="saas_hero"
)

Incluso maneja texto multilingüe en la misma imagen:
# Conference poster with English and Japanese
image = generate_image(
prompt="""Tech conference poster. Top section English text: "GLOBAL AI SUMMIT 2025" "March 15-17, Tokyo". Bottom section Japanese text: "グローバルAIサミット2025" "3月15日-17日、東京". Modern geometric design. Vibrant gradient background blue to purple. Professional bilingual typography.""",
filename="multilingual_poster"
)

Los equipos de marketing pueden crear creatividades con mensajes claros, los diseñadores explorar tipografías sin maquetar a mano, las marcas generar wordmarks coherentes y los equipos de UI/UX maquetar interfaces con texto legible.
La claridad del texto es solo una parte. Veamos cómo controlar iluminación y ángulos de cámara.
Control a nivel de estudio
Nano Banana Pro te permite ajustar iluminación, ángulos de cámara, profundidad de campo y etalonaje de color conversacionalmente, conservando tu composición.
Empieza con una foto de producto frontal:
# Generate base product image
base_image = generate_image(
prompt="""Premium wireless earbuds with charging case. Front-facing straight-on view. Sleek matte black finish. Modern minimalist design. Clean white studio background. Professional product photography. Sharp focus throughout. Contemporary tech aesthetic.""",
filename="earbuds_front"
)

Ahora cambia el ángulo de cámara a vista cenital sin regenerar:
# Create chat for editing
chat = client.chats.create(
model="gemini-3-pro-image-preview",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
)
)
# Edit camera angle conversationally
edit_response = chat.send_message([
base_image,
"""Show these exact same wireless earbuds from bird's eye view, looking straight down from above. Keep the same earbuds and charging case. Overhead flat lay composition. Professional product photography."""
])
# Save edited image
for part in edit_response.parts:
if image := part.as_image():
image.save("earbuds_overhead.png")

Los fotógrafos de producto pueden probar ángulos sin re‑shootings, arquitectos mostrar edificios desde distintas perspectivas, interioristas visualizar espacios con varios puntos de vista y marketing crear variaciones para A/B testing.
Consistencia de personajes
Las mascotas de marca deben verse idénticas en todos los puntos de contacto. Las campañas requieren el mismo personaje en escenarios distintos. Las versiones anteriores fallaban en esto (aunque la base de Nano Banana ya era buena). Nano Banana Pro mejora aún más la identidad visual entre escenas.
Genera un elemento de logotipo de marca:
# Create brand logo
brand_logo = generate_image(
prompt="""Abstract geometric ribbon logo. Flowing infinity loop shape with metallic gradient silver to deep purple. Smooth curved surfaces. Elegant minimalist design. Clean white background. Premium brand identity element. Modern corporate aesthetic. No face. No eyes.""",
filename="ribbon_logo"
)

Usa la misma cinta en una interfaz de app móvil:
# Create chat for editing
chat = client.chats.create(
model="gemini-3-pro-image-preview",
config=types.GenerateContentConfig(
response_modalities=["TEXT", "IMAGE"],
image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
)
)
# Show logo in app interface
app_response = chat.send_message([
brand_logo,
"""Show this exact ribbon logo in a complete mobile app home screen. Top status bar with time and battery. Logo in header next to app name. Content cards below showing features. Bottom tab navigation with icons and labels. Modern mobile app UI. Gradient purple background. Professional startup app design. Full mobile interface layout."""
])
# Save
for part in app_response.parts:
if image := part.as_image():
image.save("ribbon_app.png")

Ahora muestra la misma cinta en merchandising físico:
# Show logo on merchandise
merch_response = chat.send_message([
brand_logo,
"""Show this exact ribbon logo on brand merchandise collection. Flat lay showing: white tote bag with logo, coffee mug with logo, t-shirt with logo printed on chest, product packaging box with logo. All items arranged together. Premium brand identity mockup. Minimalist aesthetic. Professional product photography. Same ribbon on each item."""
])
# Save
for part in merch_response.parts:
if image := part.as_image():
image.save("ribbon_merchandise.png")

Y llegamos a la función que cambia las reglas de juego en Nano Banana Pro: el anclaje factual mediante Google Search.
Conocimiento del mundo real en acción
Cuando habilitas el anclaje con Search, el modelo accede a información actual para garantizar exactitud en materiales educativos, documentación técnica y contenido basado en datos donde la corrección es crítica.
Activa Google Search para contenido educativo:
# Generate solar energy infographic with Search grounding
image = generate_image(
prompt="""Educational infographic explaining solar panel energy conversion. Show photovoltaic cells converting to DC power, then inverter converting to AC power for the grid. Clear labels and arrows.""",
filename="solar_infographic",
use_google_search=True # Enable Search for factual accuracy
)

El mismo anclaje funciona para diagramas técnicos:
# Generate neural network diagram with Search grounding
image = generate_image(
prompt="""Neural network architecture diagram. Left: 4 input nodes labeled "Input 1" "Input 2" "Input 3" "Input 4". Middle: two hidden layers each with 5 nodes labeled "Hidden Layer 1" and "Hidden Layer 2". Right: 3 output nodes labeled "Output 1" "Output 2" "Output 3". Connection lines between all layers. Clean technical illustration. Educational ML diagram. Professional data science aesthetic.""",
filename="ml_architecture",
use_google_search=True # Enable Search for accuracy
)

Creadores de contenido educativo, redactores técnicos, equipos de datos y divulgadores científicos pueden producir materiales y diagramas precisos sin un esfuerzo de verificación exhaustivo.
Estas cuatro funciones convierten a Nano Banana Pro en una herramienta versátil para flujos de trabajo profesionales. A continuación, compáralo directamente con el Nano Banana original para ver las mejoras.
Nano Banana Pro vs. Nano Banana base: ¿en qué se diferencian?
En esta sección, compararemos el modelo base Gemini 2.5 Flash Image con Gemini 3 Pro Image, es decir, Nano Banana base frente a la versión pro.
Aunque los ejemplos anteriores se centraban en casos de uso profesionales o educativos, aquí usaremos prompts del tipo "¡Soltemos la imaginación!". Al fin y al cabo, la mayoría de imágenes generadas suelen buscar dar salida a la creatividad sin límites de la mente humana. Este tipo de prompts ponen a prueba la capacidad de los modelos para convertir ideas descabelladas en arte.
Empecemos con este:
Geometric shapes staging a protest. Cubes holding signs reading "FREE THE SPHERES!" Triangles with banners "DOWN WITH FLATLAND!" A giant dodecahedron wearing a top hat giving a speech. Protest happening inside an M.C. Escher staircase. Floating equations as graffiti: "π > 3.14159". Pure mathematical chaos.

Este prompt prueba dos cosas: comprensión conceptual abstracta y renderizado de texto. El modelo base capta el tono lúdico, pero le cuesta hacer antropomórficas las figuras geométricas (dibujar caras en ellas). La versión pro renderiza texto nítido en las pancartas y mantiene el caos matemático surrealista. También dibuja la escalera de M. C. Escher con más precisión.
Prompt 2
Bold emblem/logo direction: a graphical, simplified, highly geometric icon of an ice hockey player in a powerful action pose with the hockey stick touching the ice, constructed entirely from sharp, angular, polygonal shards. Strict four-color palette (red, blue, yellow, white) on black, flat colors only (no gradients) for perfect reproduction as a logo or patch.

Nano Banana Pro es el claro ganador. El logo es nítido, profesional (sin texto innecesario) y realmente está construido con formas geométricas como se pedía. La versión base carece de la construcción geométrica limpia y añade elementos no deseados.
Prompt 3:
Mandelbrot's set drawn with extreme mathematical accuracy for a 1:1 wallpaper, fractal art

El modelo pro representa el fractal con una precisión impresionante. Aún no es perfecto: se sacrifica algo de exactitud matemática en los bordes en favor de la calidad artística, pero hizo un trabajo muy superior al modelo base, que dibujó algo completamente distinto. No obstante, el pro añadió elementos no solicitados: recuentos de iteraciones, ejes imaginario y real y, por algún motivo, un marco de ventana al estilo Windows XP.
Cuándo optar por la versión pro
Pro supera generalmente a base, pero la diferencia depende del tipo de prompt. El renderizado de texto y la precisión geométrica muestran las mayores mejoras (mira los ejemplos del logo de hockey y la escalera geométrica). El contenido técnico como el conjunto de Mandelbrot también se beneficia de la precisión de Pro.
Pro cuesta 0,134 $ por imagen 1K/2K frente a aproximadamente la mitad en base. Para cientos de iteraciones en proyectos personales, base está bien. Para entregables profesionales o cualquier cosa que requiera texto preciso, Pro justifica el coste. La edición conversacional hace que Pro sea más rentable cuando necesitas resultados precisos, porque refinas en vez de regenerar.
Pro también admite Google Search para anclaje factual, lo que lo hace mejor para cualquier imagen que implique conocimiento del mundo real.
Conclusión
Has aprendido a generar y editar imágenes con Nano Banana Pro, has explorado sus cuatro funciones clave y has visto cómo se compara con el modelo base. La API te ofrece edición conversacional, mezcla multiimagen, texto preciso y anclaje con Google Search para contenido factual.
Empieza con el nivel gratuito en la app de Gemini para probar prompts y ver qué funciona en tus proyectos. La edición conversacional suele ahorrar dinero porque refinas imágenes existentes en lugar de regenerarlas desde cero.
Para más detalles técnicos y las últimas novedades, consulta la documentación oficial a medida que Google siga ampliando las capacidades del modelo.
Soy creador de contenidos sobre ciencia de datos con más de 2 años de experiencia y uno de los mayores seguimientos en Medium. Me gusta escribir artículos detallados sobre IA y ML con un toque sarcástico, porque hay que darle algo de vidilla al tema. He publicado más de 130 artículos y un curso en DataCamp, y tengo otro en marcha. Mis contenidos han sido vistos por más de 5 millones de personas; 20.000 de ellas se convirtieron en seguidores tanto en Medium como en LinkedIn.



