Ir al contenido principal

Nano Banana Pro: el nuevo modelo dominante de generación de imágenes de Google

Descubre cómo Nano Banana Pro de Google, también llamado Gemini 3 Pro Image, mejora la generación de imágenes con controles de estudio, personajes consistentes y verificación con datos reales.
Actualizado 23 sept 2026  · 9 min leer

Explorar con IA

ChatGPTClaudePerplexity

Cuando el equipo de desarrollo de Google bautizó internamente su modelo de generación de imágenes como "Nano Banana", el nombre se quedó. La versión pro se lanzó el 20 de noviembre de 2025 y corrige problemas que frustraban a quienes trabajaban con generadores de imágenes de IA anteriores.

Este tutorial te explica cómo funciona Nano Banana Pro, te guía por el uso de la API y te ayuda a decidir cuándo usarlo en lugar de la versión no pro.

¿Qué es Nano Banana Pro?

Nano Banana Pro (gemini-3-pro-image-preview) se basa en Gemini 2.5 Flash Image (el Nano Banana original de mi tutorial anterior) con mejoras significativas.

Ejemplo divertido de imagen de Nano Banana Pro

El modelo destaca en cuatro aspectos que a las versiones anteriores se les resistían:

  • Renderizado de texto: texto nítido y legible en varios idiomas y tipografías (adiós a las letras deformadas)
  • Controles de estudio: ajusta iluminación, ángulos de cámara y profundidad de campo como en un estudio fotográfico
  • Consistencia de personajes: mantiene el mismo personaje a través de 5 personas o 14 objetos en escenas distintas
  • Conocimiento del mundo real: integración con Google Search para datos precisos en contenido educativo

El modelo admite resoluciones 1K, 2K y 4K con relaciones de aspecto como 1:1, 16:9, 9:16 y 21:9. Cada imagen incluye la marca de agua invisible SynthID. Puedes probarlo gratis desde la app de Gemini, pero el acceso por API requiere configurar la facturación.

Antes de probar nada, necesitas acceso al modelo. Veamos tus opciones.

Cómo acceder a Nano Banana Pro

Puedes probar Nano Banana Pro gratis desde la app de Gemini en gemini.google.com. Solo inicia sesión con tu cuenta de Google y empieza a generar imágenes. El acceso gratuito tiene límites de uso (Google no ha publicado cifras exactas), así que si planeas generar muchas imágenes o crear aplicaciones, necesitarás acceso por API mediante Google AI Studio o Vertex AI. Esto requiere configurar la facturación, pero te da costes previsibles y límites más altos.

Conseguir acceso a la API

Ve a Google AI Studio e inicia sesión. Necesitarás crear o vincular un proyecto de Google Cloud y luego habilitar la facturación (se requiere tarjeta de crédito). Cuando lo tengas, genera una clave de API desde la sección API keys.

Guarda tu clave de API de forma segura. Crea un archivo .env en el directorio del proyecto y añade:

GEMINI_API_KEY=your_key_here

Nunca hagas commit de este archivo al control de versiones. Añade .env a tu .gitignore.

Desglose de precios

El modelo cobra por imagen generada:

  • Nivel estándar: 0,134 $ por imagen 1K o 2K, 0,24 $ por imagen 4K
  • Nivel por lotes: 0,067 $ por imagen 1K/2K, 0,12 $ por imagen 4K (procesa de forma asíncrona a menor coste)

Como referencia, con 10 $ obtienes aproximadamente 75 imágenes 1K de calidad estándar o 42 imágenes 4K. Generar y editar cuesta lo mismo.

Los límites de tasa varían según tu nivel de cuenta y región (consulta la documentación oficial de precios para los límites actuales). Las empresas pueden acceder al modelo a través de Vertex AI con funciones adicionales de seguridad y cumplimiento.

Con el acceso configurado, vamos a generar tu primera imagen y ver la edición conversacional en acción.

Primeros pasos: tu primera imagen

Es hora de generar imágenes y ver qué hace especial a Nano Banana Pro. Crearemos una escena cósmica impactante, la transformaremos conversacionalmente y luego la combinaremos con varias imágenes de referencia para una composición final.

Configurar tu entorno

Primero, instala los paquetes necesarios:

pip install google-genai python-dotenv pillow

Necesitarás google-genai para trabajar con los modelos Gemini, python-dotenv para cargar tu clave de API desde el archivo .env y pillow para manejar imágenes.

Cómo escribir prompts eficaces

Los buenos prompts para Nano Banana Pro combinan detalles específicos con términos de fotografía o diseño. En lugar de descripciones vagas, incluye elementos visuales concretos y referencias de estilo.

Un prompt sólido suele incluir:

  • Detalles del sujeto: objetos, colores y composiciones concretas
  • Iluminación: "luz natural suave", "hora dorada", "iluminación lateral dramática"
  • Especificaciones de cámara: "poca profundidad de campo", "ángulo bajo", "plano general"
  • Descriptores de estilo: "fotografía profesional", "cinematográfico", "diseño minimalista"

Generar tu primera imagen

Este es el código completo para generar una imagen:

import os
from google import genai
from google.genai import types
from dotenv import load_dotenv

# Load API key
load_dotenv()
client = genai.Client(api_key=os.getenv("GOOGLE_API_KEY"))

# Generate image
response = client.models.generate_content(
    model="gemini-3-pro-image-preview",
    contents="Vast cosmic nebula in deep space. Swirling purple and blue gas clouds with bright star clusters. Ethereal glow. Epic space photography. 16:9 cinematic composition. No planets visible.",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(
            aspect_ratio="16:9",
            image_size="1K"
        ),
    )
)

# Save the image
for part in response.parts:
    if image := part.as_image():
        image.save("cosmic_base.png")
        print("Image saved!")

Este código sigue el flujo básico de Nano Banana Pro. El método generate_content() se encarga de la generación. El parámetro response_modalities indica al modelo que devuelva texto e imágenes. En image_config controlas la salida: aspect_ratio define las dimensiones (16:9 en panorámico) y image_size la resolución (1K, 2K o 4K). La respuesta llega en partes, que iteras para extraer y guardar la imagen generada.

Esto genera una nebulosa cósmica impactante:

Nebulosa cósmica generada por Nano Banana Pro con nubes de gas moradas y azules y cúmulos estelares en el espacio profundo

Ahora veamos cómo la edición conversacional transforma esta escena.

Edición conversacional en acción

En lugar de regenerar desde cero, puedes editar imágenes mediante conversación. Vamos a transformar la paleta de color de la nebulosa manteniendo su estructura:

# Load the base image
from PIL import Image
base_image = Image.open("cosmic_base.png")

# Create a chat session for editing
chat = client.chats.create(
    model="gemini-3-pro-image-preview",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(
            aspect_ratio="16:9",
            image_size="1K"
        ),
    )
)

# Edit: Transform colors
response = chat.send_message([
    base_image,
    "Transform this nebula to warm orange and red tones, like a different type of stellar nursery. Keep the same swirling structure and composition."
])

# Save edited image
for part in response.parts:
    if image := part.as_image():
        image.save("cosmic_orange.png")

Misma estructura de nebulosa, estado de ánimo completamente distinto:

Nebulosa cósmica transformada a tonos cálidos naranjas y rojos con la edición conversacional de Nano Banana Pro

Mezclar varias imágenes

Nano Banana Pro puede combinar hasta 14 imágenes de referencia manteniendo la consistencia. Vamos a unir nuestra nebulosa naranja con dos elementos adicionales: un cometa dramático y un antiguo monolito alienígena.

Primero, genera las dos imágenes de referencia:

# Generate comet reference
comet_response = client.models.generate_content(
    model="gemini-3-pro-image-preview",
    contents="Massive comet with bright glowing nucleus and long ion tail streaming behind. Detailed surface texture on comet head. Ethereal blue-white tail against black space. Dramatic cosmic photography.",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
    )
)

# Save comet
for part in comet_response.parts:
    if image := part.as_image():
        image.save("comet.png")

Aquí tienes el cometa:

Cometa con núcleo brillante y larga cola iónica generado por Nano Banana Pro para la mezcla multiimagen

# Generate ancient alien monolith
monolith_response = client.models.generate_content(
    model="gemini-3-pro-image-preview",
    contents="Massive ancient alien monolith floating in space. Towering black rectangular obelisk with subtle geometric patterns. Mysterious glowing symbols etched on surface. 2001 Space Odyssey style. Epic scale.",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
    )
)

# Save monolith
for part in monolith_response.parts:
    if image := part.as_image():
        image.save("monolith.png")

Y el antiguo monolito alienígena:

Monolito alienígena antiguo con símbolos brillantes en el espacio generado por Nano Banana Pro como referencia para la mezcla

Ahora mezcla los tres elementos en una sola composición. El parámetro contents acepta una lista: tu prompt de texto primero, seguido de todas las imágenes que quieras combinar.

# Load all three images
nebula = Image.open("cosmic_orange.png")
comet = Image.open("comet.png")
monolith = Image.open("monolith.png")

# Blend them into one composition
blend_response = client.models.generate_content(
    model="gemini-3-pro-image-preview",
    contents=[
        "Combine these images into one epic space scene. Place the ancient alien monolith in the right side, towering and mysterious. Show the bright comet with its glowing tail streaking diagonally across the left side. Keep the orange nebula as the dramatic backdrop. Cinematic space composition.",
        nebula,
        comet,
        monolith
    ],
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
    )
)

# Save final composition
for part in blend_response.parts:
    if image := part.as_image():
        image.save("cosmic_final.png")

La composición final combina los tres elementos sin fisuras:

Escena espacial épica que combina nebulosa, cometa y monolito alienígena con la capacidad multiimagen de Nano Banana Pro

Ahora que has aprendido a generar imágenes con el nuevo modelo y a aprovechar algunas de sus funciones, veamos sus cuatro diferencias frente a otros modelos.

Qué hace diferente a Nano Banana Pro

Ya has visto la generación básica de imágenes y la edición conversacional. Ahora analicemos cada capacidad en detalle y cómo funciona en la práctica.

Usaremos una función auxiliar para mantener los ejemplos de código limpios:

def generate_image(prompt, filename, aspect_ratio="16:9", size="1K", use_google_search=False):
    
    config = types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(
            aspect_ratio=aspect_ratio,
            image_size=size
        ),
    )
    
    # Add Google Search grounding if requested
    if use_google_search:
        config.tools = [{"google_search": {}}]
    
    response = client.models.generate_content(
        model="gemini-3-pro-image-preview",
        contents=prompt,
        config=config
    )

    for part in response.parts:
        if image := part.as_image():
            image.save(f"{filename}.png")
            return image

Esto reduce la repetición en los ejemplos y te muestra un patrón reutilizable para tus proyectos.

Avance en renderizado de texto

Históricamente, los generadores de imágenes de IA destrozaban el texto, lo que los hacía inútiles para tipografía, branding o diseño de interfaces. Nano Banana Pro soluciona esto.

Aquí tienes un póster de cine con varios elementos de texto:

# Generate movie poster with cast and credits
image = generate_image(
    prompt="""Sci-fi movie poster. Large title "STELLAR HORIZON" at top. Actor names "SARAH CHEN" "MARCUS RODRIGUEZ" "AISHA WILLIAMS". Production credits "Directed by James Park" "Produced by Luna Studios" at bottom. Deep space background with nebula. Professional film poster typography. Crisp readable text.""",
    filename="movie_poster"
)

Póster de ciencia ficción con texto claro y legible generado por Nano Banana Pro con título, reparto y créditos

Lo mismo funciona para interfaces web con múltiples elementos de texto:

# SaaS website hero section
image = generate_image(
    prompt="""Modern SaaS website hero section. Large headline "Automate Your Workflow in Minutes" with subheadline "Connect your tools and boost productivity by 10x". Two buttons "Start Free Trial" and "Watch Demo". Trust badges showing "500K+ Users" "99.9% Uptime" "SOC 2 Certified". Clean typography. Gradient purple to blue background. Professional web design layout.""",
    filename="saas_hero"
)

Sección hero de sitio SaaS con titulares, botones y sellos de confianza que demuestran el renderizado de texto en diseño UI de Nano Banana Pro

Incluso maneja texto multilingüe en la misma imagen:

# Conference poster with English and Japanese
image = generate_image(
    prompt="""Tech conference poster. Top section English text: "GLOBAL AI SUMMIT 2025" "March 15-17, Tokyo". Bottom section Japanese text: "グローバルAIサミット2025" "3月15日-17日、東京". Modern geometric design. Vibrant gradient background blue to purple. Professional bilingual typography.""",
    filename="multilingual_poster"
)

Póster bilingüe de conferencia con texto en inglés y japonés que muestra las capacidades multilingües de Nano Banana Pro

Los equipos de marketing pueden crear creatividades con mensajes claros, los diseñadores explorar tipografías sin maquetar a mano, las marcas generar wordmarks coherentes y los equipos de UI/UX maquetar interfaces con texto legible.

La claridad del texto es solo una parte. Veamos cómo controlar iluminación y ángulos de cámara.

Control a nivel de estudio

Nano Banana Pro te permite ajustar iluminación, ángulos de cámara, profundidad de campo y etalonaje de color conversacionalmente, conservando tu composición.

Empieza con una foto de producto frontal:

# Generate base product image
base_image = generate_image(
    prompt="""Premium wireless earbuds with charging case. Front-facing straight-on view. Sleek matte black finish. Modern minimalist design. Clean white studio background. Professional product photography. Sharp focus throughout. Contemporary tech aesthetic.""",
    filename="earbuds_front"
)

Auriculares inalámbricos premium en vista frontal con iluminación de estudio, generados por Nano Banana Pro

Ahora cambia el ángulo de cámara a vista cenital sin regenerar:

# Create chat for editing
chat = client.chats.create(
    model="gemini-3-pro-image-preview",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
    )
)

# Edit camera angle conversationally
edit_response = chat.send_message([
    base_image,
    """Show these exact same wireless earbuds from bird's eye view, looking straight down from above. Keep the same earbuds and charging case. Overhead flat lay composition. Professional product photography."""
])

# Save edited image
for part in edit_response.parts:
    if image := part.as_image():
        image.save("earbuds_overhead.png")

Los mismos auriculares desde vista cenital que demuestran el control de ángulo de cámara de Nano Banana Pro sin regeneración

Los fotógrafos de producto pueden probar ángulos sin re‑shootings, arquitectos mostrar edificios desde distintas perspectivas, interioristas visualizar espacios con varios puntos de vista y marketing crear variaciones para A/B testing.

Consistencia de personajes

Las mascotas de marca deben verse idénticas en todos los puntos de contacto. Las campañas requieren el mismo personaje en escenarios distintos. Las versiones anteriores fallaban en esto (aunque la base de Nano Banana ya era buena). Nano Banana Pro mejora aún más la identidad visual entre escenas.

Genera un elemento de logotipo de marca:

# Create brand logo
brand_logo = generate_image(
    prompt="""Abstract geometric ribbon logo. Flowing infinity loop shape with metallic gradient silver to deep purple. Smooth curved surfaces. Elegant minimalist design. Clean white background. Premium brand identity element. Modern corporate aesthetic. No face. No eyes.""",
    filename="ribbon_logo"
)

Logotipo geométrico abstracto con forma de cinta e infinito creado por Nano Banana Pro para identidad de marca

Usa la misma cinta en una interfaz de app móvil:

# Create chat for editing
chat = client.chats.create(
    model="gemini-3-pro-image-preview",
    config=types.GenerateContentConfig(
        response_modalities=["TEXT", "IMAGE"],
        image_config=types.ImageConfig(aspect_ratio="16:9", image_size="1K"),
    )
)

# Show logo in app interface
app_response = chat.send_message([
    brand_logo,
    """Show this exact ribbon logo in a complete mobile app home screen. Top status bar with time and battery. Logo in header next to app name. Content cards below showing features. Bottom tab navigation with icons and labels. Modern mobile app UI. Gradient purple background. Professional startup app design. Full mobile interface layout."""
])

# Save
for part in app_response.parts:
    if image := part.as_image():
        image.save("ribbon_app.png")

El mismo logotipo de cinta integrado en una app móvil que demuestra la consistencia de Nano Banana Pro entre plataformas digitales

Ahora muestra la misma cinta en merchandising físico:

# Show logo on merchandise
merch_response = chat.send_message([
    brand_logo,
    """Show this exact ribbon logo on brand merchandise collection. Flat lay showing: white tote bag with logo, coffee mug with logo, t-shirt with logo printed on chest, product packaging box with logo. All items arranged together. Premium brand identity mockup. Minimalist aesthetic. Professional product photography. Same ribbon on each item."""
])

# Save
for part in merch_response.parts:
    if image := part.as_image():
        image.save("ribbon_merchandise.png")

El mismo logotipo de cinta en tote bag, taza, camiseta y packaging que demuestra la consistencia de marca con Nano Banana Pro

Y llegamos a la función que cambia las reglas de juego en Nano Banana Pro: el anclaje factual mediante Google Search.

Conocimiento del mundo real en acción

Cuando habilitas el anclaje con Search, el modelo accede a información actual para garantizar exactitud en materiales educativos, documentación técnica y contenido basado en datos donde la corrección es crítica.

Activa Google Search para contenido educativo:

# Generate solar energy infographic with Search grounding
image = generate_image(
    prompt="""Educational infographic explaining solar panel energy conversion. Show photovoltaic cells converting to DC power, then inverter converting to AC power for the grid. Clear labels and arrows.""",
    filename="solar_infographic",
    use_google_search=True  # Enable Search for factual accuracy
)

Infografía educativa sobre energía solar con etiquetas técnicas precisas generada por Nano Banana Pro usando Google Search

El mismo anclaje funciona para diagramas técnicos:

# Generate neural network diagram with Search grounding
image = generate_image(
    prompt="""Neural network architecture diagram. Left: 4 input nodes labeled "Input 1" "Input 2" "Input 3" "Input 4". Middle: two hidden layers each with 5 nodes labeled "Hidden Layer 1" and "Hidden Layer 2". Right: 3 output nodes labeled "Output 1" "Output 2" "Output 3". Connection lines between all layers. Clean technical illustration. Educational ML diagram. Professional data science aesthetic.""",
    filename="ml_architecture",
    use_google_search=True  # Enable Search for accuracy
)

Diagrama de red neuronal con capas etiquetadas generado por Nano Banana Pro con visualización técnica precisa usando Google Search

Creadores de contenido educativo, redactores técnicos, equipos de datos y divulgadores científicos pueden producir materiales y diagramas precisos sin un esfuerzo de verificación exhaustivo.

Estas cuatro funciones convierten a Nano Banana Pro en una herramienta versátil para flujos de trabajo profesionales. A continuación, compáralo directamente con el Nano Banana original para ver las mejoras.

Nano Banana Pro vs. Nano Banana base: ¿en qué se diferencian?

En esta sección, compararemos el modelo base Gemini 2.5 Flash Image con Gemini 3 Pro Image, es decir, Nano Banana base frente a la versión pro.

Aunque los ejemplos anteriores se centraban en casos de uso profesionales o educativos, aquí usaremos prompts del tipo "¡Soltemos la imaginación!". Al fin y al cabo, la mayoría de imágenes generadas suelen buscar dar salida a la creatividad sin límites de la mente humana. Este tipo de prompts ponen a prueba la capacidad de los modelos para convertir ideas descabelladas en arte.

Empecemos con este:

Geometric shapes staging a protest. Cubes holding signs reading "FREE THE SPHERES!" Triangles with banners "DOWN WITH FLATLAND!" A giant dodecahedron wearing a top hat giving a speech. Protest happening inside an M.C. Escher staircase. Floating equations as graffiti: "π > 3.14159". Pure mathematical chaos.

Este prompt prueba dos cosas: comprensión conceptual abstracta y renderizado de texto. El modelo base capta el tono lúdico, pero le cuesta hacer antropomórficas las figuras geométricas (dibujar caras en ellas). La versión pro renderiza texto nítido en las pancartas y mantiene el caos matemático surrealista. También dibuja la escalera de M. C. Escher con más precisión.

Prompt 2

Bold emblem/logo direction: a graphical, simplified, highly geometric icon of an ice hockey player in a powerful action pose with the hockey stick touching the ice, constructed entirely from sharp, angular, polygonal shards. Strict four-color palette (red, blue, yellow, white) on black, flat colors only (no gradients) for perfect reproduction as a logo or patch.

Nano Banana Pro es el claro ganador. El logo es nítido, profesional (sin texto innecesario) y realmente está construido con formas geométricas como se pedía. La versión base carece de la construcción geométrica limpia y añade elementos no deseados.

Prompt 3:

Mandelbrot's set drawn with extreme mathematical accuracy for a 1:1 wallpaper, fractal art

El modelo pro representa el fractal con una precisión impresionante. Aún no es perfecto: se sacrifica algo de exactitud matemática en los bordes en favor de la calidad artística, pero hizo un trabajo muy superior al modelo base, que dibujó algo completamente distinto. No obstante, el pro añadió elementos no solicitados: recuentos de iteraciones, ejes imaginario y real y, por algún motivo, un marco de ventana al estilo Windows XP.

Cuándo optar por la versión pro

Pro supera generalmente a base, pero la diferencia depende del tipo de prompt. El renderizado de texto y la precisión geométrica muestran las mayores mejoras (mira los ejemplos del logo de hockey y la escalera geométrica). El contenido técnico como el conjunto de Mandelbrot también se beneficia de la precisión de Pro.

Pro cuesta 0,134 $ por imagen 1K/2K frente a aproximadamente la mitad en base. Para cientos de iteraciones en proyectos personales, base está bien. Para entregables profesionales o cualquier cosa que requiera texto preciso, Pro justifica el coste. La edición conversacional hace que Pro sea más rentable cuando necesitas resultados precisos, porque refinas en vez de regenerar.

Pro también admite Google Search para anclaje factual, lo que lo hace mejor para cualquier imagen que implique conocimiento del mundo real.

Conclusión

Has aprendido a generar y editar imágenes con Nano Banana Pro, has explorado sus cuatro funciones clave y has visto cómo se compara con el modelo base. La API te ofrece edición conversacional, mezcla multiimagen, texto preciso y anclaje con Google Search para contenido factual.

Empieza con el nivel gratuito en la app de Gemini para probar prompts y ver qué funciona en tus proyectos. La edición conversacional suele ahorrar dinero porque refinas imágenes existentes en lugar de regenerarlas desde cero.

Para más detalles técnicos y las últimas novedades, consulta la documentación oficial a medida que Google siga ampliando las capacidades del modelo.


Bexruz (Bex) Tuychiev's photo
Author
Bexruz (Bex) Tuychiev
LinkedIn

Soy creador de contenidos sobre ciencia de datos con más de 2 años de experiencia y uno de los mayores seguimientos en Medium. Me gusta escribir artículos detallados sobre IA y ML con un toque sarcástico, porque hay que darle algo de vidilla al tema. He publicado más de 130 artículos y un curso en DataCamp, y tengo otro en marcha. Mis contenidos han sido vistos por más de 5 millones de personas; 20.000 de ellas se convirtieron en seguidores tanto en Medium como en LinkedIn. 

Temas
Inteligencia Artificial

Aprende con DataCamp

Curso

Comprender la inteligencia artificial

2 h
423.4K
Aprende los conceptos básicos de la inteligencia artificial, como machine learning, aprendizaje profundo, PLN, IA generativa y mucho más.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Los 7 mejores generadores de vídeo con IA para 2026 con vídeos de ejemplo

Descubre los mejores generadores de vídeo con IA disponibles en la actualidad, entre los que se incluyen RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo y los muy esperados Sora y Veo de DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

blog

SAM 2: Primeros pasos con el modelo 2 de Segmentar cualquier cosa de Meta

El SAM 2 (Segment Anything Model 2) de Meta AI es el primer modelo unificado capaz de segmentar cualquier objeto tanto en imágenes como en vídeos en tiempo real.
An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

DCLM-7B de Apple: Configuración, Ejemplo de uso, Ajuste fino

Empieza a utilizar el gran modelo de lenguaje DCLM-7B de Apple y aprende a configurarlo, utilizarlo y ajustarlo para tareas específicas.
Dimitri Didmanidze's photo

Dimitri Didmanidze

9 min

Tutorial

Visión GPT-4: Guía completa para principiantes

Este tutorial le presentará todo lo que necesita saber sobre GPT-4 Vision, desde cómo acceder a él hasta ejemplos prácticos del mundo real y sus limitaciones.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Ver MásVer Más