Ir al contenido principal

Stability AI anuncia Stable Diffusion 3: todo lo que sabemos hasta ahora

Descubre las nuevas actualizaciones de Stable Diffusion y conoce las capacidades del modelo de texto a imagen en su versión 3.
Actualizado 17 sept 2026

Explorar con IA

ChatGPTClaudePerplexity

Stability AI anunció un acceso anticipado a Stable Diffusion 3, su modelo generativo de IA de texto a imagen. A diferencia del anuncio de Sora de texto a vídeo de OpenAI de la semana pasada, se mostraron pocas demostraciones de las nuevas capacidades del modelo, aunque sí se compartieron algunos detalles. Aquí analizamos qué implica el anuncio, cómo funciona el nuevo modelo y qué consecuencias puede tener para el avance de la generación de imágenes.

¿Qué es Stable Diffusion 3?

Stable Diffusion es una serie de modelos generativos de IA que crean imágenes a partir de texto. Es decir, escribes un prompt describiendo lo que quieres ver y el modelo genera una imagen que se ajusta a tu descripción. Existe una interfaz web para acceder fácilmente a la IA.

Una diferencia importante con DALL·E, el modelo rival de OpenAI para generar imágenes, es que cuenta con "pesos abiertos". Es decir, los detalles de la red neuronal que realiza los cálculos del modelo son públicos. Esto aporta cierta transparencia sobre cómo funciona el modelo y permite que investigadores adapten y construyan sobre el trabajo de Stability AI.

Stable Diffusion 3 no es un único modelo, sino toda una familia, con tamaños que van desde 800 millones de parámetros hasta 8.000 millones. A más parámetros, mayor calidad de salida, aunque con el efecto secundario de que las imágenes son más caras y tardan más en generarse. Las versiones con menos parámetros son mejores para crear imágenes sencillas y las versiones con más parámetros se adaptan mejor a imágenes de mayor calidad o más complejas.

¿Cómo funciona Stable Diffusion 3?

Stable Diffusion 3 utiliza una arquitectura de diffusion transformer, similar a la que emplea Sora. Las versiones anteriores de Stable Diffusion —y la mayoría de IAs actuales de generación de imágenes— usan un modelo de difusión. Los grandes modelos de lenguaje para generación de texto, como GPT, usan una arquitectura transformer. Combinar ambos enfoques es un avance reciente que promete aprovechar lo mejor de las dos arquitecturas.

Los modelos de difusión son muy buenos creando detalle en regiones pequeñas, pero flojean al generar el diseño global de una imagen. Por el contrario, los transformers se manejan bien con el layout, pero les cuesta generar detalles finos. Así que es probable que Stable Diffusion combine un transformer para organizar la composición general de la imagen y después use difusores para generar los parches.

Esto nos permite esperar que Stable Diffusion 3 se desempeñe mejor que sus predecesores al organizar escenas complejas.

El anuncio también señala que Stable Diffusion 3 emplea una técnica llamada flow matching. Es una forma más eficiente computacionalmente de entrenar modelos y de crear imágenes con ellos que la técnica de trayectorias de difusión actual. En la práctica, la IA es más barata de entrenar y las imágenes también son más baratas de generar, reduciendo los costes del sistema.

¿Cuáles son las limitaciones de Stable Diffusion 3?

Una de las limitaciones actuales de la generación de imágenes con IA es la capacidad de generar texto. De hecho, el anuncio de Stability AI comenzaba con una imagen que incluía el nombre del modelo, "Stable Diffusion 3". La colocación de las letras es buena pero no perfecta: fíjate en que la distancia entre la "B" y la "L" de Stable es mayor que entre la "L" y la "E". Del mismo modo, las dos "F" de Diffusion están demasiado juntas. Aun así, en conjunto, supone una mejora notable respecto a la generación anterior de modelos.

Prompt: Epic anime artwork of a wizard atop a mountain at night casting a cosmic spell into the dark sky that says

Prompt: ilustración anime épica de un mago en lo alto de una montaña de noche lanzando un hechizo cósmico al cielo oscuro que diga "Stable Diffusion 3" hecho de energía multicolor

Otro problema de estos modelos es que, como los difusores generan parches de la imagen por separado, pueden aparecer inconsistencias entre regiones. Esto se nota sobre todo al intentar generar imágenes realistas. La entrada del anuncio no incluía muchos ejemplos fotorrealistas, pero una imagen de un autobús en una calle de ciudad deja ver algunos de estos fallos. Observa que la sombra bajo el autobús sugiere una luz que viene desde detrás, mientras que la sombra de un edificio en la calzada indica luz desde la izquierda. También la colocación de las ventanas del edificio en la parte superior derecha es algo inconsistente entre distintas zonas. Además, el autobús no tiene conductor, aunque esto podría resolverse con un prompt más cuidadoso.

image1.png

¿Cómo puedo acceder a Stable Diffusion 3?

Stable Diffusion 3 está en fase de "acceso anticipado". Esto significa que solo está disponible para investigadores con fines de prueba. Esta fase permite a Stability AI recopilar feedback sobre el rendimiento y la seguridad del modelo antes de lanzarlo al público general.

Puedes unirte a la lista de espera para acceder a la IA aquí.

¿Cuáles son los casos de uso de Stable Diffusion 3?

Las IAs de generación de imágenes ya se utilizan en multitud de casos, desde ilustración y diseño gráfico hasta materiales de marketing. Stable Diffusion apunta a ser útil en los mismos ámbitos, con la ventaja añadida de que probablemente podrá crear imágenes con composiciones más complejas.

¿Cuáles son los riesgos de Stable Diffusion 3?

El conjunto de datos con el que se entrenó Stable Diffusion incluía algunas imágenes con copyright, lo que ha derivado en varias demandas aún sin resolver. No está claro cuál será su desenlace, pero en teoría podría considerarse que las imágenes creadas con Stable Diffusion también infringen derechos de autor.

¿Qué no sabemos todavía?

Aún no se han publicado todos los detalles técnicos de Stable Diffusion 3 y, en particular, no hay forma de evaluar el rendimiento de la IA. Cuando el modelo esté disponible públicamente y existan benchmarks, podremos determinar cuánto mejora respecto a versiones anteriores. También quedarán claros otros factores como el tiempo y el coste de generar una imagen.

Un avance técnico que OpenAI destacó mucho en su artículo de DALL·E 3, pero que no se mencionó en el anuncio de Stability AI, es el recaptioning. Se trata de una forma de prompt engineering automática, donde el texto del usuario se reestructura y enriquece con más detalle para dar instrucciones más claras al modelo. Se desconoce si Stable Diffusion 3 utiliza esta técnica o no.

Reflexiones finales

Stable Diffusion 3 promete ser otro paso adelante en el progreso de la IA generativa de texto a imagen. Cuando se publique, podremos probarla a fondo y descubrir nuevos casos de uso. Si tienes ganas de adentrarte en el mundo de la IA generativa, nuestro itinerario de aprendizaje AI Fundamentals te ayudará a ponerte al día con machine learning, deep learning, NLP, modelos generativos y mucho más.

Para más recursos sobre lo último en IA, echa un vistazo a esta lista:


Richie Cotton's photo
Author
Richie Cotton
LinkedIn

Richie ayuda a particulares y organizaciones a mejorar en el uso de los datos y la IA. Es científico de datos desde antes de que se llamara ciencia de datos, y ha escrito dos libros y creado muchos cursos DataCamp sobre el tema. Es presentador del podcast DataFramed, y dirige el programa de seminarios web de DataCamp.

Temas
Inteligencia Artificial

¡Empieza hoy tu viaje en IA!

Curso

Comprender ChatGPT

1 h
434.9K
Aprende a utilizar ChatGPT. Descubre las mejores prácticas para escribir prompts y explora casos de uso empresarial comunes para la potente herramienta de IA.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Todo lo que sabemos sobre GPT-5

Descubre cómo GPT-5 evolucionará hasta convertirse en un sistema unificado con funciones avanzadas, cuyo lanzamiento está previsto para el verano de 2025, basándose en la última hoja de ruta de OpenAI y en la historia de GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

blog

7 emocionantes proyectos de IA para todos los niveles en 2026

Desarrolla tu portafolio y mejora tus habilidades en la creación de soluciones innovadoras para problemas complejos trabajando en proyectos de IA.
Abid Ali Awan's photo

Abid Ali Awan

8 min

Tutorial

Cómo ejecutar Stable Diffusion:

Explora la IA generativa con nuestro tutorial introductorio sobre Stable Diffusion. Aprende a ejecutar el modelo de aprendizaje profundo en línea y localmente para generar imágenes detalladas.
Kurtis Pykes 's photo

Kurtis Pykes

7 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

IA explicable - Comprender y confiar en los modelos de aprendizaje automático

Sumérjase en la IA explicable (XAI) y aprenda a generar confianza en los sistemas de IA con LIME y SHAP para la interpretabilidad de modelos. Comprender la importancia de la transparencia y la equidad en las decisiones basadas en la IA.
Zoumana Keita 's photo

Zoumana Keita

12 min

ChatGPT Code Interpreter

Tutorial

Cómo utilizar ChatGPT Code Interpreter

Todo lo que necesitas saber sobre ChatGPT Code Interpreter de OpenAI
Adel Nehme's photo

Adel Nehme

9 min

Ver MásVer Más