Curso
Hoy vivimos en un mundo donde la creatividad tiene menos límites. Gracias a las capacidades de la IA generativa para crear lenguaje natural, imágenes y vídeo, nuestras ideas más vívidas pueden convertirse en realidades visuales sorprendentes.
Hace unos años, tales posibilidades parecían ciencia ficción, pero ya no es así, especialmente con la tecnología revolucionaria de la API de DALL-E 3.
Este artículo es una guía completa para entender la tecnología de DALL-E 3: sus funciones, aplicaciones prácticas y reales, y cómo está redefiniendo el panorama creativo.
Visión general de la API de DALL-E 3
Antes de entrar en la parte de la API, entendamos qué es DALL-E 3. Ya tenemos una introducción completa a usar DALL-E 3 con Bing y ChatGPT; en cambio, esta guía se centra principalmente en cómo integrar la API.
¿Qué es DALL-E 3?
Es el último modelo de generación de imágenes de OpenAI y se anunció en septiembre de 2023. Este modelo entiende mucha más sutileza y detalle que sus predecesores. DALL-E 3 permite generar imágenes excepcionales a partir de descripciones de texto.
Se lanzaron varias versiones anteriores, como DALL-E 1 en enero de 2021 y DALL-E 2 en abril de 2022. DALL-E 3 es, con diferencia, la versión más avanzada; a continuación encontrarás una tabla comparativa con las versiones previas.
Detalles de precios
Los precios se indican para cada una de las versiones de DALL-E. Como vemos, solo DALL-E 3 ofrece calidades estándar y alta definición y sus resoluciones correspondientes.
|
Modelo |
Calidad |
Resolución |
Precio por imagen (US $) |
|
DALL-E |
1024x1024 |
0.13 |
|
|
DALL·E 2 |
1024×1024 |
0.020 |
|
|
512×512 |
0.018 |
||
|
256×256 |
0.016 |
||
|
DALL·E 3 |
Estándar |
1024×1024 |
0.040 |
|
1024×1792, 1792×1024 |
0.080 |
||
|
HD |
1024×1024 |
0.080 |
|
|
1024×1792, 1792×1024 |
0.120 |
Características adicionales
La tabla anterior ofrece una visión comparativa de tres iteraciones del sistema de IA DALL-E, diseñado para generar imágenes a partir de descripciones en texto. Estas versiones son DALL-E, DALL-E 2 y DALL-E 3, cada una con su fecha de lanzamiento y conjunto de funciones.
- DALL-E, la primera versión, se presentó en enero de 2021, utilizando GPT-3 como modelo de lenguaje. Supuso el primer paso en la tecnología texto-a-imagen y estuvo disponible para quienes tenían una cuenta de la API de OpenAI.
- La segunda versión, DALL-E 2, se lanzó en julio de 2022 y avanzó con el modelo de lenguaje CLIP. Las capacidades de CLIP mejoraron la comprensión de las instrucciones de texto, logrando una generación de imágenes más precisa.
- La versión más reciente es DALL-E 3, publicada en octubre de 2023. Integra el modelo de lenguaje más avanzado GPT-4, lo que ofrece una comprensión del texto y una creación de imágenes aún mejores. Esta versión está disponible no solo para quienes tienen cuenta de la API de OpenAI, sino también para suscriptores "Plus" a través de la interfaz de ChatGPT.
Cada versión representa un paso evolutivo en las capacidades de IA texto-a-imagen, con avances en modelos de lenguaje y accesibilidad que reflejan el compromiso de OpenAI con mejorar y democratizar la tecnología.
OpenAI ofrece capacidades adicionales mediante su suscripción "Plus", entre ellas GPT-4 Vision. Para saber más, nuestra guía GPT-4 Vision: guía completa para principiantes te presenta todo lo que necesitas: desde cómo acceder hasta ejemplos prácticos y sus limitaciones.
|
DALL-E |
DALL-E 2 |
DALL-E 3 |
|
|
Fecha de lanzamiento |
Enero de 2021 |
Julio de 2022 |
Octubre de 2023 |
|
Tipo de dato de entrada |
Instrucción de texto |
Instrucción de texto |
Instrucción de texto |
|
Modelo de lenguaje |
GPT-3 |
CLIP |
GPT-4 |
|
Disponible para |
Cualquiera con una cuenta de la API de OpenAI |
Cualquiera con una cuenta de la API de OpenAI |
Cualquiera con una cuenta de la API de OpenAI y suscriptores "Plus" vía ChatGPT |
¿Por qué una versión API?
OpenAI anunció el lanzamiento de varias APIs durante su primer día del desarrollador, y DALL-E 3 fue una de ellas.
La versión API de DALL-E 3 ofrece un acceso más directo y versátil a sus capacidades. Tras llegar a la interfaz de ChatGPT y a Bing Chat, que brindan una experiencia más guiada, la API permite a desarrolladores y empresas integrar directamente DALL-E 3 en sus propias aplicaciones y flujos de trabajo.
Funciones de la API de DALL-E 3
La API incorpora un conjunto de funciones pensadas para mejorar la experiencia de uso. Veámoslas en detalle:

Funciones de la API de DALL-E 3
- Integración de texto en imágenes: la API de DALL-E 3 puede integrar texto en un contexto visual, como si formara parte de la escena original.
- Variedad de orientaciones: con DALL-E 3 puedes generar imágenes en formato horizontal y vertical, lo que aporta flexibilidad para distintos medios y maquetaciones.
- Mejor calidad de imagen: el modelo no solo crea imágenes visualmente atractivas, también ricas en detalles, ofreciendo una experiencia realista y cautivadora.
- Comprensión de instrucciones complejas: DALL-E 3 interpreta con eficacia instrucciones elaboradas, lo que permite crear imágenes muy específicas y detalladas.
Casos de uso por industria de la API de DALL-E 3
Muchas industrias han aprovechado DALL-E desde sus primeras versiones. La API actual ofrece capacidades de generación de imágenes más avanzadas, impulsando la creatividad y la eficiencia.
Aunque hay infinidad de sectores, aquí nos centramos en tres: publicidad y marketing, educación y desarrollo de videojuegos.
- Publicidad y marketing: varias agencias pueden usar la API para crear rápidamente visuales personalizados para campañas y branding. Esto potencia la creatividad y reduce el time to market.
- Educación: las plataformas de aprendizaje online pueden generar ilustraciones y diagramas a medida para hacer sus contenidos más atractivos y accesibles a un público más amplio.
- Desarrollo de videojuegos: es, probablemente, uno de los campos que más se beneficiará de la API de DALL-E 3, porque el juego es pura imagen. Los estudios pueden integrarla para diseñar con rapidez visuales únicos.
Manos a la obra: cómo empezar con la API de DALL-E 3
Ahora que ya entendemos mejor la API de DALL-E 3 y lo que puede hacer, toca ponernos creativos. En esta sección te guiamos por el proceso de generar imágenes con la API tras preparar todos los requisitos.
Flujo de trabajo de generación de imágenes
En cualquier implementación técnica, conviene ofrecer un flujo visual que muestre cómo interactúan los componentes principales de la aplicación que se desarrolla.
Este flujo explica cómo interactúa el usuario con la API: desde la instrucción personalizada hasta la imagen final.

Flujo simplificado de la interacción del usuario con la API de DALL-E 3
El flujo tiene dos partes principales:
- El front-end es la parte que permite introducir la descripción de la imagen deseada.
- La segunda parte es el back-end, responsable de enviar la instrucción del usuario a la API de DALL-E 3.
Ahora sí, vamos con la implementación técnica. El código fuente de este tutorial está disponible en este workbook de DataLab; crea una copia para editarlo y ejecutarlo en el navegador sin instalar nada en tu ordenador.
Configura tu OpenAI KEY
Las herramientas principales para reproducir los resultados de este tutorial son:
- Python: es el lenguaje principal que usaremos. Como alternativa, puedes usar NodeJS.
- OpenAI: el paquete para interactuar con los servicios de OpenAI
- OS: el paquete del sistema operativo para configurar la variable de entorno
- Image: se encarga de convertir la respuesta de DALL-E 3 a formato de imagen
El primer paso es obtener tu OpenAI KEY, que da acceso al modelo DALL-E 3. Los pasos principales se ilustran a continuación:

Cuatro pasos para crear tu OpenAI KEY
Los cuatro pasos son bastante autoexplicativos. Eso sí, crea tu cuenta desde el sitio oficial de OpenAI.
Interactúa con la API de DALL-E 3
Una vez tengas tu KEY, no la compartas con nadie. Debe permanecer privada. Después, configúrala como variable de entorno para poder trabajar:
import os
OPENAI_API_KEY= “<YOUR PRIVATE KEY>”
os.environ["OPENAI_API_KEY"] = OPENAI_API_KEY
La instrucción os.environ inicia la interacción con los servicios de OpenAI según el alcance de tu clave privada, que puede ser Personal o Enterprise.
Luego, usando la función generate de los clientes de OpenAI, puedes especificar:
- El modelo a usar, que en este tutorial es dall-e-3.
- La instrucción (prompt) que se envía al modelo.
- Las dimensiones de la imagen final que generará dall-e-3; usamos 1024x1024 en todos los ejemplos.
- La calidad de la imagen: standard o alta definición (hd). Aquí nos centramos en imágenes en alta definición.
- Puedes solicitar una imagen por llamada con DALL-E 3 o hasta diez a la vez con el parámetro n, útil para peticiones en paralelo. En este tutorial usamos n=1 por simplicidad.
La siguiente función auxiliar combina toda esta información para facilitar la reproducibilidad, pero antes tenemos que instalar la librería de OpenAI e importar lo necesario:
La instalación se realiza con el gestor de paquetes pip:
pip install --upgrade openai
La opción de actualización instala el SDK de Python v1.2, necesario para interactuar correctamente con DALL-E 3.
from openai import OpenAI
# Instantiate the OpenAI client
client = OpenAI()
from IPython.display import Image
El client se encarga de iniciar la comunicación con la API de DALL-E 3.
Aquí tienes la función auxiliar:
def get_image_from_DALL_E_3_API(user_prompt,
image_dimension="1024x1024",
image_quality="hd",
model="dall-e-3",
nb_final_image=1):
response = client.images.generate(
model = model,
prompt = user_prompt,
size = image_dimension,
quality = image_quality,
n=nb_final_image,
)
image_url = response.data[0].url
display(Image(url=image_url))
Genera imágenes realistas
Con la función anterior, probemos a generar imágenes con instrucciones simples y avanzadas. Las avanzadas se inspiran en los casos de uso por industria que vimos antes.
Ten en cuenta que ejecutar el mismo código varias veces puede dar resultados distintos por el componente "creativo" del modelo.
Usa una instrucción simple
Imagina que enviamos esta instrucción al modelo:
Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky.
puppy_prompt = "Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky."
get_image_from_DALL_E_3_API(puppy_prompt)
Tras ejecutar correctamente el código anterior, se genera la siguiente imagen.

Imagen generada a partir de la instrucción simple
El resultado refleja fielmente la instrucción.
Usa instrucciones más complejas
Ahora, veamos instrucciones complejas para educación, publicidad y desarrollo de videojuegos.
Contenido educativo
- Instrucción:
Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook.
- Código:
education_prompt = "Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook"
get_image_from_DALL_E_3_API(education_prompt)
- Resultado:

Imagen generada para la instrucción "Education"
Publicidad y marketing
- Instrucción:
Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living.
- Código:
advertising_prompt = "Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living."
get_image_from_DALL_E_3_API(advertising_prompt)
- Resultado:

Imagen generada para la instrucción "Advertising"
Desarrollo de videojuegos
En este último ejemplo, pidamos al modelo que añada información textual destacada en naranja en la instrucción y veamos cómo se comporta.
- Instrucción:
Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style.
- Código:
game_dev_prompt = "Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style"
get_image_from_DALL_E_3_API(game_dev_prompt)
- Resultado:

Imagen generada para la instrucción "Game Development"
Podemos ver que el modelo añadió correctamente el texto "BEWARE MYTHICAL CREATURES AHEAD" tras generar la imagen. Es fantástico.
Buenas prácticas al usar la API de DALL-E 3
Para una mejor experiencia con la API de DALL-E 3, ten en cuenta estas pautas:
- Prioriza la claridad: proporcionar instrucciones precisas y detalladas es clave, igual que dar indicaciones claras a una persona. Cuanto más explícita sea la solicitud, más preciso será el resultado.
- Consideraciones éticas: respeta los derechos de autor y la privacidad, y valora el impacto potencial de las imágenes generadas.
- Conoce y adapta sus límites: como cualquier tecnología, DALL-E 3 también tiene limitaciones. Familiarizarte con lo que la API puede y no puede hacer te ayudará a ajustar las instrucciones y tus expectativas.
- Mantente al día y explora: probar una variedad de instrucciones te permite descubrir el alcance de la API y tus propios límites creativos. Para un pintor, sería como experimentar con distintos pinceles y colores.
Conclusión
En resumen, hemos explorado a fondo la API de DALL-E 3, desde su configuración hasta sus múltiples aplicaciones. Empezamos con una visión general de sus capacidades pioneras para preparar el terreno.
Después profundizamos en sus funciones específicas, aclarando sus capacidades avanzadas de generación de imágenes. A esto siguió un repaso a casos de uso en distintas industrias, demostrando su versatilidad y amplio impacto.
También te guiamos por los primeros pasos para usar la API, desde obtener acceso hasta configurarla para diferentes aplicaciones, destacando la importancia de entender y aprovechar bien sus funciones.
Además, compartimos buenas prácticas de uso, haciendo hincapié en las consideraciones éticas y en cómo exprimir su potencial. Incluimos consejos prácticos y ejemplos para ayudarte a optimizar tu experiencia.
¿Listo para dar tu próximo paso en el mundo de la IA y la creatividad? Potencia tus habilidades y libera tu potencial creativo con las herramientas que usan los innovadores en IA. Empieza hoy con nuestro tutorial How to Use Midjourney: A Comprehensive Guide to AI-Generated Artwork Creation. O aprende a trabajar con otras APIs populares en el curso Working with the OpenAI API.
Zoumana desarrolla herramientas de IA LLM para ayudar a las empresas a llevar a cabo la diligencia debida en materia de sostenibilidad y evaluaciones de riesgos. Anteriormente trabajó como científico de datos e ingeniero de aprendizaje automático en Axionable e IBM. Zoumana es la fundadora de la plataforma tecnológica educativa de aprendizaje entre iguales ETP4Africa. Ha escrito más de 20 tutoriales para DataCamp.





