Cours
Nous vivons désormais dans un monde où la créativité a moins de limites. Grâce aux capacités de l’IA générative pour créer du langage naturel, des images et des vidéos, nos imaginaires les plus vifs peuvent se transformer en visuels spectaculaires.
De telles possibilités semblaient relever de la fiction il y a quelques années, mais ce n’est plus le cas, notamment avec la technologie de rupture qu’est l’API DALL-E 3.
Cet article propose un guide complet pour comprendre la technologie DALL-E 3, explorer ses fonctionnalités, ses applications pratiques et concrètes, et la façon dont elle redessine le paysage créatif.
Aperçu de l’API DALL-E 3
Avant d’aborder l’aspect API, commençons par définir DALL-E 3. Nous proposons une introduction complète à l’utilisation de DALL-E 3 via Bing et ChatGPT ; ce guide-ci se concentre principalement sur l’intégration via l’API.
Qu’est-ce que DALL-E 3 ?
Il s’agit du dernier modèle de génération d’images d’OpenAI, annoncé en septembre 2023. Ce modèle comprend bien plus de nuances et de détails que ses prédécesseurs. DALL-E 3 permet de générer des visuels remarquables à partir de descriptions textuelles.
Plusieurs versions, comme DALL-E 1 et DALL-E 2, ont été respectivement mises en avant en janvier 2021 et en avril 2022. DALL-E 3 est de loin la version la plus aboutie, et le tableau ci-dessous la compare aux versions précédentes.
Détails tarifaires
Les prix sont indiqués pour chacune des versions de DALL-E. Comme on peut le voir, seule DALL-E 3 propose des qualités d’image standard et haute définition, ainsi que leurs résolutions correspondantes.
|
Modèle |
Qualité |
Résolution |
Prix par image (en $ US) |
|
DALL-E |
1024x1024 |
0.13 |
|
|
DALL·E 2 |
1024×1024 |
0.020 |
|
|
512×512 |
0.018 |
||
|
256×256 |
0.016 |
||
|
DALL·E 3 |
Standard |
1024×1024 |
0.040 |
|
1024×1792, 1792×1024 |
0.080 |
||
|
HD |
1024×1024 |
0.080 |
|
|
1024×1792, 1792×1024 |
0.120 |
Caractéristiques complémentaires
Le tableau ci-dessus offre une vue comparative de trois itérations du système d’IA DALL-E, conçu pour générer des images à partir de descriptions textuelles : DALL-E, DALL-E 2 et DALL-E 3, chacune avec sa date de sortie et ses spécificités.
- DALL-E, la première version, a été présentée en janvier 2021, en s’appuyant sur GPT-3 comme modèle de langage. Elle a marqué le premier jalon des technologies de génération d’images à partir de texte, accessible aux utilisateurs disposant d’un compte OpenAI API.
- La deuxième version, DALL-E 2, est sortie en juillet 2022, faisant progresser la technologie avec le modèle de langage CLIP. Les capacités de CLIP ont amélioré la compréhension des invites textuelles et conduit à des images plus fidèles.
- La version la plus récente, DALL-E 3, a été publiée en octobre 2023. Elle intègre le modèle de langage plus avancé GPT-4, offrant vraisemblablement une meilleure compréhension des textes et une création d’images encore plus aboutie. Cette version est accessible non seulement aux titulaires d’un compte OpenAI API, mais aussi aux abonnés « Plus » via l’interface ChatGPT.
Chaque version représente une étape dans l’évolution des capacités d’IA de génération d’images à partir de texte, avec des avancées tant sur les modèles de langage que sur l’accessibilité, témoignant de l’engagement d’OpenAI à améliorer et démocratiser l’IA.
OpenAI propose des capacités supplémentaires via son abonnement « Plus », dont GPT-4 Vision. Pour en savoir plus, notre GPT-4 Vision : guide complet pour débutants vous présente l’essentiel, de l’accès aux exemples concrets, sans oublier ses limites.
|
DALL-E |
DALL-E 2 |
DALL-E 3 |
|
|
Date de sortie |
Janvier 2021 |
Juillet 2022 |
Octobre 2023 |
|
Type de données en entrée |
Invite textuelle |
Invite textuelle |
Invite textuelle |
|
Modèle de langage |
GPT-3 |
CLIP |
GPT-4 |
|
Disponible pour |
Toute personne avec un compte OpenAI API |
Toute personne avec un compte OpenAI API |
Toute personne avec un compte OpenAI API et les abonnés « Plus » via ChatGPT |
Pourquoi une version API ?
OpenAI a annoncé le lancement de plusieurs API lors de sa première journée développeurs, dont DALL-E 3.
La version API de DALL-E 3 offre un accès plus direct et plus polyvalent à ses capacités. Après son arrivée dans l’interface ChatGPT et dans Bing Chat, qui proposent une expérience plus guidée et contrôlée, l’API permet aux développeurs et aux entreprises d’intégrer directement DALL-E 3 dans leurs applications et leurs workflows.
Fonctionnalités de l’API DALL-E 3
L’API apporte un ensemble de fonctionnalités conçues pour améliorer l’expérience utilisateur. Explorons ces capacités en détail :

Fonctionnalités de l’API DALL-E 3
- Intégration de texte dans les images : l’API DALL-E 3 peut intégrer du texte souhaité dans un contexte visuel, comme s’il faisait partie de la scène d’origine.
- Multiples orientations d’image : avec DALL-E 3, vous pouvez générer des formats paysage et portrait, pour s’adapter aux différents supports et contraintes de mise en page.
- Meilleure qualité d’image : le modèle ne se contente pas de créer des images esthétiques : elles sont également riches en détails, pour un rendu réaliste et captivant.
- Compréhension d’invites complexes : DALL-E 3 interprète efficacement des demandes complexes, ce qui permet de créer des images très spécifiques et détaillées.
Cas d’usage de l’API DALL-E 3 par secteur
De nombreux secteurs tirent parti de DALL-E depuis les premières versions. Cette API propose des capacités plus avancées de génération d’images, au service de la créativité et de l’efficacité.
Même s’ils sont innombrables, concentrons-nous ici sur trois domaines : la publicité et le marketing, l’éducation et le développement de jeux vidéo.
- Publicité et marketing : de nombreuses agences peuvent exploiter l’API pour créer rapidement des visuels personnalisés pour leurs campagnes et leur branding. À la clé : un surcroît de créativité et un time-to-market réduit.
- Éducation : les plateformes d’apprentissage en ligne peuvent générer des illustrations et schémas sur mesure pour rendre leurs supports plus attrayants et accessibles à un public plus large.
- Développement de jeux vidéo : c’est, selon nous, l’un des domaines qui profiteront le plus de l’API DALL-E 3, car le jeu vidéo est un média visuel par essence. Les studios peuvent intégrer la technologie pour concevoir rapidement des visuels uniques.
Pratique : premiers pas avec l’API DALL-E 3
Maintenant que vous comprenez mieux l’API DALL-E 3 et ce qu’elle permet, passons à la création. Cette section vous guide pas à pas pour générer des images via l’API DALL-E 3, une fois les prérequis en place.
Workflow de génération d’images
Pour toute implémentation technique, il est utile de fournir un schéma illustrant l’interaction entre les principaux composants de l’application en cours de développement.
Ce workflow explique comment l’utilisateur interagit avec l’API, de la saisie de l’invite personnalisée à la réception de l’image finale.

Workflow simplifié de l’interaction utilisateur avec l’API DALL-E 3
Le workflow comporte deux grandes parties :
- Le front-end, qui permet à l’utilisateur de saisir la description de l’image souhaitée.
- Le back-end, qui transmet l’invite de l’utilisateur à l’API DALL-E 3.
Passons maintenant à l’implémentation technique. Le code source de ce tutoriel est disponible dans ce workbook DataLab ; créez-en une copie pour l’éditer et l’exécuter dans votre navigateur, sans rien installer sur votre ordinateur.
Configurer la clé OpenAI
Les principaux outils nécessaires pour reproduire ce tutoriel sont :
- Python : le langage principal utilisé ici. Une alternative possible est NodeJS.
- OpenAI : le package pour interagir avec les services OpenAI
- OS : le package système pour configurer la variable d’environnement
- Image : responsable de la conversion de la réponse de DALL-E 3 en format image
La première étape consiste à obtenir votre clé OpenAI, nécessaire pour accéder au modèle DALL-E 3. Les principales étapes sont illustrées ci-dessous :

Quatre étapes clés pour créer une clé OpenAI
Ces quatre étapes sont explicites. Il est toutefois essentiel de créer votre compte depuis le site officiel d’OpenAI.
Interagir avec l’API DALL-E 3
Une fois la clé obtenue, veillez à ne pas la partager. Elle doit rester privée. Ensuite, définissez-la comme variable d’environnement comme suit pour pouvoir l’utiliser :
import os
OPENAI_API_KEY= “<YOUR PRIVATE KEY>”
os.environ["OPENAI_API_KEY"] = OPENAI_API_KEY
L’instruction os.environ initialise l’interaction avec les services OpenAI en fonction de la portée de la clé privée de l’utilisateur, qui peut être Personal ou Enterprise.
Ensuite, à l’aide de la fonction generate des clients OpenAI, l’utilisateur peut préciser :
- Le modèle à utiliser, dall-e-3 dans ce tutoriel.
- L’invite (prompt) envoyée au modèle.
- Les dimensions de l’image finale générée par dall-e-3 ; nous utilisons 1024x1024 pour toutes les images générées.
- La qualité de l’image, standard ou haute définition (hd). Nous nous concentrons ici sur la haute définition.
- Vous pouvez demander une image à la fois avec DALL-E 3, ou jusqu’à dix en parallèle via le paramètre n. Pour la simplicité, ce tutoriel utilise n=1.
La fonction utilitaire suivante regroupe ces paramètres pour une meilleure reproductibilité, mais commençons par installer la bibliothèque OpenAI et importer les modules requis :
L’installation se fait avec le gestionnaire de paquets Python pip :
pip install --upgrade openai
L’option d’upgrade permet de passer au SDK Python v1.2, requis pour interagir avec DALL-E 3.
from openai import OpenAI
# Instantiate the OpenAI client
client = OpenAI()
from IPython.display import Image
Le client initialise la communication avec l’API DALL-E 3.
Voici la fonction utilitaire :
def get_image_from_DALL_E_3_API(user_prompt,
image_dimension="1024x1024",
image_quality="hd",
model="dall-e-3",
nb_final_image=1):
response = client.images.generate(
model = model,
prompt = user_prompt,
size = image_dimension,
quality = image_quality,
n=nb_final_image,
)
image_url = response.data[0].url
display(Image(url=image_url))
Générer des images réalistes
Avec la fonction ci-dessus, expérimentons la génération d’images avec des invites simples et avancées. Les invites avancées s’appuient sur les cas d’usage sectoriels précédents.
Notez qu’exécuter plusieurs fois le même code produit des résultats différents : c’est l’effet « créatif » du modèle.
Utiliser une invite simple
Imaginons l’invite suivante :
Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky.
puppy_prompt = "Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky."
get_image_from_DALL_E_3_API(puppy_prompt)
L’image suivante est générée après exécution du code ci-dessus.

Image générée à partir de l’invite simple
Ce résultat reflète fidèlement l’invite fournie.
Utiliser des invites plus complexes
Considérons maintenant des invites complexes pour l’éducation, la publicité et le développement de jeux vidéo.
Contenu éducatif
- Invite :
Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook.
- Code :
education_prompt = "Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook"
get_image_from_DALL_E_3_API(education_prompt)
- Résultat :

Image générée pour l’invite « Education »
Publicité et marketing
- Invite :
Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living.
- Code :
advertising_prompt = "Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living."
get_image_from_DALL_E_3_API(advertising_prompt)
- Résultat :

Image générée pour l’invite « Advertising »
Développement de jeux
Pour ce dernier exemple, demandons au modèle d’ajouter des informations textuelles mises en évidence en orange dans l’invite, et observons le résultat.
- Invite :
Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style.
- Code :
game_dev_prompt = "Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style"
get_image_from_DALL_E_3_API(game_dev_prompt)
- Résultat :

Image générée pour l’invite « Game Development »
On constate que le modèle a bien ajouté le texte « BEWARE MYTHICAL CREATURES AHEAD » après la génération de l’image. Impressionnant.
Bonnes pratiques avec l’API DALL-E 3
Pour une meilleure expérience avec l’API DALL-E 3, voici quelques conseils et lignes directrices :
- Privilégier des demandes détaillées : fournissez des invites précises et détaillées, comme vous le feriez avec des consignes claires à un humain. Plus la demande est explicite, plus le résultat est fidèle.
- Considérations éthiques : gardez à l’esprit les implications éthiques des créations finales, en respectant le droit d’auteur et la vie privée, et en considérant l’impact potentiel des images générées.
- Reconnaître et contourner les limites : comme toute technologie, DALL-E 3 a ses limites. Mieux comprendre ce que l’API peut ou non faire aide à formuler des invites plus réalistes.
- Rester informé et expérimenter : tester une variété d’invites permet de découvrir l’étendue des possibilités de l’API et d’élargir ses propres horizons créatifs. Pour un peintre, c’est comme explorer différents pinceaux et couleurs.
Conclusion
En résumé, cet article a proposé une exploration approfondie de l’API DALL-E 3, de sa mise en place à ses différents usages. Nous avons commencé par un aperçu global, en présentant ses capacités de rupture pour préparer la suite.
Nous avons ensuite détaillé ses fonctionnalités, en clarifiant ses capacités avancées de génération d’images. Puis nous avons passé en revue des cas d’usage sectoriels, illustrant la polyvalence et l’impact étendu de l’API.
L’article vous a également guidé dans les premières étapes d’utilisation, de l’obtention de l’accès à la configuration selon les applications, en soulignant l’importance de bien comprendre et exploiter ses fonctionnalités.
Enfin, nous avons partagé des bonnes pratiques, en insistant sur les considérations éthiques et sur les stratégies pour en tirer le meilleur. Des conseils pratiques et des exemples vous aideront à optimiser votre expérience.
Prêt à franchir une nouvelle étape dans l’IA et la création ? Développez vos compétences et libérez votre potentiel créatif avec les outils plébiscités par les innovateurs de l’IA. Lancez-vous avec notre tutoriel How to Use Midjourney: A Comprehensive Guide to AI-Generated Artwork Creation dès aujourd’hui. Ou découvrez d’autres API populaires avec notre cours Working with the OpenAI API.
Scientifique de données aux multiples talents qui aime partager ses connaissances et rendre service aux autres, Zoumana est un créateur de contenu sur YouTube et un rédacteur technique de premier plan sur Medium. Il prend plaisir à parler, à coder et à enseigner. Zoumana est titulaire de deux masters. Le premier en informatique avec une spécialisation en apprentissage automatique à Paris, en France, et le second en science des données à l'université Texas Tech aux États-Unis. Son parcours professionnel a débuté en tant que développeur de logiciels au sein du Groupe OPEN en France, avant de rejoindre IBM en tant que consultant en apprentissage automatique, où il a développé des solutions d'IA de bout en bout pour les compagnies d'assurance. Zoumana a rejoint Axionable, la première startup d'IA durable basée à Paris et Montréal. Il y a occupé le poste de Data Scientist et a mis en œuvre des produits d'IA, principalement des cas d'utilisation NLP, pour des clients en France, à Montréal, à Singapour et en Suisse. En outre, 5 % de son temps a été consacré à la recherche et au développement. Il travaille actuellement en tant que scientifique de données senior à l'IFC, le groupe de la Banque mondiale.
