Kurs
Wir leben inzwischen in einer Welt, in der Kreativität immer weniger Grenzen kennt. Dank generativer KI, die natürliche Sprache, Bilder und Videos erzeugen kann, lassen sich unsere lebhaftesten Vorstellungen in beeindruckende visuelle Realitäten verwandeln.
Solche Möglichkeiten wirkten vor wenigen Jahren noch wie Science-Fiction. Mit der bahnbrechenden Technologie der DALL-E 3 API ist das vorbei.
Dieser Artikel ist ein vollständiger Leitfaden zu DALL-E 3: Wir erklären die Technologie, zeigen ihre Funktionen, praktische Anwendungen in der realen Welt und wie sie die kreative Landschaft verändert.
Überblick über die DALL-E 3 API
Bevor wir in die API einsteigen, klären wir kurz, was DALL-E 3 ist. Eine ausführliche Einführung in die Nutzung von DALL-E 3 über Bing und ChatGPT findest du hier – dieser Guide konzentriert sich vor allem auf die API-Integration.
Was ist DALL-E 3?
DALL-E 3 ist OpenAIs neuestes Bildgenerierungsmodell und wurde im September 2023 angekündigt. Es versteht deutlich mehr Nuancen und Details als seine Vorgänger und ermöglicht es, aus Textbeschreibungen herausragende Visuals zu erzeugen.
Frühere Versionen wie DALL-E 1 (Januar 2021) und DALL-E 2 (April 2022) bereiteten den Weg. DALL-E 3 ist bislang die stärkste Ausführung. Unten findest du den Vergleich zu den Vorgängern.
Preise
Die Preisangaben beziehen sich auf jede DALL-E-Version. Nur DALL-E 3 bietet Standard- und HD-Bildqualität mit den jeweils verfügbaren Auflösungen.
|
Modell |
Qualität |
Auflösung |
Preis pro Bild (in US $) |
|
DALL-E |
1024x1024 |
0.13 |
|
|
DALL·E 2 |
1024×1024 |
0.020 |
|
|
512×512 |
0.018 |
||
|
256×256 |
0.016 |
||
|
DALL·E 3 |
Standard |
1024×1024 |
0.040 |
|
1024×1792, 1792×1024 |
0.080 |
||
|
HD |
1024×1024 |
0.080 |
|
|
1024×1792, 1792×1024 |
0.120 |
Weitere Merkmale
Die Tabelle oben zeigt einen Vergleich dreier DALL-E-Iterationen zur Bildgenerierung aus Text: DALL-E, DALL-E 2 und DALL-E 3 – jeweils mit eigenem Veröffentlichungszeitraum und Funktionsumfang.
- DALL-E, die erste Version, erschien im Januar 2021 und nutzte GPT-3 als Sprachmodell. Sie markierte den ersten großen Schritt für Text-zu-Bild-Technologie und war für alle mit einem OpenAI-API-Konto verfügbar.
- DALL-E 2 wurde im Juli 2022 veröffentlicht und setzte auf das Sprachmodell CLIP. Dessen Fähigkeiten verbesserten das Verständnis von Texteingaben und führten zu präziseren Bildern.
- Die jüngste Version, DALL-E 3, kam im Oktober 2023 und integriert das fortschrittlichere Sprachmodell GPT-4. Es bietet ein nochmals besseres Textverständnis und eine höhere Bildqualität. Verfügbar ist es sowohl für OpenAI-API-Nutzer als auch für „Plus“-Abonnentinnen und -Abonnenten über die ChatGPT-Oberfläche.
Jede Version steht für einen Entwicklungssprung in der Text-zu-Bild-KI – mit verbesserten Sprachmodellen und größerer Zugänglichkeit, im Sinne von OpenAIs Ziel, KI zu verbessern und zu demokratisieren.
Zusätzliche Funktionen gibt es über das „Plus“-Abo von OpenAI, darunter GPT-4 Vision. In unserem GPT-4 Vision: Der umfassende Guide für Einsteiger erfährst du alles Wichtige – vom Zugang über Praxisbeispiele bis zu Grenzen der Technologie.
|
DALL-E |
DALL-E 2 |
DALL-E 3 |
|
|
Veröffentlichung |
Januar 2021 |
Juli 2022 |
Oktober 2023 |
|
Eingabetyp |
Text-Prompt |
Text-Prompt |
Text-Prompt |
|
Sprachmodell |
GPT-3 |
CLIP |
GPT-4 |
|
Verfügbar für |
Alle mit einem OpenAI-API-Konto |
Alle mit einem OpenAI-API-Konto |
Alle mit einem OpenAI-API-Konto sowie „Plus“-Abonnentinnen und -Abonnenten über ChatGPT |
Warum eine API-Version?
OpenAI hat auf seinem ersten Developer Day mehrere APIs vorgestellt – darunter DALL-E 3.
Die API-Version von DALL-E 3 bietet direkten und flexiblen Zugriff auf die Funktionen. Nach der Integration in die ChatGPT-Oberfläche und Bing Chat, die eine stärker geführte Nutzung erlauben, ermöglicht die API Entwicklerinnen, Entwicklern und Unternehmen, DALL-E 3 direkt in eigene Anwendungen und Workflows einzubinden.
Funktionen der DALL-E 3 API
Die API bringt eine Reihe von Features mit, die das Nutzungserlebnis verbessern. Schauen wir sie uns im Detail an:

DALL-E 3 API-Funktionen
- Texteinbettung in Bildern: Die DALL-E 3 API kann gewünschten Text nahtlos in den Bildkontext integrieren, sodass er wie Teil der originalen Szene wirkt.
- Verschiedene Bildausrichtungen: Mit DALL-E 3 lassen sich Bilder im Quer- und Hochformat generieren – ideal für unterschiedliche Medien und Layouts.
- Höhere Bildqualität: Das Modell erzeugt nicht nur visuell ansprechende, sondern auch detailreiche Bilder und liefert so ein realistisches, fesselndes Ergebnis.
- Verständnis komplexer Prompts: DALL-E 3 interpretiert komplexe Eingaben zuverlässig und ermöglicht hochspezifische, detailreiche Visuals.
Branchenszenarien für die DALL-E 3 API
Viele Branchen nutzen DALL-E bereits seit den ersten Versionen. Die aktuelle API erweitert die Möglichkeiten der Bildgenerierung – für mehr Kreativität und Effizienz.
Es gibt zahllose Einsatzfelder. Wir konzentrieren uns hier auf drei Bereiche: Werbung und Marketing, Bildung und Videospielentwicklung.
- Werbung und Marketing: Agenturen können mit der API schnell maßgeschneiderte Visuals für Kampagnen und Branding erstellen – kreativer, schneller am Markt.
- Bildung: Online-Plattformen generieren mit der API passgenaue Illustrationen und Diagramme, damit Lernmaterialien ansprechender und für ein breiteres Publikum zugänglich werden.
- Videospielentwicklung: Einer der größten Profiteure: Games leben von Visuals. Studios können die Technologie einsetzen, um rasch einzigartige Game-Assets zu gestalten.
Hands-on: Einstieg in die DALL-E 3 API
Jetzt, da wir die DALL-E 3 API und ihre Möglichkeiten besser kennen, wird es kreativ. In diesem Abschnitt führen wir dich durch den Prozess der Bildgenerierung mit der DALL-E 3 API – nachdem alle Voraussetzungen eingerichtet sind.
Ablauf der Bildgenerierung
Für jede technische Umsetzung hilft ein visuelles Ablaufdiagramm, die Interaktion der Hauptkomponenten einer Anwendung zu zeigen.
Dieser Ablauf erklärt die Interaktion mit der API – vom individuellen Prompt bis zum finalen Bild.

Vereinfachter Workflow der Nutzerinteraktion mit der DALL-E 3 API
Der Workflow hat zwei Hauptteile:
- Das Frontend, in dem die Beschreibung für das gewünschte Bild eingegeben wird.
- Das Backend, das den Prompt der Nutzerin oder des Nutzers an die DALL-E 3 API übergibt.
Zeit für die technische Umsetzung. Den Quellcode zu diesem Tutorial findest du in diesem DataLab-Workbook. Erstelle eine Kopie und führe es direkt im Browser aus – ganz ohne Installation.
OpenAI KEY einrichten
Für die Reproduzierbarkeit dieses Tutorials brauchst du vor allem:
- Python: die Hauptprogrammiersprache für dieses Tutorial. Alternativ geht auch NodeJS.
- OpenAI: das Paket zur Interaktion mit OpenAI-Services
- OS: das Betriebssystem-Paket zum Setzen von Umgebungsvariablen
- Image: wandelt die DALL-E-3-Antwort in ein Bildformat um
Zuerst benötigst du den OpenAI KEY, um auf das DALL-E-3-Modell zuzugreifen. Die Schritte siehst du unten:

Vier Hauptschritte, um einen OpenAI KEY zu erstellen
Die vier Schritte sind weitgehend selbsterklärend. Wichtig ist, dass du dein Konto über die offizielle OpenAI-Website erstellst.
Mit der DALL-E 3 API interagieren
Gib deinen KEY nicht weiter – er ist privat. Richte ihn anschließend als Umgebungsvariable ein, damit du damit arbeiten kannst:
import os
OPENAI_API_KEY= “<YOUR PRIVATE KEY>”
os.environ["OPENAI_API_KEY"] = OPENAI_API_KEY
Die os.environ-Zuweisung startet die Interaktion mit OpenAI-Services – je nach Gültigkeitsbereich deines privaten Keys (Personal oder Enterprise).
Über die Generate-Funktion der OpenAI-Clients lassen sich dann festlegen:
- Das zu nutzende Modell – in diesem Tutorial dall-e-3.
- Der Prompt, der an das Modell gesendet wird.
- Die Abmessungen des finalen Bilds. Wir verwenden durchgängig 1024x1024.
- Die Bildqualität: standard oder hd. Wir generieren hier ausschließlich HD-Bilder.
- Die Anzahl der Bilder pro Aufruf über den Parameter n. DALL-E 3 erzeugt ein Bild pro Anfrage oder bis zu zehn gleichzeitig. Zur Einfachheit setzen wir n=1.
Die folgende Helper-Funktion fasst alles zur besseren Wiederverwendbarkeit zusammen. Zuvor installieren und importieren wir die benötigten Bibliotheken:
Die Installation erfolgt mit dem Python-Paketmanager pip:
pip install --upgrade openai
Die Option --upgrade bringt dich auf das Python SDK v1.2, das für die Interaktion mit DALL-E 3 erforderlich ist.
from openai import OpenAI
# Instantiate the OpenAI client
client = OpenAI()
from IPython.display import Image
Der client übernimmt die Kommunikation mit der DALL-E 3 API.
Hier ist die Helper-Funktion:
def get_image_from_DALL_E_3_API(user_prompt,
image_dimension="1024x1024",
image_quality="hd",
model="dall-e-3",
nb_final_image=1):
response = client.images.generate(
model = model,
prompt = user_prompt,
size = image_dimension,
quality = image_quality,
n=nb_final_image,
)
image_url = response.data[0].url
display(Image(url=image_url))
Realistische Bilder generieren
Mit der obigen Helper-Funktion probieren wir einfache und komplexe Prompts aus. Die komplexen Beispiele orientieren sich an den zuvor genannten Branchenszenarien.
Wichtig: Mehrfaches Ausführen desselben Codes führt zu unterschiedlichen Ergebnissen – das liegt am kreativen Anteil des Modells.
Einfacher Prompt
Senden wir etwa diesen Prompt an das Modell:
Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky.
puppy_prompt = "Create an image of a cute brown puppy sitting in a green meadow under a clear blue sky."
get_image_from_DALL_E_3_API(puppy_prompt)
Nach erfolgreicher Ausführung wird folgendes Bild erzeugt:

Bild, generiert aus einfachem Prompt
Das Ergebnis spiegelt den Prompt sehr gut wider.
Komplexere Prompts
Nun zu komplexeren Prompts für Bildung, Werbung und Game-Development.
Bildungsinhalte
- Prompt:
Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook.
- Code:
education_prompt = "Generate an illustration of the solar system with planets orbiting the sun, labeled in English, for a grade school science textbook"
get_image_from_DALL_E_3_API(education_prompt)
- Ergebnis:

Bild, generiert für den Prompt „Education“
Werbung und Marketing
- Prompt:
Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living.
- Code:
advertising_prompt = "Create an image of a family enjoying a picnic in a futuristic city park, with skyscrapers in the background and a clear blue sky, to be used in a campaign promoting eco-friendly urban living."
get_image_from_DALL_E_3_API(advertising_prompt)
- Ergebnis:

Bild, generiert für den Prompt „Advertising“
Game-Development
Im letzten Beispiel bitten wir das Modell, zusätzlich hervorgehobenen Text in Orange in das Bild zu integrieren – und schauen, wie es reagiert.
- Prompt:
Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style.
- Code:
game_dev_prompt = "Design a concept art of a mystical forest at twilight, with glowing plants and a hidden entrance to an underground cave, for an adventure game setting. Include a signpost in the image with the text 'Beware: Mythical Creatures Ahead' in an ancient, mystical font style"
get_image_from_DALL_E_3_API(game_dev_prompt)
- Ergebnis:

Bild, generiert für den Prompt „Game Development“
Wie zu sehen ist, konnte das Modell den Text „BEWARE MYTHICAL CREATURES AHEAD“ erfolgreich in das generierte Bild integrieren. Großartig.
Best Practices für die Nutzung der DALL-E 3 API
Für das bestmögliche Erlebnis mit der DALL-E 3 API beachte diese Empfehlungen:
- Kommuniziere präzise: DALL-E 3 profitiert von klaren, detaillierten Prompts – wie Menschen von klaren Anweisungen. Je eindeutiger die Beschreibung, desto treffender das Ergebnis.
- Ethik im Blick behalten: Achte bei Ergebnissen auf Urheberrecht und Datenschutz und bedenke mögliche Auswirkungen der generierten Bilder.
- Grenzen anerkennen: Wie jede Technologie hat auch DALL-E 3 Limitierungen. Wer sie kennt, formuliert Prompts realistischer und erzielt bessere Resultate.
- Dranbleiben und weiterlernen: Probiere unterschiedliche Prompts, um die Bandbreite der API und die eigenen kreativen Möglichkeiten auszuloten – wie Malerinnen und Maler verschiedene Pinsel und Farben testen.
Fazit
Dieser Artikel hat die DALL-E 3 API umfassend beleuchtet – vom Setup bis zu vielfältigen Anwendungen. Wir starteten mit einem Überblick und haben die wegweisenden Fähigkeiten eingeordnet.
Anschließend sind wir auf die spezifischen Funktionen eingegangen und haben die fortgeschrittenen Möglichkeiten der Bildgenerierung erläutert. Daran schlossen sich praxisnahe Branchenszenarien an, die die Vielseitigkeit und Wirkung der API zeigen.
Zudem haben wir die ersten Schritte mit der DALL-E 3 API beschrieben – vom Zugang bis zur Einrichtung für verschiedene Use Cases – und dabei betont, wie wichtig das Verständnis der Funktionen ist.
Abgerundet wurden die Inhalte durch Best Practices, ethische Hinweise und Strategien zur optimalen Nutzung. Konkrete Tipps und Beispiele helfen dir, das Potenzial der API voll auszuschöpfen.
Bist du bereit für deinen nächsten Schritt in der Welt von KI und kreativer Technologie? Bring deine Fähigkeiten auf das nächste Level und entfessle dein kreatives Potenzial mit den Tools, die KI-Vorreiter nutzen. Starte jetzt mit unserem Tutorial How to Use Midjourney: A Comprehensive Guide to AI-Generated Artwork Creation. Oder lerne andere gängige APIs kennen – zum Beispiel im Kurs Working with the OpenAI API.
Zoumana ist ein vielseitiger Datenwissenschaftler, der sein Wissen gerne mit anderen teilt und anderen etwas zurückgibt. Er erstellt Inhalte auf YouTube und schreibt auf Medium. Er hat Freude am Sprechen, Programmieren und Unterrichten. Zoumana hat zwei Master-Abschlüsse. Den ersten in Informatik mit dem Schwerpunkt Maschinelles Lernen in Paris, Frankreich, und den zweiten in Datenwissenschaft an der Texas Tech University in den USA. Sein beruflicher Werdegang begann als Softwareentwickler bei Groupe OPEN in Frankreich, bevor er als Berater für maschinelles Lernen zu IBM wechselte, wo er End-to-End-KI-Lösungen für Versicherungsunternehmen entwickelte. Zoumana arbeitet bei Axionable, dem ersten nachhaltigen KI-Startup mit Sitz in Paris und Montreal. Dort arbeitete er als Data Scientist und implementierte KI-Produkte, vor allem NLP-Anwendungsfälle, für Kunden aus Frankreich, Montreal, Singapur und der Schweiz. Zusätzlich widmete er 5% seiner Zeit der Forschung und Entwicklung. Zurzeit arbeitet er als Senior Data Scientist bei der IFC, der Weltbankgruppe.
