Stable Diffusion Web UI (SDUI) ist eine benutzerfreundliche Browseroberfläche für das leistungsstarke generative KI-Modell Stable Diffusion. Dieses fortgeschrittene KI-Modell kann Bilder aus Textbeschreibungen erzeugen oder bestehende Bilder anhand von Prompts verändern. Die von AUTOMATIC1111 entwickelte Weboberfläche bietet eine komfortable Möglichkeit, mit Stable-Diffusion-Modellen zu arbeiten, ganz ohne tiefere Technik- oder Programmierkenntnisse.
Du kannst die Web UI lokal auf einem Laptop oder PC mit CPU- und GPU-Unterstützung nutzen. Außerdem kannst du dein eigenes Modell auf einem Server bereitstellen, damit andere damit experimentieren können. Sie unterstützt nahezu alle Betriebssysteme und GPUs, darunter Nvidia, AMD und Intel. Dieses Tool hat die Art und Weise verändert, wie Künstlerinnen und Künstler hochwertige Werke am eigenen Rechner erschaffen — privat, zugänglich und KI-gestützt.
In diesem Tutorial zeigen wir Schritt für Schritt, wie du SDUI auf einem Windows-11-Laptop mit Nvidia-GPU herunterlädst und einrichtest. Anschließend erkunden wir die Funktionen der Web UI, inklusive Erweiterungen und eigener Stable-Diffusion-Modelle. Der Guide ist für alle geeignet — auch ohne Technik-Background oder für Teenager.
CUDA für Nvidia-GPUs herunterladen und installieren
Du kannst die Stable Diffusion Web UI auch ohne GPU oder CUDA nutzen. Die Web UI läuft auf der CPU und liefert schnell Ergebnisse. Für deutlich kürzere Laufzeiten empfehlen wir jedoch, wenn möglich, die Nutzung der GPU-Beschleunigung.
Dieser Guide richtet sich ausschließlich an Nutzerinnen und Nutzer mit Nvidia-GPU unter Windows.
Installiere zunächst die aktuelle Version des CUDA Toolkit 12.3. Wähle die passenden Optionen für dein Betriebssystem und lade den Base-Installer herunter.

Installiere danach das aktuelle cuDNN. Lade die Zip-Datei von Nvidia cuDNN herunter. Achte darauf, dass die Version zum installierten CUDA Toolkit passt.

Entpacke alle Ordner der Zip-Datei, öffne sie und verschiebe die Inhalte in den CUDA-Toolkit-Ordner. In diesem Beispiel liegt er unter C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.3; bei dir kann der Pfad abweichen. Falls eine Nachfrage zu doppelten Dateien erscheint, wähle "Alle ersetzen".
Hinweis: Stelle sicher, dass die neuesten Nvidia-Treiber installiert sind, um die beste Leistung zu erzielen.
Stable Diffusion Web UI herunterladen und installieren
In diesem Abschnitt zeigen wir die einfachste, weitgehend automatisierte Installation von SDUI. Wir nutzen eine Binär-Distribution für alle, die Python und Git nicht installieren können.
- Lade die Datei
sd.Web UI.zipvon Release v1.0.0-pre herunter. Auch wenn es eine ältere Version ist, aktualisiert sich die Installation automatisch auf den neuesten Stand. - Entpacke die Zip-Datei an einen Ort deiner Wahl, z. B. nach
C:\Desktop\Web UI. - Zum Aktualisieren der Stable Diffusion Web UI doppelklicke einfach auf die Datei
update.bat. - Starte danach die Web UI mit einem Doppelklick auf
run.bat. Beim ersten Mal dauert es etwa eine Stunde, um alle benötigten Dateien und das Modell herunterzuladen. - Nach der Installation aller Python-Pakete und des Stable-Diffusion-Modells wirst du zu folgender lokaler URL im Browser weitergeleitet: "http://127.0.0.1:7860". Öffnet sich der Link nicht automatisch, klicke ihn im Terminal an.
Hinweis: Das Repository der Stable Diffusion Web UI enthält Installationshinweise für weitere Betriebssysteme.
Leitfaden zum Tab Txt2img
Im Standardbrowser siehst du die Oberfläche mit mehreren Optionen. Lass uns Schritt für Schritt Bilder in hoher Qualität erzeugen.
Klicke zuerst auf den Tab txt2img und gib positive und negative Prompts ein, um ein Bild eines Mädchens in einem dunklen Wald mit Weihnachtskleidung zu erzeugen. Zusätzliche Stichwörter verbessern Qualität und Stil.
Wir starten mit einem knappen Negativ-Prompt und fügen nach und nach weitere Schlüsselwörter hinzu, um wiederkehrende Bildfehler zu vermeiden.
Positiver Prompt: “masterpiece, best quality, ultra high res, visually stunning, a beautiful, 1girl, dark forest, style illustration, sorceress, dark theme, wearing Christmas clothes, close up, looking at camera”
Negativer Prompt: “bad quality, bad anatomy, worst quality, low quality, low resolution, extra fingers, blur, blurry, ugly, wrong proportions, watermark, image artifacts, lowres, ugly, jpeg artifacts, deformed, noisy image, 2girls, double images,”


Unser generiertes Artwork zeigt eine Frau in einer dunklen Weihnachtsszenerie — in hervorragender Qualität.
Jetzt passen wir die erweiterten Einstellungen an. Ändere die Bildgröße und erhöhe die Sampling-Schritte für mehr Details.


Alle generierten Bilder enthalten Metadaten mit positiven und negativen Prompts sowie den erweiterten Einstellungen. Damit kannst du das Ergebnis reproduzieren.
Wir senden das Bild jetzt per Foto-Emoji unter dem Bild in den Tab "img2img", wie oben gezeigt.
Wenn du dein eigenes generatives KI-Modell von Grund auf bauen möchtest, folge diesem Guide: Building a Diffuser Model From Scratch with PyTorch.
Leitfaden zum Tab Img2img
Im Tab img2img kannst du ein Referenzbild hochladen und mit unterschiedlichen Prompts in verschiedenen Stilen ähnliche Bilder erzeugen. Wir haben einen neuen positiven Prompt hinzugefügt und den negativen beibehalten, um vier Bilder in unterschiedlichen Stilen zu erstellen. Wenn du mehrere Bilder mit einem Prompt erzeugen willst, erhöhe in den Generationseinstellungen den Batch count.
Positiver Prompt: “masterpiece, best quality, ultra high res, visually stunning, a beautiful, 1barbie, pink theme, wearing Christmas clothes, close up, looking at camera, 3d, “


Die Ergebnisse sehen beeindruckend aus, mit unterschiedlichen Stilen und Requisiten. Manche ohne Krone, andere farbenfroher.

Wechsle nun zum Tab "Inpaint" und tausche die hölzerne Krone im Foto aus. Markiere mit dem Inpainting-Tool nur den oberen Kopfbereich des Mädchens und ersetze ihn durch eine goldene Krone. Inpainting verändert nur den ausgewählten Bildbereich.

Die neue goldene Krone fügt sich nahtlos ins Bild — ganz ohne Photoshop. Mit einem Markierungstool und einem kurzen Prompt lässt sich ein Teil des Bildes gezielt ändern.
Upscaler verwenden
Um unser Bild hochzuskalieren, senden wir es in den Tab Extras. Wir skalieren auf das Vierfache und lassen den Rest unverändert.

Klicke anschließend auf Generate, um “512x512” in wenigen Sekunden in “2048x2048” zu konvertieren — ohne sichtbaren Qualitätsverlust.

Die Bildgröße kannst du prüfen, indem du das Bild herunterlädst und die Dateieigenschaften öffnest.

PNG Info
Wie bereits gesehen, enthält jedes Bild Metadaten, die zeigen, wie es erzeugt wurde. Wenn du Infos zu einem früher generierten Bild einsehen willst, lade es im Tab "PNG Info" hoch. Dort findest du die positiven und negativen Prompts sowie die erweiterten Einstellungen.

Erweiterungen installieren
Um Erweiterungen in der Web UI zu installieren, wechsle in den Tab Extensions und dann zu install from URL. Füge dort die Repository-URL der Erweiterung ein. In unserem Fall installieren wir die ControlNet-Erweiterung über https://github.com/Mikubill/sd-Web UI-controlnet. ControlNet ist eine neuronale Netzwerkarchitektur, mit der sich Diffusionsmodelle über zusätzliche Bedingungen steuern lassen.

- Installiere anschließend die Erweiterung OpenPose Editor über die GitHub-URL:
https://github.com/fkunn1326/openpose-editorund klicke auf Install. - Lade das OpenPose-Modell aus dem Hugging-Face-Repository herunter:
hf.co/lllyasviel/ControlNet-v1-1/tree/main. Achte darauf, die Datei “control_v11p_sd15_openpose.pth” herunterzuladen. - Verschiebe die Modelldatei in das Verzeichnis der Stable Diffusion Web UI:
stable-diffusion-Web UI\extensions\sd-Web UI-controlnet\models - Nach erfolgreicher Installation steht dir der
OpenPose Editorzur Verfügung. - Verändere die Pose der Strichfigur mit der Maus und klicke zum Schluss auf “Send to txt2img”.

Scrolle nach unten und öffne das ControlNet-Panel. Aktiviere Enable, Pixel Perfect und wähle OpenPose.

Schreibe danach oben deinen positiven und negativen Prompt, um vier Bilder mit ähnlicher Pose zu erzeugen.
Positiver Prompt: “a belle dancer, near beach, looking at camera, high quality, hires, 4k, detailed “
Negativer Prompt: “worst quality, low quality, lowres, monochrome, greyscale, multiple views, comic, sketch, bad anatomy, deformed, disfigured, watermark, multiple_views, mutation hands, watermark, bad facial,”

Wir haben vier Bilder von Frauen in derselben Pose. Klicke auf ein Bild, um sie als Einzelbild zu betrachten.

Eigene Modelle verwenden
Jetzt laden und aktivieren wir ein Custom-Modell, das auf hochwertigen Porträts feinabgestimmt wurde, um besonders realistische Bilder zu erzeugen. CivitAI ist eine Plattform für diverse Open-Source-Modelle zur Bildgenerierung. Du kannst gezielt nach Modellen suchen und sie ohne Account herunterladen.
Wie du Stable Diffusion feinabstimmst, zeigt dieser Guide: Fine-tuning Stable Diffusion XL with DreamBooth and LoRA. Er führt dich in einfachen Schritten über Kaggle mit kostenlosem GPU-Zugang durchs Fine-Tuning.
In unserem Beispiel laden wir das Modell RealVisXL V2.0 über die Suche auf der Website und klicken im rechten Bereich auf Download.

Nach dem Download verschiebst du das Modell in das Model-Verzeichnis der Stable Diffusion Web UI unter C:\Desktop\Web UI\Web UI\models\Stable-diffusion.
Klicke links oben auf Aktualisieren und wähle dann im Dropdown das neue RealVisXL-Modell aus, um es zu aktivieren.

Hinweis: Auf einer nur CPU-beschleunigten Maschine kann das Generieren eines einzelnen Bildes bis zu 5 Minuten dauern. Nutze daher nach Möglichkeit eine GPU.
Die für RealVisXL optimierten positiven und negativen Prompts findest du, indem du auf der Modellseite nach unten scrollst und ein Bild öffnest. Die Bilder enthalten Metadaten, mit denen sich realistische Ergebnisse reproduzieren lassen. Wenn wir z. B. ein Bild von Spiderwoman erzeugen wollen, die nach oben schaut und in die Kamera blickt, nutzen wir die passenden Metadaten.
Positiver Prompt: “An image from a marvel spiderwoman, focused, decisive, surreal, dynamic pose, ultra highres, sharpness texture, High detail RAW Photo, detailed face, shallow depth of field, sharp eyes, (realistic skin texture:1.2), (freckles, moles:0.6), dslr, film grain”
Negativer Prompt: “(worst quality, low quality, illustration, 3d, 2d, painting, cartoons, sketch), open mouth”

Die Ergebnisse sind überzeugend: Licht, Farben, Hauttextur, Haare und Gesichtszüge wirken sehr realistisch.

Hier sind die beiden besten Bilder. Kolleginnen und Kollegen würden kaum glauben, dass sie generiert sind.
Aktuell zählt DALLE-3 zu den leistungsfähigsten Modellen. Mehr dazu im Blog An Introduction to Using DALL-E 3: Tips, Examples, and Features.
Fazit
Die Stable Diffusion Web UI macht KI-Bildgenerierung für alle zugänglich. Die benutzerfreundliche Oberfläche erleichtert die Arbeit mit modernen Diffusionsmodellen wie Stable Diffusion — auch ohne Technik-Know-how.
In diesem Tutorial haben wir gezeigt, wie du die Web UI unter Windows mit Nvidia-GPU herunterlädst, installierst und aktualisierst. Mit der SDUI-Einrichtung haben wir Kernfunktionen wie Text-zu-Bild, Bild-zu-Bild, Hochskalierung und mehr ausprobiert. Zusätzlich haben wir Erweiterungen installiert, um den Funktionsumfang zu erweitern — etwa ControlNet in Kombination mit dem OpenPose-Modell.
Zum Schluss haben wir mit einem feinabgestimmten Modell verblüffend realistische Gesichter generiert. Das zeigt, welches kreative Potenzial die Web UI freilegt — ganz ohne fortgeschrittene KI- oder Programmierkenntnisse.
Für dein nächstes Projekt: Probiere Diffusers in Python aus, um fotorealistische Bilder mit KI zu erzeugen. So baust du dir leicht deine eigene Oberfläche und generierst Bilder im Handumdrehen.
Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.
Code Along Series: Werde ein KI-Entwickler
Baue KI-Systeme und entwickle KI-Anwendungen mit OpenAI, LangChain, Pinecone und Hugging Face!

