Kurs
Kling AI hat gerade Version 3.0 seiner KI-Videomodelle veröffentlicht. Ähnlich wie bei der Veröffentlichung von Seedance 2.0 ist das ein chinesischer Gegenentwurf zu einer von US‑Modellen dominierten KI-Landschaft – und möglicherweise das derzeit stärkste KI-Videomodell.
In diesem Artikel lernst du, wie du Kling 3.0 über die Weboberfläche voll ausreizt: Charaktere anlegen und Videos erstellen, in denen Figuren über mehrere Einstellungen hinweg konsistent bleiben.
Wenn du dich über die neuesten Releases in diesem Bereich informieren willst, schau dir unseren Leitfaden zu anderen Top-Modellen für Videogenerierung an.
Was ist Kling AI?
Kling AI ist eine generative KI-Plattform, mit der sich Videos aus Textprompts, Bildern oder einer Kombination daraus erstellen lassen. Entwickelt vom chinesischen Technologieunternehmen Kuaishou, gilt es schnell als eines der besten Modelle für Charakterkonsistenz. Die generierten Videos kommen mit nativer Tonspur und wirken dadurch erstaunlich hochwertig und einsatzbereit.
Kling AI: Preise und Zugriff
Wie bei vielen KI-Videomodellen basiert die Preisgestaltung von Kling AI auf Credits. Wir zahlen ein monatliches Abo und erhalten dafür ein festes Kontingent an Credits. Zusätzlich gibt es je nach Tarif kleinere Funktionen, die freigeschaltet werden. Der wichtigste Unterschied zwischen den Stufen bleibt aber die Anzahl der Generierungscredits.
Für diesen Artikel habe ich den Pro‑Plan (32,56 $ pro Monat) mit 3.000 Credits verwendet. Für weitere Details zu den Tarifen findest du alles auf der offiziellen Preisseite von Kling AI.
Wie viele Credits kostet die Videogenerierung?
Der Credit-Verbrauch hängt im Wesentlichen von drei Faktoren ab:
- Die Videolänge (3 bis 15 Sekunden)
- Die Auflösung (720p oder 1080p)
- Ob Audio generiert wird oder nicht

Gehen wir von Videos mit nativer Audioausgabe aus, lassen sich mit dem Pro-Abo pro Monat rund 6 Minuten 720p- oder 4 Minuten 1080p-Video generieren.
Die wichtigsten Funktionen von Kling 3.0
Die Beispiele in diesem Abschnitt stammen aus dem offiziellen Nutzerhandbuch zum Kling‑3.0‑Modell.
Implizite Multi-Shot-Szenen
Die meisten KI-Videomodelle funktionieren am besten, wenn der Prompt eine einzelne Einstellung oder Aktion beschreibt. Kling 3.0 versteht auch Prompts, die mehrere Einstellungen in einem Text enthalten.
Das folgende Beispiel beschreibt Setting und vier Einstellungen, ohne sie explizit als Liste zu nennen:
Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."
Der Prompt wurde mit einem Bild kombiniert, das das Modell als erste Videoframe verwendet.

Hier ist das Ergebnis:
Dieses Video hat mich sehr beeindruckt. Die Prompt-Treue ist hoch, und das Ergebnis wirkt auf mich ziemlich realistisch.
Explizite Multi-Shot-Szenen
Auch wenn das Modell anhand des Textes erkennen kann, wo eine Einstellung endet und die nächste beginnt, ist es nicht unfehlbar und kann den Prompt anders interpretieren als beabsichtigt. Wir können die Struktur erzwingen, indem wir die einzelnen Shots explizit im Prompt angeben.
Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.
Um jeden Shot festzulegen, klicken wir unten im Promptfeld auf den Button Custom Multi-Shot. Dort können wir für jeden Shot einen Prompt hinterlegen und die Dauer setzen. Pro Video sind bis zu 6 Shots möglich.

Hier ist das Ergebnis dieses Multi-Shot-Prompts:
Audio- und Tonkontrolle
Wie wir gesehen haben, erlaubt Kling 3.0 die Generierung von Videos mit nativer Audioausgabe. Es geht aber noch weiter. Wir können die generierte Tonspur steuern, indem wir im Prompt spezifizieren, was wir hören wollen. Zum Beispiel:
Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!
In diesem Beispiel liefert der Prompt Hinweise zu Hintergrundgeräuschen und zur Sprechweise der Personen im Video. Für Dialoge gilt in der Regel folgende Struktur:
<who is speaking> (<how things are said>) <what they say>
Hier ist das mit obigem Prompt generierte Video:
Dieses Beispiel basiert auf einem Bild als erstem Frame. So kann das Modell die Personen besser mit dem Prompt verknüpfen. Beeindruckend ist, dass das Modell allein anhand des Bildes Vater, Mutter, Junge und Mädchen korrekt zuordnet.
Mehrsprachige Sprachausgabe
Das Modell kann Sprach-Ausgabe in folgenden Sprachen generieren:
- Chinesisch
- Englisch
- Japanisch
- Koreanisch
- Spanisch
Wir können die gesprochene Sprache zusammen mit der Tonbeschreibung angeben:
<who is speaking> (<how things are said>, <language>) <what they say>
Hier ein Beispiel:
On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?"
Girl (sighing, Korean): "시험이 너무 무 서워"".
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."Subjektbindung
Die Subjektbindung sorgt dafür, dass bestimmte Charaktere oder visuelle Elemente über ein generiertes Video hinweg konsistent bleiben. Wenn Erscheinungsbild und Merkmale eines Subjekts fixiert werden, bleibt der Fokus stabil und wiedererkennbar – auch bei Kamerabewegungen wie Zoom, Schwenk oder Neigung.
Nachdem wir ein Bild als ersten Frame hochgeladen haben, aktivieren wir diese Funktion über die Option Bind elements to enhance Consistency. Dadurch entsteht eine Referenz, die das System nutzt, um visuelle Stabilität zu sichern und unerwünschte Veränderungen des Subjekts während der Generierung zu vermeiden.

Ohne Subjektbindung muss das Modell Merkmale raten, die im Startbild nicht sichtbar sind. Trägt die Person auf dem Bild beispielsweise eine Sonnenbrille, ist ein zusätzliches Porträt ohne Brille hilfreich. Weitere Perspektiven – etwa Blick nach links und rechts – sind ebenfalls sinnvoll, damit das Modell nicht „hinzuerfindet“, wie die Person aussieht.

Beim Erstellen eines Elements können wir bis zu drei Bilder hinterlegen. Außerdem lassen sich Stimme und Name des Charakters auswählen.
Hier ist das Ergebnis:
Diese Features sind für mich ein echter Gamechanger, weil gerade die Charakterkonsistenz bei KI-Video bislang oft frustrierend war. Häufig brauchte es extrem detaillierte Prompts und viele Iterationen, bis es passte.
Omni-Modus
Der Omni‑Modus von Kling AI vereint alle Funktionen in einem Modell. Du kannst ihn dir wie Subjektbindung auf Steroiden vorstellen: Er erlaubt, Elemente (Charaktere, Szenen, Objekte usw.) zu erstellen und sie anschließend in einem einzigen Prompt zusammenzuführen. So lassen sich sehr komplexe Szenen mit hoher Genauigkeit generieren.
Beispielsweise kannst du ein Charakter-Element über Referenzbilder anlegen und dann ein Szenen‑Element erstellen, um die Figur dort zu platzieren. Oder du erstellst mehrere Charaktere und entwickelst Dialoge zwischen ihnen, indem du sie im Prompt referenzierst.
Im Omni‑Modus kannst du bereits erstellte Elemente mit @ referenzieren. Daraufhin öffnet sich ein Pop‑up zur Auswahl des gewünschten Elements.

Hier ein Drei‑Shot‑Beispiel, das die Stärke und Vielseitigkeit von Omni zeigt:
Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!"
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me."
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."In diesem Beispiel sind @Image, @Grace, @Alan und @Samoyed separat erstellte Elemente, die in einem einzigen Prompt zusammenkommen.

Kling 3.0 im Praxistest
Im vorherigen Abschnitt haben wir die Kernfähigkeiten von Kling 3.0 kennengelernt und Beispiele von der offiziellen Website gezeigt. Die Resultate sind sehr beeindruckend, aber bei Firmenbeispielen ist Skepsis angebracht – sie sind kuratiert und zeigen oft nur die besten Fälle.
Hier drehen wir selbst eine Runde und testen neue Beispiele, um zu sehen, ob das Modell den Erwartungen standhält.
Beispiel 1: Einen Charakter generieren
Ich habe mit KI eine Fantasy-Figur erstellt: zunächst ein Ganzkörperbild, dann mehrere Posen – Blick nach links, nach rechts und mit wütendem Ausdruck.

Aus diesen Elementen habe ich den Charakter Elias zusammengestellt. Dann habe ich ein Bild für den ersten Videoframe generiert und die beiden per Subjektbindung verknüpft.

Das ist der Prompt, den ich verwendet habe:
Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides.
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line."
Elias pauses for a second.
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice."
Beachte, dass hier keine @-Referenzen genutzt werden, weil ich nicht im Omni‑Modus gearbeitet habe, sondern nur mit Subjektbindung. Hier ist das Ergebnis
Beispiel 2: Comedy‑Sketch mit Omni generieren
Hier habe ich versucht, eine Sitcom‑Szene unter Freunden zu erstellen. Ich habe drei Charaktere per KI erzeugt: Alex, Jamie und Sam – jeweils mit mehreren Posen.

Außerdem habe ich ein Bild für den Ort generiert und daraus ein Szenen‑Element erstellt.

Das ist der finale Prompt. Ich habe die Shots per Text beschrieben statt die Multi‑Shot‑Funktion zu nutzen, weil diese auf sechs Shots begrenzt. Kling 3.0 kommt damit problemlos zurecht.
Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."
Und so sah das Ergebnis aus:
Im Video sieht man ein paar Fehler:
- Es gibt einen Startframe mit leerer Couch. Das lag vermutlich an meinem Prompt, weil ich nicht explizit gesagt habe, dass die Charaktere in Shot 1 auf der Couch sitzen sollen. Beim erneuten Versuch startete es ebenfalls leer. Erst als ich einen ersten Frame mit sitzenden Charakteren vorgegeben habe, passte es – dann war es jedoch schwieriger, Alex ins Café eintreten zu lassen.
- Es sitzt eine zusätzliche Person auf der Couch.
Trotzdem finde ich das Resultat sehr überzeugend. Die Figuren wirken lebendig und authentisch, und insgesamt fließt die Szene gut.
Beispiel 3: Charakter in einem Multi‑Szenen‑Video wiederverwenden
Im letzten Beispiel habe ich die zuvor erstellten Charaktere in einem anderen Kontext eingesetzt. Ziel war es zu prüfen, wie konsistent sie zwischen Videos bleiben – ob sich also mit denselben Figuren mehrere Szenen glaubhaft erzählen lassen. Wenn Look & Feel erhalten bleiben, traue ich Kling 3.0 durchaus längeren Formaten zu.
Hier habe ich die Multi‑Shot‑Funktion genutzt und jeden Shot einzeln beschrieben. So ist die Szene konfiguriert:

Das ist das generierte Video:
Auch hier liegt das Ergebnis sehr nah an meiner Vorstellung. Abgesehen von ein paar Pausen für mehr Emotion und dem fehlenden sichtbaren Sprechen in der letzten Einstellung ist es wirklich gut gelungen.
Kling 3.0 vs. Runway Gen‑4.5 im Vergleich
Meiner Meinung nach war das beste KI‑Videomodell, das ich bisher getestet habe, Runway Gen‑4.5. Ich wollte diesen Artikel mit einem Vergleich zu Kling 3.0 abschließen – anhand einiger Prompts aus meinem Runway‑Artikel.
Physikverständnis
Dieses Beispiel prüft, wie gut das Modell physikalische Zusammenhänge versteht – mit einem Elefanten und einer Maus auf einer Wippe. Im ersten Fall sitzt die Maus bereits auf der Wippe und ein Elefant soll vom Himmel fallen; im zweiten ist es umgekehrt.
Beide Modelle verstehen offenbar, dass die Maus leichter ist als der Elefant. Kling 3.0 hielt sich etwas strenger an den Prompt, da in beiden Fällen Elefant und Maus vom Himmel fallen sollten.
Charakteremotionen
Im zweiten Beispiel geht es darum, wie gut die Modelle Emotionen transportieren. Der Prompt fordert ein Video von einer Person, die eine sehr traurige Textnachricht erhält.
Hier ist Kling 3.0 klar vorn. Die Emotionen wirken echt, während das Runway‑4.5‑Video merkwürdige Tränen zeigt und sogar Wasser aus dem Mund der Figur läuft.
Komplexe Fantasy‑Szene
Im letzten Beispiel sollen beide Modelle eine komplexe Fantasy‑Szene generieren: Die Protagonistin hat einen magischen Pinsel, mit dem sie Dinge zeichnet und zum Leben erweckt. Auf der Flucht vor den Bösewichten nutzt sie den Pinsel, um aus einer Sackgasse zu entkommen.
Keines der Modelle kann die Szene vollständig umsetzen, aber Runways Ergebnis ist etwas treffender. Allerdings wurden beide mit einem einzigen langen Prompt generiert. Mit den Omni‑Funktionen von Kling ließe sich die Szene meiner Ansicht nach umsetzen.
Fazit
Kling 3.0 ist die erste Video‑KI, bei der ich wirklich das Gefühl habe, das in meinem Kopf auch umsetzen zu können – nicht nur eine Annäherung.
Mit genug Credits und einem fixen Skript traue ich ihm komplette, konsistente Episoden oder sogar einen Film zu – mit durchgehender Charakteridentität, passendem Ton und sauberer Kontinuität zwischen den Szenen. Iteration und Qualitätskontrolle bleiben nötig, aber es fühlt sich endlich wie normale Produktionsarbeit an, nicht wie ein Ringkampf mit dem Modell.
In meinen Tests saß es nicht jedes Mal auf Anhieb; gelegentlich wurden zwei Figuren verwechselt, links‑rechts in den Shots vertauscht oder selten eine Zeile anders zugeordnet. Insgesamt lag der erste Versuch pro Szene aber meist sehr nah am Wunschresultat.
Allerdings finde ich Kling noch recht teuer, vor allem für Hobby‑Projekte. Ich würde gern längere Inhalte angehen, aber bei den aktuellen Preisen ist die Credit‑Rechnung für Experimente und Retakes schwer zu rechtfertigen.
Die gute Nachricht: Der Trend ist klar. Die Qualität steigt schnell, die Effizienz nimmt zu, der Wettbewerb zieht an. Ich bin zuversichtlich, dass die Kosten fallen und der Zugang breiter wird – und dass KI‑Video bald günstig und präzise genug für Wochenendprojekte und Indie‑Produktionen ist.
Wenn du deine KI‑Kompetenzen schärfen und dich auf eine Arbeitswelt vorbereiten willst, in der KI zum Kernskill gehört, schau dir unseren AI Fundamentals course an.
Kling 3.0: Häufige Fragen
Kann Kling 3.0 Videos mit Dialog und Soundeffekten generieren?
Ja, Kling 3.0 kann synchronen Dialog, Hintergrundgeräusche und Tonvariationen direkt aus Prompts generieren. Du kannst festlegen, wie der Dialog gesprochen wird – inklusive Emotionen, Tonlage und Hinweisen auf Hintergrundaudio.
Welche Sprachen unterstützt Kling 3.0?
Das Modell unterstützt Sprachgenerierung in folgenden Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch.
Brauchst du Bilder, um Kling 3.0 zu nutzen?
Nein, Kling kann Videos auch allein aus Textprompts generieren. Referenzbilder verbessern jedoch die Charakterkonsistenz und visuelle Genauigkeit deutlich – besonders in Kombination mit Subjektbindung oder dem Omni‑Modus.
Eignet sich Kling 3.0 für längeres Storytelling?
Kling 3.0 hat starkes Potenzial für Longform‑Content, da Charaktere wiederverwendet, Multi‑Szenen‑Konsistenz gewahrt und komplexe Storys unterstützt werden. Für längere Produktionen braucht es jedoch viele Credits und iterative Verfeinerung.
Was sind die Hauptgrenzen von Kling 3.0?
Trotz der hohen Leistungsfähigkeit kann Kling 3.0 gelegentlich kleine Unstimmigkeiten einbauen, etwa vertauschte Figuren, Timing‑Pausen oder verpasste Dialogzeilen. Außerdem kann das Credit‑Modell für Casual‑ oder Hobby‑Nutzer die Experimentierfreude einschränken.


