Cours
Kling AI vient de publier la version 3.0 de ses modèles vidéo d'IA. À l'image de la sortie de Seedance 2.0, il s'agit d'une réponse chinoise à un paysage dominé par des modèles américains, et c'est peut-être bien le meilleur modèle vidéo IA du moment.
Dans cet article, vous apprendrez à exploiter pleinement Kling 3.0 via son interface web pour créer des personnages et produire des vidéos où les personnages restent cohérents d'un plan à l'autre.
Si vous souhaitez suivre les dernières sorties dans ce domaine, nous vous conseillons notre guide sur les meilleurs modèles de génération vidéo.
Qu'est-ce que Kling AI ?
Kling AI est une plateforme d'IA générative conçue pour créer des vidéos à partir de textes, d'images ou d'une combinaison des deux. Développée par la société technologique chinoise Kuaishou, elle s'est rapidement imposée parmi les meilleurs modèles pour la cohérence des personnages. Les vidéos générées intègrent un son natif, pour un rendu propre et prêt à l'emploi.
Tarification et accès à Kling AI
Comme beaucoup de modèles vidéo IA, la tarification de Kling AI repose sur des crédits. On paie un abonnement mensuel donnant accès à un nombre fixe de crédits. D'autres petites fonctionnalités varient selon la formule, mais le principal différenciateur reste le volume de crédits de génération inclus.
Pour rédiger cet article, j'ai utilisé leur offre Pro (32,56 $ par mois), qui inclut 3 000 crédits. Pour plus de détails sur les formules, consultez la page officielle des tarifs Kling AI.
Combien de crédits faut-il pour générer une vidéo ?
La consommation de crédits dépend principalement de trois facteurs :
- La durée de la vidéo (de 3 à 15 secondes)
- La résolution (720p ou 1080p)
- La présence ou non d'audio généré

En supposant une génération avec audio natif, avec un abonnement Pro, on peut s'attendre à environ 6 minutes de vidéo 720p ou 4 minutes en 1080p par mois.
Fonctionnalités clés de Kling 3.0
Les exemples de cette section proviennent du guide utilisateur officiel du modèle Kling 3.0.
Scènes multi-plans implicites
La plupart des modèles vidéo IA fonctionnent mieux lorsque le prompt décrit un seul plan ou une seule action. Kling 3.0 comprend un prompt qui décrit plusieurs plans en une seule fois.
L'exemple ci-dessous présente le décor et quatre plans sans les énumérer explicitement :
Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."
Le prompt était associé à une image, utilisée par le modèle comme premier cadre de la vidéo.

Voici le résultat :
J'ai trouvé cette vidéo très convaincante. L'adhérence au prompt est forte et le rendu me paraît très réaliste.
Scènes multi-plans explicites
Même si le modèle sait délimiter des plans à partir d'un prompt texte, il n'est pas infaillible et peut interpréter différemment de ce qu'on attendait. On peut imposer la structure d'une scène en mentionnant explicitement les plans dans le prompt.
Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.
Pour spécifier chaque plan, cliquez sur le bouton Custom Multi-Shot en bas du champ de prompt. Vous pouvez y définir un prompt et une durée pour chaque plan. Le modèle accepte jusqu'à 6 plans par vidéo.

Voici le résultat de ce prompt multi-plans :
Contrôles de l'audio et du ton
Comme nous l'avons vu, Kling 3.0 permet de générer des vidéos avec audio natif. Mais il va plus loin : on peut orienter l'audio généré en précisant nos attentes dans le prompt. Par exemple :
Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!
Ici, le prompt indique les sons d'ambiance et la manière de parler des personnages. Pour les dialogues, la structure est généralement :
<who is speaking> (<how things are said>) <what they say>
Voici la vidéo générée avec le prompt ci-dessus :
Cet exemple a été généré à partir d'une image de premier cadre. Cela aide le modèle à associer les personnages au prompt. Impressionnant : à partir de la seule image, le modèle identifie qui sont le père, la mère, le garçon et la fille.
Synthèse vocale multilingue
Le modèle peut générer des dialogues dans les langues suivantes :
- Chinois
- Anglais
- Japonais
- Coréen
- Espagnol
On peut préciser la langue parlée en même temps que la description du ton :
<who is speaking> (<how things are said>, <language>) <what they say>
Voici un exemple :
On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?"
Girl (sighing, Korean): "시험이 너무 무 서워"".
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."Ancrage de sujet
L'ancrage de sujet permet de conserver des personnages ou éléments visuels spécifiques tout au long d'une vidéo générée. En figeant l'apparence et les caractéristiques du sujet, on assure une focalisation stable et reconnaissable, même lors de mouvements de caméra (zoom, panoramique, inclinaison).
Après avoir téléversé une image comme premier cadre, on active cette fonction en sélectionnant l'option Bind elements to enhance Consistency. Le système crée alors une référence pour maintenir la stabilité visuelle et éviter les variations indésirables du sujet pendant la génération.

Sans ancrage, le modèle doit deviner les attributs non visibles dans l'image initiale. Par exemple, sur l'image ci-dessus, le sujet porte des lunettes de soleil : il serait utile de fournir un portrait découvert. D'autres poses (regards à gauche et à droite) aident aussi le modèle à ne pas « inventer » l'apparence de la personne.

Lors de la création d'un élément, on peut fournir jusqu'à trois images. On peut aussi choisir une voix et un nom pour le personnage.
Voici le résultat :
Personnellement, je trouve ces fonctions révolutionnaires, car la cohérence des personnages était l'un des aspects les plus frustrants de la génération vidéo par IA : il fallait souvent des prompts très détaillés et de nombreuses itérations pour y arriver.
Mode Omni
Le mode Omni de Kling AI réunit toutes les fonctions dans un seul modèle. On peut le voir comme de l'ancrage de sujet sous stéroïdes : il permet de créer des éléments (personnages, décors, objets, etc.) puis de les convoquer dans un même prompt. On peut ainsi générer des scènes très complexes avec une grande précision.
Par exemple, on crée un élément « personnage » à partir d'images de référence, puis un élément « scène », et on place facilement le personnage dans ce décor. On peut aussi créer plusieurs personnages et écrire des dialogues entre eux en les référençant dans le prompt.
En mode Omni, on référence les éléments créés avec @. Une fenêtre surgissante permet alors de sélectionner l'élément voulu.

Voici un exemple en trois plans qui illustre la puissance et la polyvalence d'Omni :
Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!"
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me."
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."Dans cet exemple, @Image, @Grace, @Alan et @Samoyed sont des éléments créés séparément puis utilisés ensemble dans un seul prompt.

Mettre Kling 3.0 à l'épreuve
Dans la section précédente, nous avons présenté les capacités essentielles de Kling 3.0 avec quelques exemples issus de leur site. Les résultats sont très impressionnants, mais il faut rester prudent : les démos officielles sont souvent triées sur le volet.
Dans cette section, nous faisons nos propres tests sur de nouveaux cas pour vérifier si le modèle tient vraiment ses promesses.
Exemple 1 : générer un personnage
J'ai utilisé l'IA pour créer un personnage de fantasy. J'ai généré une image en pied, puis plusieurs poses différentes : regard à gauche, à droite, expression courroucée.

J'ai combiné ces éléments pour créer un personnage nommé Elias. J'ai ensuite généré une image de premier cadre et utilisé l'ancrage de sujet pour lier les deux.

Voici le prompt utilisé :
Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides.
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line."
Elias pauses for a second.
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice."
Notez que je n'utilise pas les références @ car je n'ai pas activé le mode Omni pour cette vidéo, seulement l'ancrage de sujet. Voici le résultat
Exemple 2 : générer un sketch comique avec Omni
Ici, j'ai cherché à créer une scène de sitcom entre amis. J'ai conçu trois personnages, Alex, Jamie et Sam, via l'IA, en générant là encore plusieurs poses pour chacun.

J'ai aussi généré une image de lieu et créé un élément de scène.

Voici le prompt final utilisé. J'ai décrit les plans en texte plutôt que d'utiliser la fonction multi-plans, car celle-ci limite à six plans. Kling 3.0 s'en sort très bien ainsi aussi.
Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."
Et voici le résultat :
On remarque quelques imperfections :
- Un premier cadre avec le canapé vide. Probablement ma faute : je n'avais pas précisé que les personnages devaient être assis au plan 1. Même en relançant, la scène démarrait vide. En fournissant un premier cadre avec les personnages déjà assis, j'ai obtenu le résultat attendu, mais il était alors difficile de faire entrer Alex dans le coffee shop.
- Un personnage supplémentaire est assis sur le canapé.
Malgré cela, le rendu reste très convaincant : les personnages sont vivants et crédibles, et l'ensemble s'enchaîne plutôt bien.
Exemple 3 : réutiliser un personnage dans une vidéo multi-scènes
Dans ce dernier exemple, j'ai réutilisé des personnages dans un contexte différent. L'idée était de jauger leur cohérence entre plusieurs vidéos pour voir si l'on pouvait créer des scènes multiples avec les mêmes personnages. Si l'apparence et le ressenti restent stables, je suis convaincu que Kling 3.0 peut servir à produire des formats longs.
Ici, j'ai utilisé la fonctionnalité multi-plans pour décrire chaque plan. Voici la configuration de la scène :

Voici la vidéo générée :
Là encore, le résultat est très proche de ce que je visais. Hormis quelques pauses pour ajouter de l'émotion, et l'absence de mouvement de lèvres au dernier plan, c'est très bien exécuté.
Kling 3.0 vs Runway Gen-4.5 : comparaison
Selon moi, le meilleur modèle vidéo IA que j'avais testé jusque-là était Runway Gen-4.5. Je souhaitais conclure en le comparant à Kling 3.0 avec quelques prompts déjà utilisés dans cet article sur Runway.
Compréhension de la physique
Cet exemple teste la compréhension de la physique avec un éléphant et une souris sur une balançoire à bascule. Dans le premier cas, la souris est assise et l'éléphant doit tomber du ciel ; dans le second, l'inverse.
Les deux modèles comprennent que la souris est plus légère que l'éléphant. Kling 3.0 respecte un peu mieux le prompt : dans les deux cas, l'éléphant et la souris sont censés tomber du ciel.
Émotions des personnages
Le deuxième exemple évalue la capacité à rendre les émotions. Le prompt demande de générer une vidéo d'une personne recevant un message très triste.
Ici, Kling 3.0 l'emporte nettement. Les émotions paraissent réelles, tandis que la vidéo de Runway 4.5 présente des larmes étranges et même de l'eau qui sort de la bouche du personnage.
Scène de fantasy complexe
Dans ce dernier test, nous avons demandé aux deux modèles de générer une scène de fantasy complexe où le protagoniste possède un pinceau magique capable de dessiner des objets et de leur donner vie. Il fuit des antagonistes et utilise le pinceau pour s'échapper d'une impasse.
Aucun modèle ne parvient à tout réaliser, mais le résultat de Runway est plus proche. Cela dit, ces vidéos ont été générées avec un seul long prompt. Je pense que la scène serait exécutable avec les fonctionnalités Omni de Kling.
Conclusion
Kling 3.0 est la première IA vidéo qui me donne vraiment l'impression de pouvoir exécuter ce que j'ai en tête, pas seulement de m'en approcher.
Avec suffisamment de crédits et un script verrouillé, je suis convaincu qu'il peut porter des épisodes entiers, cohérents, voire un film, en maintenant l'identité des personnages, le ton et la continuité entre les scènes. Il reste de l'itération et du contrôle qualité, mais on a enfin l'impression d'un flux de production normal, sans lutter contre le modèle.
Dans mes essais, ce n'était pas parfait à chaque fois : parfois, deux personnages étaient inversés, leur position gauche-droite était permutée entre les plans, ou une réplique était mal attribuée. Mais, dans l'ensemble, la première tentative était généralement très proche du résultat souhaité.
Cela dit, je trouve encore Kling un peu onéreux, surtout pour les hobbyistes comme moi. J'aimerais me lancer sur des formats longs, mais à ce niveau de prix, l'arbitrage en crédits freine l'expérimentation et les reprises.
La bonne nouvelle, c'est que la trajectoire est claire : la qualité grimpe vite, l'efficience s'améliore et la concurrence s'intensifie. Les coûts baisseront, l'accès s'élargira, et la création vidéo par IA sera bientôt assez abordable et précise pour des projets du week-end comme pour des productions indépendantes.
Si vous souhaitez développer vos compétences en IA et vous préparer à un marché de l'emploi où l'IA devient une compétence clé, consultez notre parcours AI Fundamentals.
Kling 3.0 : FAQ
Kling 3.0 peut-il générer des vidéos avec dialogues et effets sonores ?
Oui, Kling 3.0 peut générer des dialogues synchronisés, des sons d'ambiance et des variations de ton directement à partir des prompts. Les utilisateurs peuvent préciser la façon de parler (émotions, ton) et les indices audio d'arrière-plan.
Quelles langues Kling 3.0 prend-il en charge ?
Le modèle prend en charge la génération de voix dans les langues suivantes : chinois, anglais, japonais, coréen et espagnol.
Faut-il des images pour utiliser Kling 3.0 ?
Non, Kling peut générer des vidéos uniquement à partir de prompts texte. Toutefois, fournir des images de référence améliore nettement la cohérence des personnages et la précision visuelle, notamment avec l'ancrage de sujet ou le mode Omni.
Kling 3.0 convient-il à la narration longue ?
Kling 3.0 montre un fort potentiel pour le contenu long, grâce à la réutilisation de personnages, à la cohérence multi-scènes et à la narration complexe. Cependant, produire des formats longs peut nécessiter beaucoup de crédits et des itérations.
Quelles sont les principales limites de Kling 3.0 ?
Malgré sa puissance, Kling 3.0 peut parfois introduire de petites incohérences : inversion de personnages, pauses de timing, ou réplique manquante. De plus, la tarification par crédits peut limiter l'expérimentation pour les utilisateurs occasionnels.


