Curso
Kling AI acaba de lanzar la versión 3.0 de sus modelos de vídeo con IA. Igual que ocurrió con el lanzamiento de Seedance 2.0, llega como respuesta desde China a un panorama dominado por modelos creados en EE. UU., y podría ser el mejor modelo de vídeo con IA del momento.
En este artículo aprenderás a exprimir Kling 3.0 desde su interfaz web para crear personajes y producir vídeos donde los personajes se mantengan consistentes entre planos.
Si quieres ponerte al día con los últimos lanzamientos en este espacio, te recomiendo nuestra guía sobre otros modelos punteros de generación de vídeo.
¿Qué es Kling AI?
Kling AI es una plataforma de IA generativa diseñada para crear vídeos a partir de prompts de texto, imágenes o una combinación de ambos. Desarrollada por la tecnológica china Kuaishou, se ha convertido rápidamente en uno de los mejores modelos para mantener la consistencia de los personajes. Los vídeos incluyen sonido nativo, lo que les da un acabado pulido y listo para usar.
Precio y acceso a Kling AI
Como en muchos modelos de vídeo con IA, el precio de Kling AI se basa en créditos. Pagas una suscripción mensual que te da acceso a un número fijo de créditos al mes. También hay pequeñas funciones bloqueadas según el plan, pero la principal diferencia es la cantidad de créditos de generación que recibes.
Para escribir este artículo utilicé el plan Pro (32,56 $ al mes), que incluye 3.000 créditos. Para más detalles sobre sus planes, consulta la página oficial de precios de Kling AI.
¿Cuántos créditos cuesta generar un vídeo?
El consumo de créditos depende principalmente de tres factores:
- La duración del vídeo (de 3 a 15 segundos)
- La resolución (720p o 1080p)
- Si se genera audio o no

Si generamos vídeos con audio nativo y contamos con una suscripción Pro, podemos esperar alrededor de 6 minutos de vídeo en 720p o 4 minutos en 1080p al mes.
Funciones clave de Kling 3.0
Los ejemplos de esta sección provienen de la guía oficial de usuario del modelo Kling 3.0.
Escenas multi‑plano implícitas
La mayoría de modelos de vídeo con IA funcionan mejor cuando el prompt describe un único plano o acción. Kling 3.0 es capaz de entender un prompt que describe varios planos en una sola instrucción.
El siguiente prompt de ejemplo describe el escenario y cuatro planos sin listarlos explícitamente:
Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."
El prompt se acompañó de una imagen, que el modelo usó como primer fotograma del vídeo.

Este es el resultado:
Este vídeo me ha sorprendido mucho. La adherencia al prompt es excelente y el resultado me parece bastante realista.
Escenas multi‑plano explícitas
Aunque el modelo puede entender dónde termina un plano y empieza el siguiente a partir del texto, no es perfecto y puede interpretar el prompt de forma distinta a lo que queremos. Podemos forzar la estructura de la escena mencionando explícitamente los planos en el prompt.
Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.
Para detallar cada plano, haz clic en el botón Custom Multi‑Shot al final del campo de prompt. Ahí puedes escribir un prompt para cada plano y fijar su duración. El modelo permite hasta 6 planos por vídeo.

Este es el resultado de este prompt multi‑plano:
Controles de audio y tono
Como hemos visto, Kling 3.0 permite generar vídeos con audio nativo. Pero va más allá. Podemos guiar el audio especificando en el prompt lo que queremos. Por ejemplo:
Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!
En este ejemplo, el prompt aporta información sobre el sonido ambiente y cómo deben hablar las personas en el vídeo. Para los diálogos, la estructura suele ser:
<who is speaking> (<how things are said>) <what they say>
Este es el vídeo generado con el prompt anterior:
Este ejemplo se generó a partir de una imagen como primer fotograma. Esto ayuda al modelo a asociar los personajes con el prompt. Es llamativo que, solo con la imagen, el modelo identifique quién es el padre, la madre, el niño y la niña.
Capacidades de habla multilingüe
El modelo puede generar voz en los siguientes idiomas:
- Chino
- Inglés
- Japonés
- Coreano
- Español
Podemos indicar el idioma junto con la descripción del tono:
<who is speaking> (<how things are said>, <language>) <what they say>
Aquí tienes un ejemplo:
On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?"
Girl (sighing, Korean): "시험이 너무 무 서워"".
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."Vinculación de sujetos
La vinculación de sujetos es una función que permite que personajes o elementos visuales concretos se mantengan consistentes a lo largo de un vídeo generado. Al fijar la apariencia y las características de un sujeto, garantizamos que el foco principal se mantenga estable y reconocible, incluso con movimientos de cámara como zoom, paneos o inclinaciones.
Tras subir una imagen como fotograma inicial, podemos activar esta función seleccionando la opción Bind elements to enhance Consistency. Esto crea una referencia que el sistema usa para mantener la estabilidad visual y evitar cambios no deseados del sujeto durante la generación del vídeo.

Sin la vinculación, el modelo tendrá que adivinar rasgos del sujeto que no se ven en la imagen inicial. Por ejemplo, en la imagen anterior la persona lleva gafas de sol. Sería útil aportar una imagen de su cara. También ayuda incluir otras poses, como mirar a la izquierda y a la derecha, si queremos que el modelo "no se invente" el aspecto de la persona.

Al crear un elemento, podemos aportar hasta tres imágenes. También podemos elegir una voz y un nombre para el personaje.
Este es el resultado:
En mi opinión, estas funciones cambian las reglas del juego, porque la consistencia de personajes era uno de los aspectos más frustrantes de la generación de vídeo con IA. A menudo exigía prompts muy detallados y muchas iteraciones para acertar.
Modo Omni
El modo Omni de Kling AI reúne todas las funciones en un único modelo. Es como una vinculación de sujetos potenciada: permite crear elementos (personajes, escenarios, objetos, etc.) y luego combinarlos en un solo prompt. Así se pueden generar escenas muy complejas con gran precisión.
Por ejemplo, podemos crear un personaje a partir de imágenes de referencia y luego un elemento de escena, colocando fácilmente al personaje en ese escenario. O crear varios personajes y desarrollar diálogos entre ellos haciendo referencia a esos personajes en el prompt.
Al usar el modo Omni, podemos referirnos a elementos creados previamente con @. Esto abre una ventana emergente para seleccionar el elemento al que queremos hacer referencia.

Aquí tienes un ejemplo de tres planos que muestra la potencia y versatilidad de Omni:
Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!"
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me."
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."En este ejemplo, @Image, @Grace, @Alan y @Samoyed son elementos creados por separado y usados juntos en un único prompt.

Probando Kling 3.0
En la sección anterior vimos las capacidades principales de Kling 3.0 y mostramos algunos ejemplos de su web oficial. Los resultados me parecen muy buenos, pero conviene ser escéptico con los ejemplos de las empresas, ya que suelen estar muy seleccionados.
En esta sección lo ponemos a prueba con ejemplos nuevos para ver si el modelo realmente cumple las expectativas.
Ejemplo 1: generar un personaje
Usé IA para generar un personaje de fantasía. Creé una imagen de cuerpo entero y luego varias poses: mirando a la izquierda, a la derecha y con expresión de enfado.

Combiné esos elementos para crear un personaje al que llamé Elias. Después generé una imagen para el primer fotograma del vídeo y utilicé la vinculación de sujeto para asociarlos.

Este es el prompt que utilicé:
Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides.
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line."
Elias pauses for a second.
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice."
Observa que no usa referencias con @ porque no usé el modo Omni para este vídeo, solo la vinculación de sujeto. Aquí tienes el resultado
Ejemplo 2: sketch cómico con Omni
Aquí intenté crear una escena tipo sitcom entre amigos. Creé tres personajes, Alex, Jamie y Sam, con IA. Como antes, generé varias poses para cada uno.

También generé una imagen para la localización y creé un elemento de escena con ella.

Este es el prompt final que utilicé. Describí los planos con un prompt de texto en lugar de la función multi‑plano porque esta limita la escena a seis planos. Resulta que Kling 3.0 también es capaz de manejarlo así.
Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."
Y este fue el resultado:
Se aprecian algunos fallos en el vídeo:
- Hay un primer fotograma con el sofá vacío. Probablemente es culpa mía por no especificar que los personajes debían estar en el sofá en el plano 1. Sin embargo, al reintentar también empezó vacío. Solo al aportar un primer fotograma con los personajes sentados en el sofá obtuve el resultado esperado, aunque así fue difícil hacer que Alex entrara en la cafetería.
- Hay un personaje extra sentado en el sofá.
Aun así, el resultado me parece muy convincente. Los personajes se sienten vivos y auténticos, y en general la escena fluye bastante bien.
Ejemplo 3: reutilizar un personaje en un vídeo multi‑escena
En este último ejemplo intenté reutilizar los personajes creados en un contexto diferente. La idea era comprobar cuán consistentes se mantienen entre vídeos para ver si es viable crear varias escenas con los mismos personajes. Si la apariencia y el carácter se mantienen, creo de verdad que Kling 3.0 podría servir para generar contenidos de mayor duración.
En este caso usé la funcionalidad multi‑plano para describir cada toma. Esta es la configuración de la escena:

Este es el vídeo que generó:
De nuevo, el resultado está muy cerca de lo que buscaba. Salvo algunas pausas para añadir emoción y que no se ve hablar al personaje en el último plano, está muy logrado.
Comparativa Kling 3.0 vs Runway Gen‑4.5
En mi opinión, el mejor modelo de vídeo con IA que había probado hasta ahora era Runway Gen‑4.5. Quería cerrar el artículo comparándolo con Kling 3.0 usando algunos prompts que utilicé en este artículo sobre Runway.
Comprensión de la física
Este ejemplo pone a prueba cómo entiende la física cada modelo con un elefante y un ratón en un balancín. En el primer caso, el ratón está sentado y un elefante debería caer del cielo; en el segundo, al revés.
Ambos modelos parecen entender que el ratón es más ligero que el elefante. Kling 3.0 se ciñó un poco más al prompt, ya que en ambos casos el elefante y el ratón debían caer del cielo.
Emociones de los personajes
El segundo ejemplo evalúa cómo transmite emociones cada modelo. El prompt pide generar un vídeo de alguien recibiendo un mensaje de texto muy triste.
Aquí Kling 3.0 gana con claridad. Las emociones se sienten reales, mientras que en el vídeo de Runway 4.5 aparecen lágrimas extrañas e incluso sale agua por la boca del personaje.
Escena de fantasía compleja
En este último ejemplo pedimos a ambos modelos que generasen una escena de fantasía compleja donde la protagonista tiene un pincel mágico que dibuja cosas y las hace cobrar vida. Huye de los malos y usa el pincel para escapar de un callejón sin salida.
Ninguno de los modelos consigue generar por completo esta escena, pero el resultado de Runway es más preciso. Aun así, ambos se generaron con un único prompt largo. Creo que la escena sería abordable usando las funciones Omni de Kling.
Conclusión
Kling 3.0 es la primera IA de vídeo que de verdad me hace sentir que puedo ejecutar lo que tengo en la cabeza, no solo aproximarlo.
Con suficientes créditos y un guion cerrado, estoy convencido de que podría sostener episodios completos y consistentes, o incluso un largometraje, manteniendo identidad de personajes, tono y continuidad entre escenas. Sigue habiendo iteración y control de calidad, pero por fin se siente como producción normal, no como pelearse con el modelo para que obedezca.
En mis pruebas, no clavó el resultado siempre; a veces confundió dos personajes o invirtió izquierda‑derecha entre planos y, en raras ocasiones, reasignó una línea. Pero, en general, el primer intento de cada escena solía quedar muy cerca del objetivo.
Dicho esto, Kling me sigue pareciendo algo caro, sobre todo para aficionados como yo. Me encantaría lanzarme a contenidos más largos, pero con los precios actuales, la cuenta de créditos complica justificar la experimentación y las repeticiones.
La buena noticia es que la tendencia está clara: la calidad sube rápido, la eficiencia mejora y la competencia aprieta. Confío en que los costes bajarán y el acceso se ampliará, y no tardaremos en ver creación de vídeo con IA lo bastante barata y precisa para proyectos de fin de semana y producciones indie.
Si te interesa afilar tus habilidades en IA y prepararte para un mundo donde la IA es una competencia clave en el mercado laboral, echa un vistazo a nuestro curso de AI Fundamentals.
Kling 3.0: preguntas frecuentes
¿Kling 3.0 puede generar vídeos con diálogos y efectos de sonido?
Sí, Kling 3.0 puede generar diálogos sincronizados, sonidos de fondo y variaciones de tono directamente a partir de prompts. Puedes especificar cómo se pronuncia cada línea: emociones, tono y pistas de audio ambiente.
¿Qué idiomas admite Kling 3.0?
El modelo soporta generación de voz en los siguientes idiomas: chino, inglés, japonés, coreano y español.
¿Necesitas imágenes para usar Kling 3.0?
No, Kling puede generar vídeos solo con prompts de texto. Sin embargo, aportar imágenes de referencia mejora notablemente la consistencia de los personajes y la fidelidad visual, especialmente usando la vinculación de sujetos o el modo Omni.
¿Kling 3.0 es adecuado para contar historias largas?
Kling 3.0 muestra un gran potencial para contenidos de larga duración porque permite reutilizar personajes, mantener la consistencia entre escenas y contar historias complejas. No obstante, producir piezas largas puede requerir muchos créditos y varias iteraciones.
¿Cuáles son las principales limitaciones de Kling 3.0?
Aunque es muy capaz, Kling 3.0 puede introducir pequeñas inconsistencias como intercambiar personajes, pausas de timing o líneas de diálogo omitidas. Además, el sistema de créditos puede limitar la experimentación para usuarios ocasionales o aficionados.





