Ir al contenido principal

Kling 3.0: guía completa de generación de vídeo con IA

Descubre Kling 3.0 y sus funciones clave. Aprende a generar vídeos, crear tus propios personajes y montar escenas complejas con varios planos y audio nativo.
Actualizado 17 sept 2026  · 10 min leer

Explora con IA

ChatGPTClaudePerplexity

Kling AI acaba de lanzar la versión 3.0 de sus modelos de vídeo con IA. Igual que ocurrió con el lanzamiento de Seedance 2.0, llega como respuesta desde China a un panorama dominado por modelos creados en EE. UU., y podría ser el mejor modelo de vídeo con IA del momento.

En este artículo aprenderás a exprimir Kling 3.0 desde su interfaz web para crear personajes y producir vídeos donde los personajes se mantengan consistentes entre planos.

Si quieres ponerte al día con los últimos lanzamientos en este espacio, te recomiendo nuestra guía sobre otros modelos punteros de generación de vídeo.

¿Qué es Kling AI?

Kling AI es una plataforma de IA generativa diseñada para crear vídeos a partir de prompts de texto, imágenes o una combinación de ambos. Desarrollada por la tecnológica china Kuaishou, se ha convertido rápidamente en uno de los mejores modelos para mantener la consistencia de los personajes. Los vídeos incluyen sonido nativo, lo que les da un acabado pulido y listo para usar.

Precio y acceso a Kling AI

Como en muchos modelos de vídeo con IA, el precio de Kling AI se basa en créditos. Pagas una suscripción mensual que te da acceso a un número fijo de créditos al mes. También hay pequeñas funciones bloqueadas según el plan, pero la principal diferencia es la cantidad de créditos de generación que recibes.

Para escribir este artículo utilicé el plan Pro (32,56 $ al mes), que incluye 3.000 créditos. Para más detalles sobre sus planes, consulta la página oficial de precios de Kling AI.

¿Cuántos créditos cuesta generar un vídeo?

El consumo de créditos depende principalmente de tres factores:

  • La duración del vídeo (de 3 a 15 segundos)
  • La resolución (720p o 1080p)
  • Si se genera audio o no

Tabla de precios de Kling AI con créditos por segundo: 3.0 Vídeo—Audio nativo cuesta 12 créditos/s a 1080p y 9 créditos/s a 720p; Sin audio nativo cuesta 8 créditos/s a 1080p y 6 créditos/s a 720p. Ejemplos: 5 seg a 1080p con audio nativo = 60 créditos; 5 seg a 720p sin audio = 30 créditos.

Si generamos vídeos con audio nativo y contamos con una suscripción Pro, podemos esperar alrededor de 6 minutos de vídeo en 720p o 4 minutos en 1080p al mes.

Funciones clave de Kling 3.0

Los ejemplos de esta sección provienen de la guía oficial de usuario del modelo Kling 3.0.

Escenas multi‑plano implícitas

La mayoría de modelos de vídeo con IA funcionan mejor cuando el prompt describe un único plano o acción. Kling 3.0 es capaz de entender un prompt que describe varios planos en una sola instrucción.

El siguiente prompt de ejemplo describe el escenario y cuatro planos sin listarlos explícitamente:

Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."

El prompt se acompañó de una imagen, que el modelo usó como primer fotograma del vídeo.

Captura del editor Kling AI 3.0 mostrando una configuración de imagen a vídeo: una pareja cenando en la terraza de una villa como primer fotograma, editor de prompt multi‑plano, 720p 10 s, audio nativo y botón Generate.

Este es el resultado:

Este vídeo me ha sorprendido mucho. La adherencia al prompt es excelente y el resultado me parece bastante realista.

Escenas multi‑plano explícitas

Aunque el modelo puede entender dónde termina un plano y empieza el siguiente a partir del texto, no es perfecto y puede interpretar el prompt de forma distinta a lo que queremos. Podemos forzar la estructura de la escena mencionando explícitamente los planos en el prompt.

Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.

Para detallar cada plano, haz clic en el botón Custom Multi‑Shot al final del campo de prompt. Ahí puedes escribir un prompt para cada plano y fijar su duración. El modelo permite hasta 6 planos por vídeo.

Captura del editor Custom Multi‑Shot de Kling AI 3.0—constructor de escenas por prompt con cuatro planos: conductor de perfil, macro frontal, manos en el volante y foto envejecida de un niño.

Este es el resultado de este prompt multi‑plano:

Controles de audio y tono

Como hemos visto, Kling 3.0 permite generar vídeos con audio nativo. Pero va más allá. Podemos guiar el audio especificando en el prompt lo que queremos. Por ejemplo:

Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!

En este ejemplo, el prompt aporta información sobre el sonido ambiente y cómo deben hablar las personas en el vídeo. Para los diálogos, la estructura suele ser:

<who is speaking> (<how things are said>) <what they say>

Este es el vídeo generado con el prompt anterior:

Este ejemplo se generó a partir de una imagen como primer fotograma. Esto ayuda al modelo a asociar los personajes con el prompt. Es llamativo que, solo con la imagen, el modelo identifique quién es el padre, la madre, el niño y la niña.

Capacidades de habla multilingüe

El modelo puede generar voz en los siguientes idiomas: 

  • Chino
  • Inglés
  • Japonés
  • Coreano
  • Español

Podemos indicar el idioma junto con la descripción del tono:

<who is speaking> (<how things are said>, <language>) <what they say>

Aquí tienes un ejemplo:

On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?" 
Girl (sighing, Korean): "시험이 너무 무 서워"". 
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."

Vinculación de sujetos

La vinculación de sujetos es una función que permite que personajes o elementos visuales concretos se mantengan consistentes a lo largo de un vídeo generado. Al fijar la apariencia y las características de un sujeto, garantizamos que el foco principal se mantenga estable y reconocible, incluso con movimientos de cámara como zoom, paneos o inclinaciones.

Tras subir una imagen como fotograma inicial, podemos activar esta función seleccionando la opción Bind elements to enhance Consistency. Esto crea una referencia que el sistema usa para mantener la estabilidad visual y evitar cambios no deseados del sujeto durante la generación del vídeo.

Interfaz de vinculación de sujetos en Kling AI 3.0: panel “Bind elements to enhance consistency” con primer fotograma de una mujer en un ascensor, opción Add end frame, búsqueda/creación de sujeto y ejemplos (Sam, Jamie) para bloquear la consistencia del personaje entre planos.

Sin la vinculación, el modelo tendrá que adivinar rasgos del sujeto que no se ven en la imagen inicial. Por ejemplo, en la imagen anterior la persona lleva gafas de sol. Sería útil aportar una imagen de su cara. También ayuda incluir otras poses, como mirar a la izquierda y a la derecha, si queremos que el modelo "no se invente" el aspecto de la persona.

Captura de la interfaz Create Element de Kling para vinculación de sujetos y consistencia de personajes: Sara en fotogramas de metro/ascensor (gafas de sol, abrigo negro) con preajustes de voz.

Al crear un elemento, podemos aportar hasta tres imágenes. También podemos elegir una voz y un nombre para el personaje.

Este es el resultado:

En mi opinión, estas funciones cambian las reglas del juego, porque la consistencia de personajes era uno de los aspectos más frustrantes de la generación de vídeo con IA. A menudo exigía prompts muy detallados y muchas iteraciones para acertar.

Modo Omni

El modo Omni de Kling AI reúne todas las funciones en un único modelo. Es como una vinculación de sujetos potenciada: permite crear elementos (personajes, escenarios, objetos, etc.) y luego combinarlos en un solo prompt. Así se pueden generar escenas muy complejas con gran precisión.

Por ejemplo, podemos crear un personaje a partir de imágenes de referencia y luego un elemento de escena, colocando fácilmente al personaje en ese escenario. O crear varios personajes y desarrollar diálogos entre ellos haciendo referencia a esos personajes en el prompt.

Al usar el modo Omni, podemos referirnos a elementos creados previamente con @. Esto abre una ventana emergente para seleccionar el elemento al que queremos hacer referencia.

Referencia a un elemento usando @.

Aquí tienes un ejemplo de tres planos que muestra la potencia y versatilidad de Omni:

Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!" 
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me." 
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."

En este ejemplo, @Image, @Grace, @Alan y @Samoyed son elementos creados por separado y usados juntos en un único prompt.

Elementos del modo Omni de Kling AI: imágenes de referencia de los elementos.

Probando Kling 3.0

En la sección anterior vimos las capacidades principales de Kling 3.0 y mostramos algunos ejemplos de su web oficial. Los resultados me parecen muy buenos, pero conviene ser escéptico con los ejemplos de las empresas, ya que suelen estar muy seleccionados.

En esta sección lo ponemos a prueba con ejemplos nuevos para ver si el modelo realmente cumple las expectativas.

Ejemplo 1: generar un personaje

Usé IA para generar un personaje de fantasía. Creé una imagen de cuerpo entero y luego varias poses: mirando a la izquierda, a la derecha y con expresión de enfado.

Editor de elementos de Kling AI mostrando el personaje “Elias” para vinculación de sujeto—aventurero de fantasía, moreno y con barba, con cuatro retratos de referencia (neutral, enfadado, ángulos izquierdo y derecho) y voz William, demostrando creación y consistencia de personaje en Kling 3.0.

Combiné esos elementos para crear un personaje al que llamé Elias. Después generé una imagen para el primer fotograma del vídeo y utilicé la vinculación de sujeto para asociarlos.

Fotograma inicial. El personaje Elias de Kling AI, con abrigo largo, frente a una aldea medieval en llamas; casas y una iglesia ardiendo bajo una luna creciente, humo y ascuas elevándose—escena de fantasía cinematográfica

Este es el prompt que utilicé:

Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides. 
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line." 
Elias pauses for a second. 
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice." 

Observa que no usa referencias con @ porque no usé el modo Omni para este vídeo, solo la vinculación de sujeto. Aquí tienes el resultado

Ejemplo 2: sketch cómico con Omni

Aquí intenté crear una escena tipo sitcom entre amigos. Creé tres personajes, Alex, Jamie y Sam, con IA. Como antes, generé varias poses para cada uno.

Referencias multipose de personajes para Omni/vinculación de sujeto en Kling AI: cuadrícula 3x3 con hombre con chaqueta vaquera, mujer con jersey crema y hombre con chaleco vaquero; taburete y primeros planos, expresiones variadas sobre fondo blanco.

También generé una imagen para la localización y creé un elemento de escena con ella.

Decorado de cafetería estilo sitcom con sofá capitoné color topo, mesa de madera y dos tazas, pared de ladrillo y barra de espresso—elemento de escena para el modo Omni de Kling AI.

Este es el prompt final que utilicé. Describí los planos con un prompt de texto en lugar de la función multi‑plano porque esta limita la escena a seis planos. Resulta que Kling 3.0 también es capaz de manejarlo así.

Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."

Y este fue el resultado:

Se aprecian algunos fallos en el vídeo:

  • Hay un primer fotograma con el sofá vacío. Probablemente es culpa mía por no especificar que los personajes debían estar en el sofá en el plano 1. Sin embargo, al reintentar también empezó vacío. Solo al aportar un primer fotograma con los personajes sentados en el sofá obtuve el resultado esperado, aunque así fue difícil hacer que Alex entrara en la cafetería.
  • Hay un personaje extra sentado en el sofá.

Aun así, el resultado me parece muy convincente. Los personajes se sienten vivos y auténticos, y en general la escena fluye bastante bien.

Ejemplo 3: reutilizar un personaje en un vídeo multi‑escena

En este último ejemplo intenté reutilizar los personajes creados en un contexto diferente. La idea era comprobar cuán consistentes se mantienen entre vídeos para ver si es viable crear varias escenas con los mismos personajes. Si la apariencia y el carácter se mantienen, creo de verdad que Kling 3.0 podría servir para generar contenidos de mayor duración.

En este caso usé la funcionalidad multi‑plano para describir cada toma. Esta es la configuración de la escena:

Editor multi‑plano de Kling AI 3.0: escena de cinco planos en la playa al atardecer con los elementos Sam y Jamie, diálogos y notas de cámara, vinculación de sujeto y duraciones 5 s, 5 s, 3 s, 2 s, 3 s.

Este es el vídeo que generó:

De nuevo, el resultado está muy cerca de lo que buscaba. Salvo algunas pausas para añadir emoción y que no se ve hablar al personaje en el último plano, está muy logrado.

Comparativa Kling 3.0 vs Runway Gen‑4.5

En mi opinión, el mejor modelo de vídeo con IA que había probado hasta ahora era Runway Gen‑4.5. Quería cerrar el artículo comparándolo con Kling 3.0 usando algunos prompts que utilicé en este artículo sobre Runway.

Comprensión de la física

Este ejemplo pone a prueba cómo entiende la física cada modelo con un elefante y un ratón en un balancín. En el primer caso, el ratón está sentado y un elefante debería caer del cielo; en el segundo, al revés.

Ambos modelos parecen entender que el ratón es más ligero que el elefante. Kling 3.0 se ciñó un poco más al prompt, ya que en ambos casos el elefante y el ratón debían caer del cielo.

Emociones de los personajes

El segundo ejemplo evalúa cómo transmite emociones cada modelo. El prompt pide generar un vídeo de alguien recibiendo un mensaje de texto muy triste.

Aquí Kling 3.0 gana con claridad. Las emociones se sienten reales, mientras que en el vídeo de Runway 4.5 aparecen lágrimas extrañas e incluso sale agua por la boca del personaje.

Escena de fantasía compleja

En este último ejemplo pedimos a ambos modelos que generasen una escena de fantasía compleja donde la protagonista tiene un pincel mágico que dibuja cosas y las hace cobrar vida. Huye de los malos y usa el pincel para escapar de un callejón sin salida.

Ninguno de los modelos consigue generar por completo esta escena, pero el resultado de Runway es más preciso. Aun así, ambos se generaron con un único prompt largo. Creo que la escena sería abordable usando las funciones Omni de Kling.

Conclusión

Kling 3.0 es la primera IA de vídeo que de verdad me hace sentir que puedo ejecutar lo que tengo en la cabeza, no solo aproximarlo. 

Con suficientes créditos y un guion cerrado, estoy convencido de que podría sostener episodios completos y consistentes, o incluso un largometraje, manteniendo identidad de personajes, tono y continuidad entre escenas. Sigue habiendo iteración y control de calidad, pero por fin se siente como producción normal, no como pelearse con el modelo para que obedezca.

En mis pruebas, no clavó el resultado siempre; a veces confundió dos personajes o invirtió izquierda‑derecha entre planos y, en raras ocasiones, reasignó una línea. Pero, en general, el primer intento de cada escena solía quedar muy cerca del objetivo.

Dicho esto, Kling me sigue pareciendo algo caro, sobre todo para aficionados como yo. Me encantaría lanzarme a contenidos más largos, pero con los precios actuales, la cuenta de créditos complica justificar la experimentación y las repeticiones. 

La buena noticia es que la tendencia está clara: la calidad sube rápido, la eficiencia mejora y la competencia aprieta. Confío en que los costes bajarán y el acceso se ampliará, y no tardaremos en ver creación de vídeo con IA lo bastante barata y precisa para proyectos de fin de semana y producciones indie.

Si te interesa afilar tus habilidades en IA y prepararte para un mundo donde la IA es una competencia clave en el mercado laboral, echa un vistazo a nuestro curso de AI Fundamentals.

Kling 3.0: preguntas frecuentes

¿Kling 3.0 puede generar vídeos con diálogos y efectos de sonido?

Sí, Kling 3.0 puede generar diálogos sincronizados, sonidos de fondo y variaciones de tono directamente a partir de prompts. Puedes especificar cómo se pronuncia cada línea: emociones, tono y pistas de audio ambiente.

¿Qué idiomas admite Kling 3.0?

El modelo soporta generación de voz en los siguientes idiomas: chino, inglés, japonés, coreano y español.

¿Necesitas imágenes para usar Kling 3.0?

No, Kling puede generar vídeos solo con prompts de texto. Sin embargo, aportar imágenes de referencia mejora notablemente la consistencia de los personajes y la fidelidad visual, especialmente usando la vinculación de sujetos o el modo Omni.

¿Kling 3.0 es adecuado para contar historias largas?

Kling 3.0 muestra un gran potencial para contenidos de larga duración porque permite reutilizar personajes, mantener la consistencia entre escenas y contar historias complejas. No obstante, producir piezas largas puede requerir muchos créditos y varias iteraciones.

¿Cuáles son las principales limitaciones de Kling 3.0?

Aunque es muy capaz, Kling 3.0 puede introducir pequeñas inconsistencias como intercambiar personajes, pausas de timing o líneas de diálogo omitidas. Además, el sistema de créditos puede limitar la experimentación para usuarios ocasionales o aficionados.


François Aubry's photo
Author
François Aubry
LinkedIn
Ingeniero full-stack y fundador de CheapGPT. Enseñar siempre ha sido mi pasión. Desde mis primeros días como estudiante, busqué con entusiasmo oportunidades para dar clases particulares y ayudar a otros estudiantes. Esta pasión me llevó a realizar un doctorado, en el que también trabajé como ayudante de profesor para apoyar mis esfuerzos académicos. Durante esos años, encontré una inmensa satisfacción en el entorno tradicional del aula, fomentando las conexiones y facilitando el aprendizaje. Sin embargo, con la llegada de las plataformas de aprendizaje en línea, reconocí el potencial transformador de la educación digital. De hecho, participé activamente en el desarrollo de una plataforma de este tipo en nuestra universidad. Estoy profundamente comprometida con la integración de los principios de la enseñanza tradicional con metodologías digitales innovadoras. Mi pasión es crear cursos que no sólo sean atractivos e informativos, sino también accesibles para los alumnos en esta era digital.
Temas
IA Generativa
Inteligencia Artificial

Cursos de IA generativa

Curso

Conceptos de la IA generativa

2 h
119K
Aprovecha la IA generativa con responsabilidad, aprende cómo se desarrollan estos modelos de IA y cómo afectarán a la sociedad en el futuro.
Ver detallesRight Arrow
Empezar Curso
Ver másRight Arrow
Relacionado

blog

Los 7 mejores generadores de vídeo con IA para 2026 con vídeos de ejemplo

Descubre los mejores generadores de vídeo con IA disponibles en la actualidad, entre los que se incluyen RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo y los muy esperados Sora y Veo de DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Cómo aprender IA desde cero en 2026: Guía completa de los expertos

Descubre todo lo que necesitas saber sobre el aprendizaje de la IA en 2026, desde consejos para empezar, recursos útiles e información de expertos del sector.
Adel Nehme's photo

Adel Nehme

15 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Visión GPT-4: Guía completa para principiantes

Este tutorial le presentará todo lo que necesita saber sobre GPT-4 Vision, desde cómo acceder a él hasta ejemplos prácticos del mundo real y sus limitaciones.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Tutorial

Cómo utilizar Midjourney Guía completa para la creación de obras de arte generadas por IA

Descubre el poder de Midjourney, una herramienta de IA generativa para crear asombrosas obras de arte. Aprende cómo empezar, escribe prompts eficaces y optimiza su uso con nuestra guía paso a paso.
Kurtis Pykes 's photo

Kurtis Pykes

12 min

Ver MásVer Más