Curso
Kling AI acaba de lançar a versão 3.0 de seus modelos de vídeo com IA. Assim como o lançamento do Seedance 2.0, ele surge como uma resposta chinesa a um cenário dominado por modelos desenvolvidos nos EUA — e pode muito bem ser o melhor modelo de vídeo por IA do mercado.
Neste artigo, você vai aprender a usar todo o potencial do Kling 3.0 pela interface web para construir personagens e criar vídeos em que eles se mantêm consistentes entre os planos.
Se quiser conhecer mais sobre os lançamentos mais recentes nessa área, recomendo conferir nosso guia com outros principais modelos de geração de vídeo.
O que é o Kling AI?
O Kling AI é uma plataforma de IA generativa desenvolvida para criar vídeos a partir de prompts de texto, imagens ou a combinação dos dois. Criado pela empresa chinesa de tecnologia Kuaishou, ele rapidamente se tornou um dos melhores modelos de IA em consistência de personagens. Os vídeos gerados já vêm com som nativo, o que dá um acabamento mais profissional e pronto para uso.
Preços e acesso ao Kling AI
Como acontece com muitos modelos de vídeo por IA, a cobrança do Kling AI é baseada em créditos. Você paga uma assinatura mensal que dá acesso a um número fixo de créditos por mês. Há também recursos adicionais atrelados a cada plano, mas o principal diferencial continua sendo a quantidade de créditos de geração incluída.
Para escrever este artigo, usei o plano Pro (US$ 32,56 por mês), que oferece 3.000 créditos. Para mais detalhes sobre os planos, consulte a página oficial de preços do Kling AI.
Quantos créditos custa gerar um vídeo?
O consumo de créditos depende basicamente de três fatores:
- O comprimento do vídeo (de 3 a 15 segundos)
- A resolução (720p ou 1080p)
- Se o áudio será gerado ou não

Considerando vídeos com áudio nativo, com a assinatura Pro dá para gerar cerca de 6 minutos de vídeo em 720p ou 4 minutos em 1080p por mês.
Principais recursos do Kling 3.0
Os exemplos desta seção foram retirados do guia oficial do modelo Kling 3.0.
Cenas multi-shots implícitas
A maioria dos modelos de vídeo por IA funciona melhor quando o prompt descreve um único plano ou ação. O Kling 3.0 consegue entender um prompt que descreve vários planos em um único texto.
O prompt a seguir descreve o cenário e quatro planos sem listá-los explicitamente:
Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."
O prompt foi combinado com uma imagem, que o modelo usou como primeiro quadro do vídeo.

Veja o resultado:
Fiquei bem impressionado com este vídeo. A aderência ao prompt é ótima e o resultado me pareceu bastante realista.
Cenas multi-shots explícitas
Embora o modelo consiga entender onde um plano termina e o próximo começa a partir do texto, isso não é perfeito e ele pode interpretar de forma diferente do que imaginamos. Podemos forçar a estrutura da cena mencionando explicitamente os planos no prompt.
Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.
Para detalhar cada plano, clique no botão Custom Multi-Shot na parte inferior do campo de prompt. Ali, dá para escrever um prompt para cada plano e também definir a duração. O modelo permite até 6 planos por vídeo.

Abaixo está o resultado desse prompt multi-shots:
Controles de áudio e tom
Como vimos, o Kling 3.0 permite gerar vídeos com áudio nativo. Mas ele vai além disso. Dá para orientar o áudio gerado especificando o que queremos no prompt. Por exemplo:
Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!
Nesse exemplo, o prompt traz informações sobre sons de fundo e como as pessoas devem falar no vídeo. Para diálogos, a estrutura costuma ser:
<who is speaking> (<how things are said>) <what they say>
Aqui está o vídeo gerado com o prompt acima:
Esse exemplo foi gerado a partir de uma imagem de primeiro quadro. Isso ajuda o modelo a associar os personagens ao prompt. É impressionante que, só pela imagem, o modelo consiga identificar quem é o pai, a mãe, o menino e a menina.
Fala multilíngue
O modelo é capaz de gerar fala nos seguintes idiomas:
- Chinês
- Inglês
- Japonês
- Coreano
- Espanhol
Podemos especificar o idioma falado junto com a descrição do tom:
<who is speaking> (<how things are said>, <language>) <what they say>
Veja um exemplo:
On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?"
Girl (sighing, Korean): "시험이 너무 무 서워"".
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."Vinculação de sujeito
A vinculação de sujeito é um recurso que mantém personagens ou elementos visuais específicos consistentes ao longo de todo o vídeo gerado. Fixar a aparência e as características de um sujeito ajuda a garantir que o foco principal permaneça estável e reconhecível, mesmo com movimentos de câmera como zoom, pan e tilt.
Depois de enviar uma imagem como quadro inicial, dá para ativar esse recurso selecionando a opção Bind elements to enhance Consistency. Ela cria uma referência que o sistema usa para manter a estabilidade visual e evitar mudanças indesejadas no sujeito durante a geração.

Sem a vinculação de sujeito, o modelo precisa adivinhar traços que não aparecem na imagem inicial. No exemplo acima, a personagem usa óculos escuros. Por isso, seria útil fornecer uma imagem do rosto. Outras poses, como olhando para a esquerda e para a direita, também ajudam se quisermos que o modelo "não invente" a aparência da pessoa.

Ao criar um elemento, é possível enviar até três imagens. Também dá para escolher uma voz e um nome para o personagem.
Veja o resultado:
Pessoalmente, considero esses recursos um divisor de águas, porque a consistência de personagens era um dos aspectos mais frustrantes da geração de vídeos por IA. Muitas vezes exigia prompts de texto superdetalhados e várias iterações até acertar.
Modo Omni
O modo Omni do Kling AI reúne todos os recursos em um único modelo. Pense nele como uma versão turbinada da vinculação de sujeito: você cria elementos (personagens, cenários, itens etc.) e depois junta tudo em um único prompt. Isso permite gerar cenas bem complexas com alto nível de fidelidade.
Por exemplo, você pode criar um elemento de personagem fornecendo imagens de referência e depois um elemento de cena, posicionando facilmente o personagem nesse cenário. Também dá para criar vários personagens e desenvolver diálogos entre eles referenciando esses elementos no prompt.
No modo Omni, é possível referenciar elementos já criados usando @. Isso abre um pop-up para selecionar o elemento desejado.

Aqui vai um exemplo de três planos mostrando a força e a versatilidade do Omni:
Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!"
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me."
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."Neste exemplo, @Image, @Grace, @Alan e @Samoyed são elementos criados separadamente e usados juntos em um único prompt.

Testando o Kling 3.0
Na seção anterior, conhecemos os recursos principais do Kling 3.0 e vimos alguns exemplos do site oficial. Os resultados são muito impressionantes, mas é bom manter um pé atrás com exemplos fornecidos pelas empresas, já que costumam ser curados, destacando só os melhores casos.
Agora, vamos colocar a mão na massa e testá-lo com novos exemplos para ver se o modelo realmente entrega o que promete.
Exemplo 1: gerando um personagem
Usei IA para criar um personagem de fantasia. Gerei uma imagem de corpo inteiro e depois algumas poses diferentes, como olhando para a esquerda, para a direita e com expressão de raiva.

Combinei esses elementos para criar um personagem chamado Elias. Depois gerei uma imagem para o primeiro quadro do vídeo e usei a vinculação de sujeito para conectá-los.

Este foi o prompt que usei:
Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides.
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line."
Elias pauses for a second.
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice."
Perceba que não usei referências com @ porque não utilizei o modo Omni neste vídeo, apenas a vinculação de sujeito. Aqui está o resultado
Exemplo 2: criando um esquete cômico com o Omni
Aqui, tentei criar uma cena de sitcom entre amigos. Criei três personagens — Alex, Jamie e Sam — usando IA. Como antes, gerei algumas poses diferentes para cada um.

Também gerei uma imagem do local e criei um elemento de cena com ela.

Este foi o prompt final que usei. Optei por descrever os planos em um único prompt de texto em vez da funcionalidade multi-shots, pois ela limita a seis planos. E o Kling 3.0 deu conta muito bem desse formato.
Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."
E este foi o resultado:
Dá para notar alguns deslizes no vídeo:
- Há um quadro inicial com o sofá vazio. Provavelmente foi falha minha por não dizer que os personagens deveriam estar no sofá no plano 1. Porém, mesmo ao refazer, ele também começou vazio. Só quando forneci um primeiro quadro com os personagens sentados no sofá é que tive o resultado esperado. Nesse caso, porém, ficou difícil fazer o Alex entrar na cafeteria.
- Surge um personagem extra sentado no sofá.
Apesar disso, achei o resultado muito bom. Os personagens parecem vivos e autênticos, e a cena flui bem no geral.
Exemplo 3: reutilizando um personagem em um vídeo com várias cenas
Neste último exemplo, tentei reutilizar os personagens criados em outro contexto. A ideia era entender o quão consistentes eles permanecem entre vídeos para ver se é viável criar várias cenas com os mesmos personagens. Se a aparência e a essência se mantiverem, acredito que o Kling 3.0 pode ser usado para conteúdos de maior duração.
Aqui, usei a funcionalidade multi-shots para descrever cada plano. Veja a configuração da cena:

Este foi o vídeo gerado:
Mais uma vez, o resultado ficou muito próximo do que eu queria. Tirando algumas pausas para dar emoção e o fato de não vermos o personagem falar no último plano, ficou bem feito.
Comparativo: Kling 3.0 vs Runway Gen-4.5
Na minha opinião, o melhor modelo de vídeo por IA que eu tinha testado antes era o Runway Gen-4.5. Quis encerrar este artigo comparando-o ao Kling 3.0 usando alguns prompts que utilizei neste artigo que escrevi sobre o Runway.
Entendimento de física
Este exemplo testa o quanto o modelo entende de física colocando um elefante e um camundongo em uma gangorra. No primeiro caso, o camundongo está sentado e o elefante deve cair do céu; no segundo, o inverso.
Ambos os modelos entendem que o camundongo é mais leve que o elefante. O Kling 3.0 aderiu um pouco mais ao prompt, já que nos dois casos o elefante e o camundongo deveriam cair do céu.
Emoções de personagens
O segundo exemplo avalia como cada modelo transmite emoções. O prompt pede um vídeo de alguém recebendo uma mensagem de texto muito triste.
Aqui, o Kling 3.0 vence com folga. As emoções parecem reais, enquanto no Runway 4.5 as lágrimas ficam estranhas e até parece sair água da boca do personagem.
Cena de fantasia complexa
No último exemplo, pedimos que ambos os modelos gerassem uma cena de fantasia complexa em que o protagonista tem um pincel mágico que desenha coisas e lhes dá vida. O protagonista foge dos vilões e usa o pincel para escapar de um beco sem saída.
Nenhum dos modelos consegue gerar a cena inteira, mas o resultado do Runway é mais fiel. Ainda assim, ambos foram gerados com um único prompt longo. Acredito que a cena seria executável usando os recursos Omni do Kling.
Conclusão
O Kling 3.0 é o primeiro vídeo por IA que realmente me fez sentir que eu conseguiria executar o que estava na minha cabeça — e não apenas chegar perto.
Com créditos suficientes e um roteiro fechado, estou confiante de que ele consegue sustentar episódios completos e consistentes — ou até um filme — mantendo identidade dos personagens, tom e continuidade entre cenas. Ainda exige iteração e controle de qualidade, mas finalmente parece um processo de produção normal, em vez de uma queda de braço com o modelo.
Nos meus testes, nem sempre acertou de primeira; às vezes trocou dois personagens, inverteu esquerda e direita entre planos ou, raramente, atribuiu uma fala errada. Mas, no geral, a primeira tentativa de cada cena já costumava ficar muito próxima do resultado desejado.
Dito isso, ainda acho o Kling um pouco caro, especialmente para hobbistas como eu. Quero muito explorar conteúdos mais longos, mas, com os preços atuais, a conta de créditos dificulta justificar experimentos e refações.
A boa notícia é que a direção é clara: a qualidade está subindo rápido, a eficiência está melhorando e a concorrência está esquentando. Estou confiante de que os custos vão cair, o acesso vai se ampliar e, em pouco tempo, criar vídeos com IA será barato e preciso o bastante para projetos de fim de semana e produções independentes.
Se você quer afiar suas habilidades em IA e se preparar para um mundo em que IA é uma competência essencial no mercado de trabalho, confira nosso curso de AI Fundamentals.
Kling 3.0: FAQs
O Kling 3.0 consegue gerar vídeos com diálogos e efeitos sonoros?
Sim. O Kling 3.0 consegue gerar diálogos sincronizados, sons de fundo e variações de tom diretamente a partir de prompts. Os usuários podem especificar como a fala deve soar, incluindo emoções, tom e pistas de áudio ambiente.
Quais idiomas o Kling 3.0 suporta?
O modelo suporta fala nos seguintes idiomas: chinês, inglês, japonês, coreano e espanhol.
Preciso de imagens para usar o Kling 3.0?
Não. O Kling pode gerar vídeos apenas com prompts de texto. Porém, fornecer imagens de referência melhora bastante a consistência dos personagens e a precisão visual, especialmente ao usar vinculação de sujeito ou o modo Omni.
O Kling 3.0 é indicado para narrativas de longa duração?
O Kling 3.0 mostra grande potencial para conteúdo de longa duração, pois permite reutilizar personagens, manter consistência entre cenas e contar histórias complexas. No entanto, produções mais longas podem exigir muitos créditos e iteração.
Quais são as principais limitações do Kling 3.0?
Apesar de muito capaz, o Kling 3.0 pode ocasionalmente introduzir pequenas inconsistências, como troca de personagens, pausas de tempo ou falas perdidas. Além disso, o modelo de créditos pode limitar a experimentação para usuários casuais ou hobbistas.





