Pular para o conteúdo principal

Kling 3.0: um guia completo de geração de vídeo com IA

Conheça o Kling 3.0 e seus principais recursos. Aprenda a gerar vídeos, criar seus próprios personagens e montar cenas complexas com vários planos e áudio nativo.
Actualizado 17 de set. de 2026  · 10 min leer

Explore com IA

ChatGPTClaudePerplexity

Kling AI acaba de lançar a versão 3.0 de seus modelos de vídeo com IA. Assim como o lançamento do Seedance 2.0, ele surge como uma resposta chinesa a um cenário dominado por modelos desenvolvidos nos EUA — e pode muito bem ser o melhor modelo de vídeo por IA do mercado.

Neste artigo, você vai aprender a usar todo o potencial do Kling 3.0 pela interface web para construir personagens e criar vídeos em que eles se mantêm consistentes entre os planos.

Se quiser conhecer mais sobre os lançamentos mais recentes nessa área, recomendo conferir nosso guia com outros principais modelos de geração de vídeo.

O que é o Kling AI?

O Kling AI é uma plataforma de IA generativa desenvolvida para criar vídeos a partir de prompts de texto, imagens ou a combinação dos dois. Criado pela empresa chinesa de tecnologia Kuaishou, ele rapidamente se tornou um dos melhores modelos de IA em consistência de personagens. Os vídeos gerados já vêm com som nativo, o que dá um acabamento mais profissional e pronto para uso.

Preços e acesso ao Kling AI

Como acontece com muitos modelos de vídeo por IA, a cobrança do Kling AI é baseada em créditos. Você paga uma assinatura mensal que dá acesso a um número fixo de créditos por mês. Há também recursos adicionais atrelados a cada plano, mas o principal diferencial continua sendo a quantidade de créditos de geração incluída.

Para escrever este artigo, usei o plano Pro (US$ 32,56 por mês), que oferece 3.000 créditos. Para mais detalhes sobre os planos, consulte a página oficial de preços do Kling AI.

Quantos créditos custa gerar um vídeo?

O consumo de créditos depende basicamente de três fatores:

  • O comprimento do vídeo (de 3 a 15 segundos)
  • A resolução (720p ou 1080p)
  • Se o áudio será gerado ou não

Tabela de preços do Kling AI mostrando créditos por segundo: 3.0 Vídeo — áudio nativo custa 12 créditos/s em 1080p e 9 créditos/s em 720p; sem áudio nativo custa 8 créditos/s em 1080p e 6 créditos/s em 720p. Exemplos: 5 s em 1080p com áudio nativo = 60 créditos; 5 s em 720p sem áudio = 30 créditos.

Considerando vídeos com áudio nativo, com a assinatura Pro dá para gerar cerca de 6 minutos de vídeo em 720p ou 4 minutos em 1080p por mês.

Principais recursos do Kling 3.0

Os exemplos desta seção foram retirados do guia oficial do modelo Kling 3.0.

Cenas multi-shots implícitas

A maioria dos modelos de vídeo por IA funciona melhor quando o prompt descreve um único plano ou ação. O Kling 3.0 consegue entender um prompt que descreve vários planos em um único texto.

O prompt a seguir descreve o cenário e quatro planos sem listá-los explicitamente:

Outdoor terrace of a European villa, by a dining table with a blue and white checkered tablecloth, a young white woman in a blue and white striped short-sleeve shirt and khaki shorts, with a brown belt, sits barefoot, opposite a young white man in a white T-shirt.
The camera zooms in, the woman swirls the juice in a glass, her eyes looking at the distant woods, and says, "These trees will turn yellow in a month, won't they?"
Close-up of the man, he lowers his head and says, "But they'll be green again next summer."
Then the woman turns her head, smiles at the man opposite, and says, "Are you always this optimistic? Or just about summer?"
Then the man lifts his head, looks at the woman, and says, "Only about summers with you."

O prompt foi combinado com uma imagem, que o modelo usou como primeiro quadro do vídeo.

Captura do editor Kling AI 3.0 mostrando configuração de image-to-video: casal jantando no terraço como primeiro quadro, editor de prompt multi-shots, 720p 10s, áudio nativo e botão Generate.

Veja o resultado:

Fiquei bem impressionado com este vídeo. A aderência ao prompt é ótima e o resultado me pareceu bastante realista.

Cenas multi-shots explícitas

Embora o modelo consiga entender onde um plano termina e o próximo começa a partir do texto, isso não é perfeito e ele pode interpretar de forma diferente do que imaginamos. Podemos forçar a estrutura da cena mencionando explicitamente os planos no prompt.

Shot 1: Profile shot of a Black man driving a truck, cinematic handheld.
Shot 2: Frontal macro shot of the Black man driving, cinematic handheld.
Shot 3: Macro shot of his hands on the steering wheel, cinematic handheld.
Shot 4: Macro shot of a weathered photograph of a young Black child lying on the passenger seat, cinematic handheld.

Para detalhar cada plano, clique no botão Custom Multi-Shot na parte inferior do campo de prompt. Ali, dá para escrever um prompt para cada plano e também definir a duração. O modelo permite até 6 planos por vídeo.

Captura do editor Custom Multi‑Shot do Kling AI 3.0 — construtor de cena por prompt com quatro planos: motorista em perfil, macro frontal, mãos no volante e foto gasta de uma criança.

Abaixo está o resultado desse prompt multi-shots:

Controles de áudio e tom

Como vimos, o Kling 3.0 permite gerar vídeos com áudio nativo. Mas ele vai além disso. Dá para orientar o áudio gerado especificando o que queremos no prompt. Por exemplo:

Home setting with a faint hum of the living room air conditioner in the background for a realistic daily vibe.
Mom (softly, in a surprised tone): Wow, I didn't expect this plot at all.
Dad (in a low voice, agreeing, in a calm tone): Yeah, it's totally unexpected. Never thought that would happen.
Boy (in an excited tone): It's the best twist ever!
Girl (nodding along, in an enthusiastic tone): I can't believe they did that!

Nesse exemplo, o prompt traz informações sobre sons de fundo e como as pessoas devem falar no vídeo. Para diálogos, a estrutura costuma ser:

<who is speaking> (<how things are said>) <what they say>

Aqui está o vídeo gerado com o prompt acima:

Esse exemplo foi gerado a partir de uma imagem de primeiro quadro. Isso ajuda o modelo a associar os personagens ao prompt. É impressionante que, só pela imagem, o modelo consiga identificar quem é o pai, a mãe, o menino e a menina.

Fala multilíngue

O modelo é capaz de gerar fala nos seguintes idiomas: 

  • Chinês
  • Inglês
  • Japonês
  • Coreano
  • Espanhol

Podemos especificar o idioma falado junto com a descrição do tom:

<who is speaking> (<how things are said>, <language>) <what they say>

Veja um exemplo:

On the rooftop of a Korean high school, distant city lights glimmer in the background with a soft wind rustling, and stars twinkle in the night sky. The girl leans against the railing, lost in thought. The boy walks over with two cans of cola, hands one to her, and she takes it and pops the tab open.
Boy (casual tone, Korean): "숙제 다 했어? 왜 여기 있어?" 
Girl (sighing, Korean): "시험이 너무 무 서워"". 
Boy (gentle tone, Korean): "4정 마, 넌 잘할 거야."

Vinculação de sujeito

A vinculação de sujeito é um recurso que mantém personagens ou elementos visuais específicos consistentes ao longo de todo o vídeo gerado. Fixar a aparência e as características de um sujeito ajuda a garantir que o foco principal permaneça estável e reconhecível, mesmo com movimentos de câmera como zoom, pan e tilt.

Depois de enviar uma imagem como quadro inicial, dá para ativar esse recurso selecionando a opção Bind elements to enhance Consistency. Ela cria uma referência que o sistema usa para manter a estabilidade visual e evitar mudanças indesejadas no sujeito durante a geração.

Interface de vinculação de sujeito do Kling AI 3.0: painel “Bind elements to enhance consistency” com primeiro quadro de uma mulher no elevador, opção Add end frame, search/Create subject e exemplos de sujeitos (Sam, Jamie) para travar consistência do personagem entre planos.

Sem a vinculação de sujeito, o modelo precisa adivinhar traços que não aparecem na imagem inicial. No exemplo acima, a personagem usa óculos escuros. Por isso, seria útil fornecer uma imagem do rosto. Outras poses, como olhando para a esquerda e para a direita, também ajudam se quisermos que o modelo "não invente" a aparência da pessoa.

Captura da interface Create Element do Kling AI para vinculação de sujeito e consistência de personagem: Sara em quadros no metrô/elevador (óculos escuros, casaco preto) com predefinições de voz.

Ao criar um elemento, é possível enviar até três imagens. Também dá para escolher uma voz e um nome para o personagem.

Veja o resultado:

Pessoalmente, considero esses recursos um divisor de águas, porque a consistência de personagens era um dos aspectos mais frustrantes da geração de vídeos por IA. Muitas vezes exigia prompts de texto superdetalhados e várias iterações até acertar.

Modo Omni

O modo Omni do Kling AI reúne todos os recursos em um único modelo. Pense nele como uma versão turbinada da vinculação de sujeito: você cria elementos (personagens, cenários, itens etc.) e depois junta tudo em um único prompt. Isso permite gerar cenas bem complexas com alto nível de fidelidade.

Por exemplo, você pode criar um elemento de personagem fornecendo imagens de referência e depois um elemento de cena, posicionando facilmente o personagem nesse cenário. Também dá para criar vários personagens e desenvolver diálogos entre eles referenciando esses elementos no prompt.

No modo Omni, é possível referenciar elementos já criados usando @. Isso abre um pop-up para selecionar o elemento desejado.

Referenciando um elemento usando @.

Aqui vai um exemplo de três planos mostrando a força e a versatilidade do Omni:

Shot 1 (3s): Mid-shot, background @Image. @Grace sits on the sofa eating cookies as @Alan walks in holding @Samoyed.@Samoyed lunges for the cookie in @Grace's hand. @Grace says, "Hey! Watch your dog!" 
Shot 2 (2s): @Alan sits beside her, pulling the leash and lifting @Samoyed. Close-up, @Alan says, "He just likes cookies more than me." 
Shot 3 (3s): Close-up, @Grace smiles and says, "Well, he has good taste at least."

Neste exemplo, @Image, @Grace, @Alan e @Samoyed são elementos criados separadamente e usados juntos em um único prompt.

Elementos do modo Omni do Kling AI: imagens de referência dos elementos.

Testando o Kling 3.0

Na seção anterior, conhecemos os recursos principais do Kling 3.0 e vimos alguns exemplos do site oficial. Os resultados são muito impressionantes, mas é bom manter um pé atrás com exemplos fornecidos pelas empresas, já que costumam ser curados, destacando só os melhores casos.

Agora, vamos colocar a mão na massa e testá-lo com novos exemplos para ver se o modelo realmente entrega o que promete.

Exemplo 1: gerando um personagem

Usei IA para criar um personagem de fantasia. Gerei uma imagem de corpo inteiro e depois algumas poses diferentes, como olhando para a esquerda, para a direita e com expressão de raiva.

Editor de elementos do Kling AI mostrando o personagem “Elias” para vinculação de sujeito — aventureiro de fantasia de cabelo castanho e barba, com jaqueta de couro escura e colete com armadura — quatro retratos de referência (neutro, bravo, ângulos esquerdo e direito) e voz William, demonstrando criação e consistência de personagem no Kling 3.0.

Combinei esses elementos para criar um personagem chamado Elias. Depois gerei uma imagem para o primeiro quadro do vídeo e usei a vinculação de sujeito para conectá-los.

Quadro inicial. O personagem Elias, do Kling AI, de sobretudo, está diante de uma vila medieval em chamas, casas e igreja pegando fogo sob uma lua crescente, fumaça e fagulhas — cena de fantasia cinematográfica

Este foi o prompt que usei:

Elias stands alone in front of the burning village. Elias is breathing heavily, his hands clenched into tight fists at his sides. 
Elias looks at something just off-camera, something we cannot see. Elias says, in a low and dangerous voice, "I told you what would happen if you crossed that line." 
Elias pauses for a second. 
The camera zooms in close to his face. His face burns with anger, and he says, "I gave you my word, and I gave you a choice." 

Perceba que não usei referências com @ porque não utilizei o modo Omni neste vídeo, apenas a vinculação de sujeito. Aqui está o resultado

Exemplo 2: criando um esquete cômico com o Omni

Aqui, tentei criar uma cena de sitcom entre amigos. Criei três personagens — Alex, Jamie e Sam — usando IA. Como antes, gerei algumas poses diferentes para cada um.

Referências multi-poses para Omni/vinculação de sujeito do Kling AI: grade 3x3 com homem de jaqueta jeans, mulher de suéter creme e homem de colete jeans; banqueta e closes, expressões variadas em fundo branco.

Também gerei uma imagem do local e criei um elemento de cena com ela.

Cenário de cafeteria estilo sitcom com sofá capitonê bege, mesa de madeira com duas canecas, parede de tijolos e bar de espresso — elemento de cena para o modo Omni do Kling AI.

Este foi o prompt final que usei. Optei por descrever os planos em um único prompt de texto em vez da funcionalidade multi-shots, pois ela limita a seis planos. E o Kling 3.0 deu conta muito bem desse formato.

Shot 1: Mid-shot, background @Image.
Shot 2: @Jamie and @Sam sit on the couch as @Alex rushes into the coffee shop and says, "I just liked my ex’s photo from 2016."
Shot 3: @Jamie turns to @Alex and says, "How bad?"
Shot 4: @Alex replies, "She’s with the guy she left me for."
Shot 5: Camera focuses on @Sam, and he replies, "Delete it, dude!"
Shot 6: @Alex replies, "I did, but what if she saw?"
Shot 7: @Sam says, "Then act confident, like her wedding photo."
Shot 8: @Jamie laughs, and @Alex says, "I need new friends..."

E este foi o resultado:

Dá para notar alguns deslizes no vídeo:

  • Há um quadro inicial com o sofá vazio. Provavelmente foi falha minha por não dizer que os personagens deveriam estar no sofá no plano 1. Porém, mesmo ao refazer, ele também começou vazio. Só quando forneci um primeiro quadro com os personagens sentados no sofá é que tive o resultado esperado. Nesse caso, porém, ficou difícil fazer o Alex entrar na cafeteria.
  • Surge um personagem extra sentado no sofá.

Apesar disso, achei o resultado muito bom. Os personagens parecem vivos e autênticos, e a cena flui bem no geral.

Exemplo 3: reutilizando um personagem em um vídeo com várias cenas

Neste último exemplo, tentei reutilizar os personagens criados em outro contexto. A ideia era entender o quão consistentes eles permanecem entre vídeos para ver se é viável criar várias cenas com os mesmos personagens. Se a aparência e a essência se mantiverem, acredito que o Kling 3.0 pode ser usado para conteúdos de maior duração.

Aqui, usei a funcionalidade multi-shots para descrever cada plano. Veja a configuração da cena:

Editor multi-shots do Kling AI 3.0: cena de pôr do sol na praia com cinco planos, elementos Sam e Jamie, falas e notas de câmera, vinculação de sujeito e durações 5s, 5s, 3s, 2s, 3s.

Este foi o vídeo gerado:

Mais uma vez, o resultado ficou muito próximo do que eu queria. Tirando algumas pausas para dar emoção e o fato de não vermos o personagem falar no último plano, ficou bem feito.

Comparativo: Kling 3.0 vs Runway Gen-4.5

Na minha opinião, o melhor modelo de vídeo por IA que eu tinha testado antes era o Runway Gen-4.5. Quis encerrar este artigo comparando-o ao Kling 3.0 usando alguns prompts que utilizei neste artigo que escrevi sobre o Runway.

Entendimento de física

Este exemplo testa o quanto o modelo entende de física colocando um elefante e um camundongo em uma gangorra. No primeiro caso, o camundongo está sentado e o elefante deve cair do céu; no segundo, o inverso.

Ambos os modelos entendem que o camundongo é mais leve que o elefante. O Kling 3.0 aderiu um pouco mais ao prompt, já que nos dois casos o elefante e o camundongo deveriam cair do céu.

Emoções de personagens

O segundo exemplo avalia como cada modelo transmite emoções. O prompt pede um vídeo de alguém recebendo uma mensagem de texto muito triste.

Aqui, o Kling 3.0 vence com folga. As emoções parecem reais, enquanto no Runway 4.5 as lágrimas ficam estranhas e até parece sair água da boca do personagem.

Cena de fantasia complexa

No último exemplo, pedimos que ambos os modelos gerassem uma cena de fantasia complexa em que o protagonista tem um pincel mágico que desenha coisas e lhes dá vida. O protagonista foge dos vilões e usa o pincel para escapar de um beco sem saída.

Nenhum dos modelos consegue gerar a cena inteira, mas o resultado do Runway é mais fiel. Ainda assim, ambos foram gerados com um único prompt longo. Acredito que a cena seria executável usando os recursos Omni do Kling.

Conclusão

O Kling 3.0 é o primeiro vídeo por IA que realmente me fez sentir que eu conseguiria executar o que estava na minha cabeça — e não apenas chegar perto. 

Com créditos suficientes e um roteiro fechado, estou confiante de que ele consegue sustentar episódios completos e consistentes — ou até um filme — mantendo identidade dos personagens, tom e continuidade entre cenas. Ainda exige iteração e controle de qualidade, mas finalmente parece um processo de produção normal, em vez de uma queda de braço com o modelo.

Nos meus testes, nem sempre acertou de primeira; às vezes trocou dois personagens, inverteu esquerda e direita entre planos ou, raramente, atribuiu uma fala errada. Mas, no geral, a primeira tentativa de cada cena já costumava ficar muito próxima do resultado desejado.

Dito isso, ainda acho o Kling um pouco caro, especialmente para hobbistas como eu. Quero muito explorar conteúdos mais longos, mas, com os preços atuais, a conta de créditos dificulta justificar experimentos e refações. 

A boa notícia é que a direção é clara: a qualidade está subindo rápido, a eficiência está melhorando e a concorrência está esquentando. Estou confiante de que os custos vão cair, o acesso vai se ampliar e, em pouco tempo, criar vídeos com IA será barato e preciso o bastante para projetos de fim de semana e produções independentes.

Se você quer afiar suas habilidades em IA e se preparar para um mundo em que IA é uma competência essencial no mercado de trabalho, confira nosso curso de AI Fundamentals.

Kling 3.0: FAQs

O Kling 3.0 consegue gerar vídeos com diálogos e efeitos sonoros?

Sim. O Kling 3.0 consegue gerar diálogos sincronizados, sons de fundo e variações de tom diretamente a partir de prompts. Os usuários podem especificar como a fala deve soar, incluindo emoções, tom e pistas de áudio ambiente.

Quais idiomas o Kling 3.0 suporta?

O modelo suporta fala nos seguintes idiomas: chinês, inglês, japonês, coreano e espanhol.

Preciso de imagens para usar o Kling 3.0?

Não. O Kling pode gerar vídeos apenas com prompts de texto. Porém, fornecer imagens de referência melhora bastante a consistência dos personagens e a precisão visual, especialmente ao usar vinculação de sujeito ou o modo Omni.

O Kling 3.0 é indicado para narrativas de longa duração?

O Kling 3.0 mostra grande potencial para conteúdo de longa duração, pois permite reutilizar personagens, manter consistência entre cenas e contar histórias complexas. No entanto, produções mais longas podem exigir muitos créditos e iteração.

Quais são as principais limitações do Kling 3.0?

Apesar de muito capaz, o Kling 3.0 pode ocasionalmente introduzir pequenas inconsistências, como troca de personagens, pausas de tempo ou falas perdidas. Além disso, o modelo de créditos pode limitar a experimentação para usuários casuais ou hobbistas.


François Aubry's photo
Author
François Aubry
LinkedIn
Engenheiro de pilha completa e fundador da CheapGPT. Ensinar sempre foi minha paixão. Desde meus primeiros dias como estudante, eu buscava ansiosamente oportunidades para dar aulas particulares e ajudar outros alunos. Essa paixão me levou a fazer um doutorado, onde também atuei como assistente de ensino para apoiar meus esforços acadêmicos. Durante esses anos, encontrei imensa satisfação no ambiente tradicional da sala de aula, promovendo conexões e facilitando o aprendizado. Entretanto, com o advento das plataformas de aprendizagem on-line, reconheci o potencial transformador da educação digital. Na verdade, participei ativamente do desenvolvimento de uma dessas plataformas em nossa universidade. Estou profundamente comprometido com a integração dos princípios tradicionais de ensino com metodologias digitais inovadoras. Minha paixão é criar cursos que não sejam apenas envolventes e informativos, mas também acessíveis aos alunos nesta era digital.
Temas
IA generativa
Inteligência Artificial

Cursos de IA generativa

Curso

Conceitos de IA Generativa

2 h
119K
Descubra como usar IA generativa de forma responsável e seu impacto futuro na sociedade.
Ver detalhesRight Arrow
Começar Curso
Ver maisRight Arrow
Relacionado

blog

Os 7 melhores geradores de vídeo com IA para 2026, com vídeos de exemplo

Conheça os melhores geradores de vídeo com IA disponíveis hoje, incluindo RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo e os super esperados Sora e Veo da DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

blog

Como aprender IA do zero em 2026: Um guia completo feito por especialistas

Descubra tudo o que você precisa saber sobre aprender IA em 2026, desde dicas para começar, recursos úteis e insights de especialistas do setor.
Adel Nehme's photo

Adel Nehme

15 min

blog

Stability AI anuncia a difusão estável 3: Tudo o que sabemos até agora

Saiba mais sobre as novas atualizações do Stable Diffusion e descubra os recursos do modelo de texto para imagem da versão 3.
Richie Cotton's photo

Richie Cotton

Tutorial

Como usar o Midjourney: Um guia abrangente para a criação de obras de arte geradas por IA

Descubra o poder do Midjourney, uma ferramenta de IA generativa para criar obras de arte impressionantes. Saiba como começar, escrever prompts eficazes e otimizar seu uso com nosso guia passo a passo.
Kurtis Pykes 's photo

Kurtis Pykes

12 min

Tutorial

Visão GPT-4: Um guia abrangente para iniciantes

Este tutorial apresentará tudo o que você precisa saber sobre o GPT-4 Vision, desde o acesso a ele, passando por exemplos práticos do mundo real, até suas limitações.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Tutorial

Como fazer o ajuste fino do GPT 3.5: Liberando todo o potencial da IA

Explore o GPT-3.5 Turbo e descubra o potencial transformador do ajuste fino. Saiba como personalizar esse modelo de linguagem avançado para aplicativos de nicho, aprimorar seu desempenho e entender os custos associados, a segurança e as considerações de privacidade.
Moez Ali's photo

Moez Ali

11 min

Ver MaisVer Mais