Pular para o conteúdo principal

ElevenLabs Voice Cloning: um guia prático do VoiceLab

Aprenda a clonar sua voz com Instant e Professional Voice Cloning no ElevenLabs, do áudio à geração de fala via o SDK de Python.
Atualizado 3 de ago. de 2026  · 13 min lido

Explorar com IA

Abrir no ChatGPTAbrir no ClaudeAbrir no Perplexity

Provavelmente você já encontrou uma voz de texto para fala incrível, só para descobrir que o uso completo fica preso em um plano mais caro, que você não consegue deixá-la com a cara da sua marca e, muito menos, chamá-la de sua. É aí que muita gente esbarra com IA de voz. O ElevenLabs VoiceLab muda esse jogo.

Neste guia, vou te apresentar as três ferramentas do ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) e Professional Voice Cloning (PVC). Vamos passo a passo, com o que esperar em cada etapa.

Antes de começar, você vai precisar de:

  • Uma conta gratuita no ElevenLabs é suficiente para usar o Voice Design
  • Plano Starter (US$ 6/mês) para o Instant Voice Cloning
  • Plano Creator (US$ 22/mês) para o Professional Voice Cloning

No fim, você terá pelo menos uma voz personalizada salva na sua biblioteca, pronta para usar em Speech Synthesis (Text to Speech), no Studio ou até via API.

O que é o ElevenLabs VoiceLab?

Em linhas gerais, o VoiceLab é o conjunto de ferramentas do ElevenLabs para criar e gerenciar vozes personalizadas. É para quando você quer algo original, e não apenas um modelo pronto.

Veja uma comparação rápida das três ferramentas do VoiceLab:

Ferramenta

O que faz

Qualidade

Entrada necessária

Tempo de criação

Plano necessário

Melhor uso

Voice Design

Gera vozes sintéticas

Boa

Nenhuma

Instantâneo

Grátis

Experimentação

IVC

Clona uma voz a partir de áudio curto

Boa

~1–5 min de áudio

Instantâneo

Starter+

Protótipos

PVC

Clonagem de voz de alta fidelidade

Excelente

30 min a 3+ horas

1–2 dias

Creator+

Produção

Se quiser ir mais a fundo no uso programático de vozes, recomendo nosso guia da ElevenLabs API.

Trabalhando com a API OpenAI

Comece sua jornada desenvolvendo aplicativos com tecnologia de IA com a API OpenAI.
Explorar O Curso

VoiceLab vs. Voice Library

É importante não confundir com a Voice Library.

  • Voice Library: navegue e use vozes prontas
  • VoiceLab: crie e gerencie suas próprias vozes

Depois de criar uma voz no VoiceLab, você pode publicá-la na Voice Library para outros usarem. Por padrão, porém, ela fica privada na sua conta.

Configurando sua conta ElevenLabs

Começar é simples. 

  1. Acesse elevenlabs.io
  2. Clique em Sign Up
  3. Use Google ou e-mail
  4. Escolha sua plataforma inicial. Selecione Eleven Creative para focar nas ferramentas de criação de voz.

Escolha entre ElevenCreative e ElevenAgents

  1. Verifique sua conta

Depois de acessar, vá para a área do VoiceLab:

  • Clique em Voices na barra lateral esquerda.
  • Clique em + Create Voice

ElevenLabs VoiceLab Voices

Você verá quatro opções:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Opções de criação de voz

Note que nem todos os recursos estão disponíveis em todos os planos. Veja a tabela abaixo para saber o que há em cada nível:

Plano

Voice Design

IVC

PVC

Licença comercial

Free

Sim

Não

Não

Não

Starter

Sim

Sim

Não

Sim

Creator

Sim

Sim

Sim

Sim

Criando uma voz sintética com o Voice Design

O Voice Design é o ponto de partida mais simples. Você não precisa de gravações: ele gera uma voz do zero. É também a única opção disponível no plano gratuito, perfeita para iniciantes.

O fluxo é simples:

  1. Escreva um prompt com alguns ajustes-chave
  2. Gere
  3. Faça o preview
  4. Salve

Dica prática: gere pelo menos 5 a 10 variações antes de escolher. Mesmo com as mesmas configurações, os resultados variam bastante. Para começar, clique no botão Voice Design no menu Create Voice. Isso abrirá um painel para você escrever o prompt da sua voz.

Prompt do Voice Design

Você pode tocar em Settings para ajustar dois detalhes:

  • Loudness: o quão alta a voz será ao gerar. 
  • Guidance level: parecido com a temperatura em outros modelos, indica o quanto a IA deve seguir seu prompt. Guidance mais alta significa aderência maior ao que você pediu; mais baixa dá mais liberdade.

Ajustar loudness e guidance

Você pode deixar o agente de IA usar um texto de prévia próprio ou fornecer seu próprio roteiro, desativando a opção e colando seu texto na caixa de preview.

Texto de preview

Parâmetros para o prompt de voz

Use a área de prompt para definir suas configurações. Experimente o seguinte modelo para destacar parâmetros específicos:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Cada parâmetro influencia o resultado:

  • O VoiceLab é multilíngue, então o idioma determina a tonalidade da voz
  • O sotaque altera padrões de pronúncia
  • A idade afeta pitch e timbre
  • O gênero influencia a faixa vocal
  • O nível de qualidade determina o quão limpo o áudio soa

O interessante é como esses elementos se combinam. Às vezes, combinações inesperadas geram os melhores resultados — vale testar.

Gerando, pré-visualizando e salvando

Clique em Generate voice e o ElevenLabs cria uma amostra curta.

Amostras de vozes geradas

Você pode regenerar quantas vezes quiser. Cada versão sai um pouco diferente.

Quando encontrar uma de que goste:

  • Clique em Save

  • Use um nome descritivo, como narrator_us_male_30s

Depois de salvar, a voz aparecerá em My Voices e no dropdown de Speech Synthesis.

Clonando uma voz com o Instant Voice Cloning (IVC)

O Instant Voice Cloning permite replicar uma voz a partir de uma amostra pequena de áudio. É rápido e surpreendentemente eficaz, embora não perfeito. Lembre-se: você precisa do plano Starter (US$ 6/mês) ou superior.

Aviso importante: clone apenas vozes para as quais você tem permissão de uso. A plataforma exige essa confirmação — e é para valer. O processo é bem direto:

  • Prepare seu áudio
  • Envie o áudio
  • Nomeie e salve o clone
  • Teste em Text to Speech

Preparando sua amostra de áudio

Garanta o tamanho certo, o formato certo e uma qualidade decente. O mínimo é cerca de 1 minuto, mas 3 a 5 minutos costumam dar resultados bem melhores.

Envie arquivos MP3 ou WAV de até 50 MB. Você pode subir vários arquivos de uma vez. 

Para a melhor clonagem e qualidade, recomendo ao gravar:

  • Ambiente silencioso
  • Sem ruído de fundo
  • Distância constante do microfone

Evite ao máximo:

  • Múltiplos locutores
  • Gravações no celular
  • Pós-processamento pesado

Enviando e criando o clone

Volte ao painel de Voices e faça o seguinte:

  1. Clique em + Create Voice
  2. Selecione Instant Voice Cloning
  3. Envie seu áudio e clique em Next

Instant Voice Clone

  1. Dê um nome à voz, adicione labels e uma descrição (opcional)
  2. Confirme o consentimento
  3. Clique em Save Voice

Os seguintes labels podem ser escolhidos em um menu dropdown:

  • Language
  • Accent (abre opções dependendo do idioma)
  • Gender
  • Age (opções: young, middle-aged ou old)

A voz fica pronta na hora e você já pode testá-la no gerador de texto para fala. Experimente frases diferentes e repare onde soa natural e onde ainda patina.

Para isso, clique em Text to Speech na barra lateral esquerda. (Algumas versões chamam isso de Speech Synthesis.)

Text to Speec

Isso abre uma janela com um campo de texto semelhante. 

Janela de Text to Speech

À direita, clique no dropdown de Voice e selecione sua voz em My Voices.

Seleção de voz

Escreva uma frase de teste e clique em Generate speech.

Gerar fala

Isso gera uma amostra de áudio com a voz escolhida. Ajuste as configurações à direita conforme sua preferência. Você pode alterar, por exemplo:

  • Speed
  • Stability
  • Similarity
  • Style Exaggeration 

Escolher modelos diferentes também pode liberar outras opções!

Ajustando a fala gerada

Para salvar seu arquivo, clique no botão de download à direita para baixar o áudio gerado.

Salvar a fala gerada

Criando um clone de alta fidelidade com o Professional Voice Cloning (PVC)

Se o IVC gera uma aproximação, o PVC chega muito mais perto do original. É aqui que entram nuances como ritmo, respiração e emoção.

Ele requer o plano Creator (US$ 22/mês). Segundo o ElevenLabs, o processamento costuma levar de 2 a 6 horas, mas o treino completo pode chegar a 24 horas, dependendo da demanda nos servidores. 

É a opção mais indicada para construir vozes de nível de produção: narração, audiolivros e agentes de voz com identidade de marca — ou seja, usos comerciais ou de larga escala.

Gravando e selecionando seus dados de treino

Como buscamos o melhor modelo possível, os requisitos aumentam. O tempo mínimo é 30 minutos de áudio limpo, mas, para resultados ideais, mire em 3+ horas. A melhor forma de enviar é dividir em amostras de 30 minutos.

Algumas dicas para aproveitar ao máximo sua gravação:

  • Use um ambiente silencioso
  • Tente usar um bom microfone
  • Varie o conteúdo; não leia tudo de um único texto

Por exemplo, varie seu estilo de narração:

  • Use diferentes tipos de diálogo. Leia alguns textos instrutivos. 
  • Passe por alguns números e listas. Isso dá variedade de pronúncia e sintaxe. 
  • Além disso, grave em ritmos e emoções diferentes. Mais nuances e estilo ajudam a treinar um modelo melhor.

Como sempre, evite áudio de baixa qualidade, como:

  • Ruído de fundo
  • Compressão pesada
  • Muletas verbais como “ãhn” e “éh”

Enviando e aguardando o treino

Com o áudio pronto, os passos são simples:

  1. Selecione Professional Voice Clone
  2. Clique no botão Create new clone

Criar um Professional Voice Clone

  1. Envie todas as gravações, preencha nome, idioma e demais labels

Detalhes do PVC

  1. Preencha os detalhes de consentimento
  2. Envie

Antes de treinar seu clone, o ElevenLabs pede que você prove que a voz é, de fato, sua.

Esta é a grande diferença do IVC: a clonagem profissional só permite clonar a sua própria voz, então não dá para clonar a de outra pessoa, mesmo com consentimento. Se um colega quiser emprestar a voz, ele precisa criar e verificar o PVC na própria conta e depois compartilhar com você via link privado.

A verificação é uma gravação curta ao vivo: você lê algumas linhas na tela no seu microfone. Dois pontos são decisivos:

  • Use o mesmo equipamento (ou muito similar) das amostras e mantenha tom e entrega parecidos. Diferenças aqui são a causa mais comum de reprovação.
  • Leia cada linha apenas uma vez e depois pare. Ler mais de uma vez pode invalidar a verificação.

Se falhar, você pode esperar 24 horas e tentar de novo, ou falar com o suporte. Um aviso: ao chegar na verificação, o clone fica bloqueado. Você não consegue apagar um PVC não verificado sozinho, então garanta que as amostras estejam corretas antes.

Você será avisado quando o clone estiver pronto! Depois disso, uma dica útil é comparar os resultados de IVC e PVC usando a mesma frase. A diferença costuma ser bem clara.

Usando suas vozes do VoiceLab em projetos

Assim que sua voz é salva, ela fica disponível em toda a plataforma, em qualquer lugar onde o ElevenLabs gera áudio.

Você pode usá-la em:

  • Text to Speech (Speech Synthesis) para geração rápida
  • Studio para projetos longos
  • Python API para uso programático

Vou mostrar como usar sua voz em cada uma dessas ferramentas. O guia para iniciantes da ElevenLabs API é a melhor forma de começar com a API de Python.

Usando vozes personalizadas em Text to Speech e Studio

No Text to Speech, basta selecionar sua voz em Voices -> My Voices, como vimos acima.

Algumas dicas de ajuste no Text to Speech:

  • Comece com Stability entre 40 e 50%
  • Mantenha Similarity por volta de 75%
  • Ajuste conforme o resultado

Pode levar algumas tentativas até chegar exatamente na voz e na gravação que você quer, mas quanto mais experimentar, melhor vai entender o processo de geração de fala.

No Studio, é parecido. Vá em Studio na barra lateral esquerda e selecione + New Blank Project. Depois, escolha o tipo de projeto:

  • Audio Project ou
  • Video Project

Um projeto de áudio permite criar conteúdo conversacional longo com múltiplas vozes. Um projeto de vídeo exige subir um vídeo primeiro e, depois, você adiciona vozes para fazer a narração.

O projeto de áudio do Studio permite criar um arquivo com múltiplos locutores. Ótimo para gerar podcasts ou conversas, e até audiolivros com personagens diferentes. 

O painel do Studio é um canvas em branco. Vamos focar na parte de vozes, mas sinta-se à vontade para explorar.

Projeto de áudio no Studio

À esquerda, você verá uma seção de voz já selecionada. Conforme você digita no campo de texto, o Studio destaca a fala daquele personagem.

Criando novo parágrafo

Ao ir para a próxima linha, você pode selecionar outra voz e criar outro personagem. Cada linha é um “parágrafo”:

Selecionando voz para um parágrafo

Os limites do Studio são generosos. Cada projeto pode ter até 500 capítulos, cada capítulo até 400 parágrafos, e cada parágrafo até 5.000 caracteres.

O número de projetos que você pode manter depende do plano:

  • Free: 5 projetos
  • Starter: 20 projetos
  • Creator: 1.000 projetos

Siga os mesmos passos, mas escolha um projeto de vídeo. Você verá um canvas em branco e será solicitado a enviar um vídeo:Projeto de vídeo no Studio

Depois de subir um clipe, ele aparece à esquerda e você pode dar play para pré-visualizar. É possível adicionar vários vídeos.

Em seguida, vá à esquerda e selecione Speech.

Arquivos do projeto de vídeo

Assim como no áudio, você pode escolher várias vozes e digitar as falas. Ao digitar, pressione Enter para ir à próxima linha. Dá para usar vozes diferentes em cada linha e criar um diálogo.

Adicionar voz a um vídeo

Na parte de baixo, ajuste facilmente o tempo de cada fala arrastando e soltando na timeline.

Edição de vídeo com fala gerada

Se você não tiver fotos ou vídeo, pode gerá-los pela aba Video à esquerda. Basta escrever um prompt e a plataforma gera a imagem ou o vídeo desejado. 

Observação: é preciso aceitar os termos de beta de Image and Video. Além disso, membros gratuitos só podem gerar imagens; para gerar vídeo é necessário pelo menos o plano Starter (US$ 5/mês).

Gerar vídeo

Acessando vozes personalizadas pelo ElevenLabs Python SDK

Para usar o SDK de Python, você precisa primeiro ter o Python instalado. Depois, crie um ambiente de Python e instale o SDK do ElevenLabs com: pip install "elevenlabs[pyaudio]"

Em seguida, vá ao painel de desenvolvedores do ElevenLabs clicando no rodapé da barra lateral esquerda e selecionando API Keys -> Create Key.

Console de desenvolvedor do ElevenLabs

Depois, selecione quais ferramentas terão acesso via API e clique em Create Key.

Criar chave de API

Uma janela exibirá a chave de API, que você precisa copiar na hora, senão a perde para sempre.

Chave de API criada

Guarde a chave em um arquivo .env em local seguro ou na pasta do projeto.

Depois, vá ao painel de Voices e selecione My Voices. Copie o Voice ID da sua voz e salve em um lugar fácil de acessar depois.

Copiar Voice ID

Agora é só criar um script para rodar sua voz do ElevenLabs! Veja um exemplo simples:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Conclusão

O VoiceLab oferece três caminhos, dependendo da sua necessidade. O Voice Design é perfeito para experimentar, o Instant Voice Cloning é ótimo para protótipos rápidos e o Professional Voice Cloning entrega qualidade de produção.

Se você está começando, recomendo ficar no Voice Design primeiro. Faça upgrade só quando tiver um caso de uso claro.

Se você quiser ir mais a fundo na criação de aplicativos com IA, confira nossa trilha de habilidades Developing AI Applications, que ensina a usar as ferramentas mais recentes para desenvolvedores de IA, incluindo OpenAI API, Hugging Face e LangChain.

Perguntas frequentes sobre o ElevenLabs VoiceLab

O ElevenLabs é grátis para usar?

Sim. O plano gratuito oferece cerca de 10.000 créditos por mês (aprox. 10 minutos de áudio), além do Voice Design e da biblioteca de vozes padrão. Mas ele não permite uso comercial e não inclui clonagem de voz; para Instant Voice Cloning e licença comercial, você precisa pelo menos do plano Starter.

Preciso de um plano pago para usar vozes do ElevenLabs comercialmente?

Sim. O plano gratuito exige atribuição ao ElevenLabs e não concede direitos comerciais, então você não pode monetizar esse áudio. A licença comercial começa no plano Starter (cerca de US$ 6/mês, ou US$ 5 na cobrança anual), enquanto o Professional Voice Cloning para vozes de nível de produção requer o plano Creator (US$ 22/mês) ou superior.

Posso clonar a voz de outra pessoa com o ElevenLabs?

Apenas com permissão explícita, e as regras variam por método. O Instant Voice Cloning permite clonar qualquer voz para a qual você tenha autorização, mas o Professional Voice Cloning é restrito à sua própria voz e exige uma gravação de verificação ao vivo (mesmo com consentimento). Usar um clone para personificação ou fraude é ilegal na maioria das jurisdições.

Qual é a diferença entre Instant e Professional Voice Cloning?

O Instant Voice Cloning (IVC) gera um clone utilizável em segundos a partir de apenas 1–2 minutos de áudio e é ideal para protótipos, embora possa perder nuances sutis. O Professional Voice Cloning (PVC) treina um modelo dedicado com 30 minutos a 3 horas de áudio e leva algumas horas para processar, entregando um resultado muito mais fiel e pronto para produção. Use IVC para testar rápido e PVC quando a qualidade for essencial.

Posso usar minha voz personalizada do ElevenLabs fora da plataforma?

Não diretamente. Clones de voz não podem ser exportados e só funcionam dentro do ElevenLabs. Ainda assim, você pode usá-los em qualquer lugar da plataforma que gere áudio, incluindo Text to Speech, Studio e de forma programática via ElevenLabs API e Python SDK — é assim que muita gente integra uma voz personalizada aos próprios apps e pipelines.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Sou um cientista de dados com experiência em análise espacial, machine learning e pipelines de dados. Trabalhei com GCP, Hadoop, Hive, Snowflake, Airflow e outros processos de engenharia/ciência de dados.

Tópicos

Aprenda IA com a DataCamp!

Programa

Desenvolvimento de aplicativos de IA

21 h
Aprenda a criar aplicativos com tecnologia de IA com as mais recentes ferramentas de desenvolvimento de IA, incluindo a API OpenAI, Hugging Face e LangChain.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

Tutorial

Primeiros passos com o Claude 3 e a API do Claude 3

Saiba mais sobre os modelos Claude 3, benchmarks de desempenho detalhados e como acessá-los. Além disso, descubra a nova API Python do Claude 3 para geração de texto, acesso a recursos de visão e streaming.
Abid Ali Awan's photo

Abid Ali Awan

Tutorial

Como usar a API de conversão de texto em fala da OpenAI

A API TTS da OpenAI é um ponto de extremidade que permite que os usuários interajam com seu modelo de IA TTS que converte texto em linguagem falada com som natural.
Kurtis Pykes 's photo

Kurtis Pykes

cursor ai code editor

Tutorial

AI do cursor: Um guia com 10 exemplos práticos

Saiba como instalar o Cursor AI no Windows, macOS e Linux e descubra como usá-lo em 10 casos de uso diferentes.

Tutorial

Guia para iniciantes no uso da API do ChatGPT

Este guia o orienta sobre os conceitos básicos da API ChatGPT, demonstrando seu potencial no processamento de linguagem natural e na comunicação orientada por IA.
Moez Ali's photo

Moez Ali

Tutorial

Tutorial de análise de sentimentos com NLTK para iniciantes

Tutorial de análise de sentimentos com NLTK (Natural Language Toolkit) em Python. Aprenda a criar e desenvolver análises de sentimentos usando Python. Siga etapas específicas para realizar a mineração e análise de textos e fazer o processamento de linguagem natural.
Moez Ali's photo

Moez Ali

Tutorial

Tutorial da API de assistentes da OpenAI

Uma visão geral abrangente da API Assistants com nosso artigo, que oferece uma análise aprofundada de seus recursos, usos no setor, orientação de configuração e práticas recomendadas para maximizar seu potencial em vários aplicativos de negócios.
Zoumana Keita 's photo

Zoumana Keita

Ver MaisVer Mais