Programa
Provavelmente você já encontrou uma voz de texto para fala incrível, só para descobrir que o uso completo fica preso em um plano mais caro, que você não consegue deixá-la com a cara da sua marca e, muito menos, chamá-la de sua. É aí que muita gente esbarra com IA de voz. O ElevenLabs VoiceLab muda esse jogo.
Neste guia, vou te apresentar as três ferramentas do ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) e Professional Voice Cloning (PVC). Vamos passo a passo, com o que esperar em cada etapa.
Antes de começar, você vai precisar de:
- Uma conta gratuita no ElevenLabs é suficiente para usar o Voice Design
- Plano Starter (US$ 6/mês) para o Instant Voice Cloning
- Plano Creator (US$ 22/mês) para o Professional Voice Cloning
No fim, você terá pelo menos uma voz personalizada salva na sua biblioteca, pronta para usar em Speech Synthesis (Text to Speech), no Studio ou até via API.
O que é o ElevenLabs VoiceLab?
Em linhas gerais, o VoiceLab é o conjunto de ferramentas do ElevenLabs para criar e gerenciar vozes personalizadas. É para quando você quer algo original, e não apenas um modelo pronto.
Veja uma comparação rápida das três ferramentas do VoiceLab:
|
Ferramenta |
O que faz |
Qualidade |
Entrada necessária |
Tempo de criação |
Plano necessário |
Melhor uso |
|
Voice Design |
Gera vozes sintéticas |
Boa |
Nenhuma |
Instantâneo |
Grátis |
Experimentação |
|
IVC |
Clona uma voz a partir de áudio curto |
Boa |
~1–5 min de áudio |
Instantâneo |
Starter+ |
Protótipos |
|
PVC |
Clonagem de voz de alta fidelidade |
Excelente |
30 min a 3+ horas |
1–2 dias |
Creator+ |
Produção |
Se quiser ir mais a fundo no uso programático de vozes, recomendo nosso guia da ElevenLabs API.
Trabalhando com a API OpenAI
VoiceLab vs. Voice Library
É importante não confundir com a Voice Library.
- Voice Library: navegue e use vozes prontas
- VoiceLab: crie e gerencie suas próprias vozes
Depois de criar uma voz no VoiceLab, você pode publicá-la na Voice Library para outros usarem. Por padrão, porém, ela fica privada na sua conta.
Configurando sua conta ElevenLabs
Começar é simples.
- Acesse elevenlabs.io
- Clique em Sign Up
- Use Google ou e-mail
- Escolha sua plataforma inicial. Selecione Eleven Creative para focar nas ferramentas de criação de voz.

- Verifique sua conta
Depois de acessar, vá para a área do VoiceLab:
- Clique em Voices na barra lateral esquerda.
- Clique em + Create Voice

Você verá quatro opções:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Note que nem todos os recursos estão disponíveis em todos os planos. Veja a tabela abaixo para saber o que há em cada nível:
|
Plano |
Voice Design |
IVC |
PVC |
Licença comercial |
|
Free |
Sim |
Não |
Não |
Não |
|
Starter |
Sim |
Sim |
Não |
Sim |
|
Creator |
Sim |
Sim |
Sim |
Sim |
Criando uma voz sintética com o Voice Design
O Voice Design é o ponto de partida mais simples. Você não precisa de gravações: ele gera uma voz do zero. É também a única opção disponível no plano gratuito, perfeita para iniciantes.
O fluxo é simples:
- Escreva um prompt com alguns ajustes-chave
- Gere
- Faça o preview
- Salve
Dica prática: gere pelo menos 5 a 10 variações antes de escolher. Mesmo com as mesmas configurações, os resultados variam bastante. Para começar, clique no botão Voice Design no menu Create Voice. Isso abrirá um painel para você escrever o prompt da sua voz.

Você pode tocar em Settings para ajustar dois detalhes:
- Loudness: o quão alta a voz será ao gerar.
- Guidance level: parecido com a temperatura em outros modelos, indica o quanto a IA deve seguir seu prompt. Guidance mais alta significa aderência maior ao que você pediu; mais baixa dá mais liberdade.

Você pode deixar o agente de IA usar um texto de prévia próprio ou fornecer seu próprio roteiro, desativando a opção e colando seu texto na caixa de preview.

Parâmetros para o prompt de voz
Use a área de prompt para definir suas configurações. Experimente o seguinte modelo para destacar parâmetros específicos:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Cada parâmetro influencia o resultado:
- O VoiceLab é multilíngue, então o idioma determina a tonalidade da voz
- O sotaque altera padrões de pronúncia
- A idade afeta pitch e timbre
- O gênero influencia a faixa vocal
- O nível de qualidade determina o quão limpo o áudio soa
O interessante é como esses elementos se combinam. Às vezes, combinações inesperadas geram os melhores resultados — vale testar.
Gerando, pré-visualizando e salvando
Clique em Generate voice e o ElevenLabs cria uma amostra curta.

Você pode regenerar quantas vezes quiser. Cada versão sai um pouco diferente.
Quando encontrar uma de que goste:
-
Clique em Save
-
Use um nome descritivo, como
narrator_us_male_30s
Depois de salvar, a voz aparecerá em My Voices e no dropdown de Speech Synthesis.
Clonando uma voz com o Instant Voice Cloning (IVC)
O Instant Voice Cloning permite replicar uma voz a partir de uma amostra pequena de áudio. É rápido e surpreendentemente eficaz, embora não perfeito. Lembre-se: você precisa do plano Starter (US$ 6/mês) ou superior.
Aviso importante: clone apenas vozes para as quais você tem permissão de uso. A plataforma exige essa confirmação — e é para valer. O processo é bem direto:
- Prepare seu áudio
- Envie o áudio
- Nomeie e salve o clone
- Teste em Text to Speech
Preparando sua amostra de áudio
Garanta o tamanho certo, o formato certo e uma qualidade decente. O mínimo é cerca de 1 minuto, mas 3 a 5 minutos costumam dar resultados bem melhores.
Envie arquivos MP3 ou WAV de até 50 MB. Você pode subir vários arquivos de uma vez.
Para a melhor clonagem e qualidade, recomendo ao gravar:
- Ambiente silencioso
- Sem ruído de fundo
- Distância constante do microfone
Evite ao máximo:
- Múltiplos locutores
- Gravações no celular
- Pós-processamento pesado
Enviando e criando o clone
Volte ao painel de Voices e faça o seguinte:
- Clique em + Create Voice
- Selecione Instant Voice Cloning
- Envie seu áudio e clique em Next

- Dê um nome à voz, adicione labels e uma descrição (opcional)
- Confirme o consentimento
- Clique em Save Voice
Os seguintes labels podem ser escolhidos em um menu dropdown:
- Language
- Accent (abre opções dependendo do idioma)
- Gender
- Age (opções: young, middle-aged ou old)
A voz fica pronta na hora e você já pode testá-la no gerador de texto para fala. Experimente frases diferentes e repare onde soa natural e onde ainda patina.
Para isso, clique em Text to Speech na barra lateral esquerda. (Algumas versões chamam isso de Speech Synthesis.)

Isso abre uma janela com um campo de texto semelhante.

À direita, clique no dropdown de Voice e selecione sua voz em My Voices.

Escreva uma frase de teste e clique em Generate speech.

Isso gera uma amostra de áudio com a voz escolhida. Ajuste as configurações à direita conforme sua preferência. Você pode alterar, por exemplo:
- Speed
- Stability
- Similarity
- Style Exaggeration
Escolher modelos diferentes também pode liberar outras opções!

Para salvar seu arquivo, clique no botão de download à direita para baixar o áudio gerado.

Criando um clone de alta fidelidade com o Professional Voice Cloning (PVC)
Se o IVC gera uma aproximação, o PVC chega muito mais perto do original. É aqui que entram nuances como ritmo, respiração e emoção.
Ele requer o plano Creator (US$ 22/mês). Segundo o ElevenLabs, o processamento costuma levar de 2 a 6 horas, mas o treino completo pode chegar a 24 horas, dependendo da demanda nos servidores.
É a opção mais indicada para construir vozes de nível de produção: narração, audiolivros e agentes de voz com identidade de marca — ou seja, usos comerciais ou de larga escala.
Gravando e selecionando seus dados de treino
Como buscamos o melhor modelo possível, os requisitos aumentam. O tempo mínimo é 30 minutos de áudio limpo, mas, para resultados ideais, mire em 3+ horas. A melhor forma de enviar é dividir em amostras de 30 minutos.
Algumas dicas para aproveitar ao máximo sua gravação:
- Use um ambiente silencioso
- Tente usar um bom microfone
- Varie o conteúdo; não leia tudo de um único texto
Por exemplo, varie seu estilo de narração:
- Use diferentes tipos de diálogo. Leia alguns textos instrutivos.
- Passe por alguns números e listas. Isso dá variedade de pronúncia e sintaxe.
- Além disso, grave em ritmos e emoções diferentes. Mais nuances e estilo ajudam a treinar um modelo melhor.
Como sempre, evite áudio de baixa qualidade, como:
- Ruído de fundo
- Compressão pesada
- Muletas verbais como “ãhn” e “éh”
Enviando e aguardando o treino
Com o áudio pronto, os passos são simples:
- Selecione Professional Voice Clone
- Clique no botão Create new clone

- Envie todas as gravações, preencha nome, idioma e demais labels

- Preencha os detalhes de consentimento
- Envie
Antes de treinar seu clone, o ElevenLabs pede que você prove que a voz é, de fato, sua.
Esta é a grande diferença do IVC: a clonagem profissional só permite clonar a sua própria voz, então não dá para clonar a de outra pessoa, mesmo com consentimento. Se um colega quiser emprestar a voz, ele precisa criar e verificar o PVC na própria conta e depois compartilhar com você via link privado.
A verificação é uma gravação curta ao vivo: você lê algumas linhas na tela no seu microfone. Dois pontos são decisivos:
- Use o mesmo equipamento (ou muito similar) das amostras e mantenha tom e entrega parecidos. Diferenças aqui são a causa mais comum de reprovação.
- Leia cada linha apenas uma vez e depois pare. Ler mais de uma vez pode invalidar a verificação.
Se falhar, você pode esperar 24 horas e tentar de novo, ou falar com o suporte. Um aviso: ao chegar na verificação, o clone fica bloqueado. Você não consegue apagar um PVC não verificado sozinho, então garanta que as amostras estejam corretas antes.
Você será avisado quando o clone estiver pronto! Depois disso, uma dica útil é comparar os resultados de IVC e PVC usando a mesma frase. A diferença costuma ser bem clara.
Usando suas vozes do VoiceLab em projetos
Assim que sua voz é salva, ela fica disponível em toda a plataforma, em qualquer lugar onde o ElevenLabs gera áudio.
Você pode usá-la em:
- Text to Speech (Speech Synthesis) para geração rápida
- Studio para projetos longos
- Python API para uso programático
Vou mostrar como usar sua voz em cada uma dessas ferramentas. O guia para iniciantes da ElevenLabs API é a melhor forma de começar com a API de Python.
Usando vozes personalizadas em Text to Speech e Studio
No Text to Speech, basta selecionar sua voz em Voices -> My Voices, como vimos acima.
Algumas dicas de ajuste no Text to Speech:
- Comece com Stability entre 40 e 50%
- Mantenha Similarity por volta de 75%
- Ajuste conforme o resultado
Pode levar algumas tentativas até chegar exatamente na voz e na gravação que você quer, mas quanto mais experimentar, melhor vai entender o processo de geração de fala.
No Studio, é parecido. Vá em Studio na barra lateral esquerda e selecione + New Blank Project. Depois, escolha o tipo de projeto:
- Audio Project ou
- Video Project
Um projeto de áudio permite criar conteúdo conversacional longo com múltiplas vozes. Um projeto de vídeo exige subir um vídeo primeiro e, depois, você adiciona vozes para fazer a narração.
Navegação em projeto de áudio no Studio
O projeto de áudio do Studio permite criar um arquivo com múltiplos locutores. Ótimo para gerar podcasts ou conversas, e até audiolivros com personagens diferentes.
O painel do Studio é um canvas em branco. Vamos focar na parte de vozes, mas sinta-se à vontade para explorar.

À esquerda, você verá uma seção de voz já selecionada. Conforme você digita no campo de texto, o Studio destaca a fala daquele personagem.

Ao ir para a próxima linha, você pode selecionar outra voz e criar outro personagem. Cada linha é um “parágrafo”:

Os limites do Studio são generosos. Cada projeto pode ter até 500 capítulos, cada capítulo até 400 parágrafos, e cada parágrafo até 5.000 caracteres.
O número de projetos que você pode manter depende do plano:
- Free: 5 projetos
- Starter: 20 projetos
- Creator: 1.000 projetos
Navegação em projeto de vídeo no Studio
Siga os mesmos passos, mas escolha um projeto de vídeo. Você verá um canvas em branco e será solicitado a enviar um vídeo:
Depois de subir um clipe, ele aparece à esquerda e você pode dar play para pré-visualizar. É possível adicionar vários vídeos.
Em seguida, vá à esquerda e selecione Speech.

Assim como no áudio, você pode escolher várias vozes e digitar as falas. Ao digitar, pressione Enter para ir à próxima linha. Dá para usar vozes diferentes em cada linha e criar um diálogo.

Na parte de baixo, ajuste facilmente o tempo de cada fala arrastando e soltando na timeline.

Se você não tiver fotos ou vídeo, pode gerá-los pela aba Video à esquerda. Basta escrever um prompt e a plataforma gera a imagem ou o vídeo desejado.
Observação: é preciso aceitar os termos de beta de Image and Video. Além disso, membros gratuitos só podem gerar imagens; para gerar vídeo é necessário pelo menos o plano Starter (US$ 5/mês).

Acessando vozes personalizadas pelo ElevenLabs Python SDK
Para usar o SDK de Python, você precisa primeiro ter o Python instalado. Depois, crie um ambiente de Python e instale o SDK do ElevenLabs com: pip install "elevenlabs[pyaudio]"
Em seguida, vá ao painel de desenvolvedores do ElevenLabs clicando no rodapé da barra lateral esquerda e selecionando API Keys -> Create Key.

Depois, selecione quais ferramentas terão acesso via API e clique em Create Key.

Uma janela exibirá a chave de API, que você precisa copiar na hora, senão a perde para sempre.

Guarde a chave em um arquivo .env em local seguro ou na pasta do projeto.
Depois, vá ao painel de Voices e selecione My Voices. Copie o Voice ID da sua voz e salve em um lugar fácil de acessar depois.

Agora é só criar um script para rodar sua voz do ElevenLabs! Veja um exemplo simples:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Conclusão
O VoiceLab oferece três caminhos, dependendo da sua necessidade. O Voice Design é perfeito para experimentar, o Instant Voice Cloning é ótimo para protótipos rápidos e o Professional Voice Cloning entrega qualidade de produção.
Se você está começando, recomendo ficar no Voice Design primeiro. Faça upgrade só quando tiver um caso de uso claro.
Se você quiser ir mais a fundo na criação de aplicativos com IA, confira nossa trilha de habilidades Developing AI Applications, que ensina a usar as ferramentas mais recentes para desenvolvedores de IA, incluindo OpenAI API, Hugging Face e LangChain.
Perguntas frequentes sobre o ElevenLabs VoiceLab
O ElevenLabs é grátis para usar?
Sim. O plano gratuito oferece cerca de 10.000 créditos por mês (aprox. 10 minutos de áudio), além do Voice Design e da biblioteca de vozes padrão. Mas ele não permite uso comercial e não inclui clonagem de voz; para Instant Voice Cloning e licença comercial, você precisa pelo menos do plano Starter.
Preciso de um plano pago para usar vozes do ElevenLabs comercialmente?
Sim. O plano gratuito exige atribuição ao ElevenLabs e não concede direitos comerciais, então você não pode monetizar esse áudio. A licença comercial começa no plano Starter (cerca de US$ 6/mês, ou US$ 5 na cobrança anual), enquanto o Professional Voice Cloning para vozes de nível de produção requer o plano Creator (US$ 22/mês) ou superior.
Posso clonar a voz de outra pessoa com o ElevenLabs?
Apenas com permissão explícita, e as regras variam por método. O Instant Voice Cloning permite clonar qualquer voz para a qual você tenha autorização, mas o Professional Voice Cloning é restrito à sua própria voz e exige uma gravação de verificação ao vivo (mesmo com consentimento). Usar um clone para personificação ou fraude é ilegal na maioria das jurisdições.
Qual é a diferença entre Instant e Professional Voice Cloning?
O Instant Voice Cloning (IVC) gera um clone utilizável em segundos a partir de apenas 1–2 minutos de áudio e é ideal para protótipos, embora possa perder nuances sutis. O Professional Voice Cloning (PVC) treina um modelo dedicado com 30 minutos a 3 horas de áudio e leva algumas horas para processar, entregando um resultado muito mais fiel e pronto para produção. Use IVC para testar rápido e PVC quando a qualidade for essencial.
Posso usar minha voz personalizada do ElevenLabs fora da plataforma?
Não diretamente. Clones de voz não podem ser exportados e só funcionam dentro do ElevenLabs. Ainda assim, você pode usá-los em qualquer lugar da plataforma que gere áudio, incluindo Text to Speech, Studio e de forma programática via ElevenLabs API e Python SDK — é assim que muita gente integra uma voz personalizada aos próprios apps e pipelines.
Sou um cientista de dados com experiência em análise espacial, machine learning e pipelines de dados. Trabalhei com GCP, Hadoop, Hive, Snowflake, Airflow e outros processos de engenharia/ciência de dados.




