programa
Seguro que alguna vez has encontrado una gran voz de texto a voz, para darte cuenta después de que el uso completo está bloqueado en un plan más caro, no puedes ajustarla a tu marca y, desde luego, no puedes llamarla tuya. Ahí es donde mucha gente se atasca con la IA de voz. ElevenLabs VoiceLab cambia el juego.
En esta guía, voy a mostrarte las tres herramientas de ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) y Professional Voice Cloning (PVC). Iremos paso a paso para que sepas qué esperar en cada fase.
Antes de empezar, esto es lo que necesitas:
- Una cuenta gratuita de ElevenLabs es suficiente para Voice Design
- Plan Starter (6 $/mes) para Instant Voice Cloning
- Plan Creator (22 $/mes) para Professional Voice Cloning
Al terminar, tendrás al menos una voz personalizada guardada en tu biblioteca, lista para usar en Speech Synthesis (Text to Speech), Studio o incluso vía API.
¿Qué es ElevenLabs VoiceLab?
A grandes rasgos, VoiceLab es la suite de ElevenLabs para crear y gestionar voces personalizadas. Es donde vas cuando buscas algo original, no una voz prefabricada.
Aquí tienes una comparación rápida de las tres herramientas de VoiceLab:
|
Herramienta |
Qué hace |
Calidad |
Entrada necesaria |
Tiempo de creación |
Plan necesario |
Mejor caso de uso |
|
Voice Design |
Genera voces sintéticas |
Buena |
Ninguna |
Instantáneo |
Gratis |
Experimentación |
|
IVC |
Clona una voz a partir de audio corto |
Buena |
~1–5 min de audio |
Instantáneo |
Starter+ |
Prototipos |
|
PVC |
Clonación de voz de alta fidelidad |
Excelente |
30 min a 3+ horas |
1–2 días |
Creator+ |
Producción |
Si quieres profundizar en el uso de voces de forma programática, te recomiendo nuestra guía de la API de ElevenLabs.
Trabajar con la API de OpenAI
VoiceLab vs. Voice Library
Es importante no confundirlo con la Voice Library.
- Voice Library: explora y usa voces prediseñadas
- VoiceLab: crea y gestiona tus propias voces
Cuando creas una voz en VoiceLab, puedes publicarla en la Voice Library para que otros la utilicen. Pero, por defecto, se mantiene privada en tu cuenta.
Configurar tu cuenta de ElevenLabs
Empezar es muy sencillo.
- Ve a elevenlabs.io
- Haz clic en Sign Up
- Usa Google o tu email
- Elige tu plataforma inicial. Selecciona Eleven Creative para centrarte en las herramientas de creación de voz.

- Verifica tu cuenta
Una vez dentro, ve a la sección VoiceLab:
- Haz clic en Voices en la barra lateral izquierda.
- Haz clic en + Create Voice

Verás cuatro opciones:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Ten en cuenta que no todas estas funciones están disponibles en todos los planes. Consulta la tabla siguiente para saber qué incluye cada nivel:
|
Plan |
Voice Design |
IVC |
PVC |
Licencia comercial |
|
Free |
Sí |
No |
No |
No |
|
Starter |
Sí |
Sí |
No |
Sí |
|
Creator |
Sí |
Sí |
Sí |
Sí |
Crear una voz sintética con Voice Design
Voice Design es el punto de partida más sencillo. No necesitas grabaciones: genera una voz desde cero. Además, es la única opción disponible en el plan gratuito, perfecta para empezar.
El flujo es simple:
- Escribe un prompt con algunos ajustes clave
- Genera
- Previsualiza
- Guarda
Un consejo práctico: genera al menos entre 5 y 10 variaciones antes de elegir. Incluso con la misma configuración, los resultados pueden variar bastante. Para empezar, haz clic en el botón Voice Design del menú Create Voice. Se abrirá una ventana para que escribas el prompt de tu voz.

Puedes tocar Settings para ajustar dos parámetros:
- Loudness: volumen de la voz generada.
- Guidance level: parecido a la temperatura en otros modelos; indica cuánto debe ceñirse la IA a tu prompt. Un guidance alto sigue más estrictamente lo que pides; uno bajo le da más libertad.

Puedes dejar que el agente de IA use su propio texto de vista previa o proporcionar tu propio guion desactivando el ajuste y pegando tu texto en el cuadro de preview.

Definir parámetros en el prompt
Usa el área de prompt para configurar tu voz. Prueba con esta plantilla para centrarte en parámetros clave:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Cada parámetro influye en el resultado:
- VoiceLabs es multilingüe, así que el idioma determina la tonalidad
- El acento cambia los patrones de pronunciación
- La edad afecta al tono y la altura
- El género influye en el rango vocal
- El nivel de calidad determina lo limpio que suena el audio
Lo interesante es cómo se combinan. A veces, las mezclas menos obvias dan los mejores resultados, así que merece la pena probar.
Generar, previsualizar y guardar
Haz clic en Generate voice y ElevenLabs creará una muestra corta.

Puedes regenerar tantas veces como quieras. Cada versión será ligeramente distinta.
Cuando encuentres una que te guste:
-
Haz clic en Save
-
Usa un nombre descriptivo como
narrator_us_male_30s
Tras guardarla, la voz aparecerá en My Voices y en el desplegable de Speech Synthesis.
Clonar una voz con Instant Voice Cloning (IVC)
Instant Voice Cloning te permite replicar una voz usando solo una muestra breve de audio. Es rápido y sorprendentemente eficaz, aunque no perfecto. Recuerda que necesitas el plan Starter (6 $/mes) o superior.
Aviso importante: clona solo voces para las que tengas permiso. La plataforma te pedirá confirmación y debes tomártelo en serio. El proceso es simple:
- Prepara tu audio
- Sube el audio
- Pon nombre y guarda tu clon de voz
- Prueba en Text to Speech
Preparar tu muestra de audio
El audio debe tener la longitud, el formato y la calidad adecuados. El mínimo es alrededor de un minuto, pero 3 a 5 minutos suelen dar mejores resultados.
Sube archivos MP3 o WAV de menos de 50 MB, y puedes cargar varios a la vez.
Para un mejor clonado y buena calidad, te recomiendo grabar así:
- Habitación silenciosa
- Sin ruido de fondo
- Distancia al micrófono constante
Evita lo siguiente:
- Varios interlocutores
- Grabaciones con móvil
- Postprocesado agresivo
Subir y crear el clon
Vuelve al panel de Voices y haz lo siguiente:
- Haz clic en + Create Voice
- Selecciona Instant Voice Cloning
- Sube tu audio y pulsa Next

- Pon nombre a tu voz; opcionalmente añade etiquetas y una descripción
- Confirma el consentimiento
- Haz clic en Save Voice
Las etiquetas disponibles en el desplegable son:
- Language
- Accent (muestra opciones según el idioma)
- Gender
- Age (opciones: young, middle-aged u old)
La voz estará lista al instante y podrás probarla en el generador de texto a voz. Prueba varias frases y fíjate dónde suena natural y dónde flojea.
Para ello, haz clic en Text to Speech en la barra lateral izquierda. (En algunas versiones aparece como Speech Synthesis).

Se abrirá una ventana con un campo de texto similar.

A la derecha, abre el desplegable Voice y elige tu voz en My Voices.

Escribe una frase de prueba y haz clic en Generate speech.

Esto generará un audio con la voz elegida. Ajusta los parámetros de la derecha a tu gusto. Puedes modificar, por ejemplo:
- Speed
- Stability
- Similarity
- Style Exaggeration
Cambiar de modelo también puede abrir más opciones.

Para guardar el archivo, haz clic en el botón de descarga de la derecha y guarda el audio generado.

Crear un clon de alta fidelidad con Professional Voice Cloning (PVC)
Si IVC te da una aproximación, PVC te acerca mucho más al original. Aquí se capturan matices como el ritmo, la respiración y la emoción.
Requiere el plan Creator (22 $/mes). Según ElevenLabs, el procesamiento suele tardar entre 2 y 6 horas, aunque el entrenamiento total puede llegar a 24 horas según la carga de servidores.
Es la opción más adecuada para crear voces de nivel producción: narraciones, audiolibros o asistentes de voz de marca. Cosas con uso comercial o a gran escala.
Grabar y seleccionar tus datos de entrenamiento
Como buscamos el mejor modelo posible, suben los requisitos. El mínimo son 30 minutos de audio limpio, pero para resultados óptimos apunta a 3+ horas. Lo ideal es dividir el audio en bloques de 30 minutos.
Algunos consejos para aprovechar la grabación:
- Graba en un entorno silencioso
- Usa un micrófono de calidad
- Incluye contenido variado; no leas solo de una misma fuente
Por ejemplo, puedes variar tu estilo de narración:
- Incluye distintos tipos de diálogo. Lee algunos textos instructivos.
- Recita números y listas. Aporta variedad de pronunciación y sintaxis.
- Además, graba a distintos ritmos y con emociones diferentes. Más matices ayudan a crear un mejor modelo.
Como siempre, evita audio de mala calidad como:
- Ruido de fondo
- Compresión agresiva
- Muletillas como “eh” o “um”
Enviar y esperar al entrenamiento
Una vez tengas el audio listo, los pasos son sencillos:
- Selecciona Professional Voice Clone
- Haz clic en Create new clone

- Sube todas las grabaciones y rellena nombre, idioma y etiquetas

- Completa los datos de consentimiento
- Envía
Antes de entrenar tu clon, ElevenLabs te hace demostrar que la voz es tuya.
Esta es la gran diferencia con IVC: la clonación profesional solo te permite clonar tu propia voz, así que no puedes clonar la de otra persona, ni siquiera con su consentimiento. Si un compañero quiere prestarla, debe crear y verificar su PVC en su propia cuenta y luego compartirla contigo con un enlace privado.
La verificación es una grabación corta en directo. Leerás unas líneas en pantalla por el micrófono. Dos puntos críticos:
- Usa el mismo equipo, o muy similar, que el de las muestras y mantén un tono y entrega parecidos. Un desajuste aquí es la causa más común de fallo.
- Lee cada línea solo una vez y pulsa Stop. Repetir líneas puede hacer que falle la verificación.
Si falla, puedes esperar 24 horas y volver a intentarlo o contactar con soporte. Aviso: cuando entras en la fase de verificación, el clon queda bloqueado. No puedes borrar un PVC no verificado por tu cuenta, así que asegúrate de que tus muestras están bien antes de llegar aquí.
¡Te avisarán cuando tu clon esté listo! Un truco útil es comparar los resultados de IVC y PVC con la misma frase. La diferencia suele ser evidente.
Usar tus voces de VoiceLab en proyectos
Una vez guardada, tu voz está disponible en toda la plataforma, allá donde ElevenLabs genera audio.
Puedes usarla en:
- Text to Speech (Speech Synthesis) para generar rápido
- Studio para proyectos largos
- Python API para uso programático
Voy a repasar cómo usar tu voz en cada una de estas herramientas. La guía para principiantes de la API de ElevenLabs es la mejor forma de empezar con la API de Python.
Usar voces personalizadas en Text to Speech y Studio
En Text to Speech solo tienes que seleccionar tu voz en Voices -> My Voices, como hemos visto arriba.
Consejos de ajuste para Text to Speech:
- Empieza con Stability al 40–50%
- Pon Similarity alrededor del 75%
- Ajusta según el resultado
Puede que necesites varios intentos hasta clavar la voz y la toma exactas, pero cuanto más experimentes, mejor entenderás el proceso de generación.
En Studio es parecido. Ve a Studio en la barra lateral y selecciona + New Blank Project. Después, elige el tipo de proyecto:
- Audio Project o
- Video Project
Un proyecto de audio te permite crear contenido conversacional de larga duración con varias voces. En un proyecto de vídeo, subes primero un vídeo y luego añades voces para el doblaje.
Navegación de proyectos de audio en Studio
El proyecto de audio de Studio te permite crear un archivo con varios locutores. Es ideal para podcasts o contenido conversacional; incluso para audiolibros con distintos personajes.
El panel de audio de Studio es un lienzo en blanco. Aquí nos centraremos en la parte de voz, pero siéntete libre de explorar.

A la izquierda verás una sección de voz ya seleccionada. Al escribir en el área de texto, se resaltará el discurso de ese personaje.

Al pasar a la siguiente línea, puedes seleccionar otra voz y crear otro personaje. Cada línea es un “párrafo”:

Los límites de Studio son amplios: cada proyecto puede tener hasta 500 capítulos, cada uno con hasta 400 párrafos. Cada párrafo admite hasta 5.000 caracteres.
El número de proyectos depende de tu plan:
- Free: 5 proyectos
- Starter: 20 proyectos
- Creator: 1.000 proyectos
Navegación de proyectos de vídeo en Studio
Sigue los mismos pasos, pero elige un proyecto de vídeo. Irás a un lienzo en blanco donde subir tu vídeo:
Una vez subido, lo verás a la izquierda y podrás previsualizarlo. Puedes añadir varios clips si lo necesitas.
Después, en la izquierda, elige Speech.

Igual que en audio, puedes elegir varias voces y escribir las frases. Al escribir, pulsa Enter para pasar a una línea nueva. Puedes asignar voces distintas por línea para simular una conversación.

Abajo puedes ajustar fácilmente los tiempos de cada línea arrastrándolas en la línea de tiempo.

Si no tienes fotos o vídeo, puedes generarlos desde la pestaña Video de la izquierda. Escribe un prompt y se generará la imagen o el vídeo que necesites.
Ten en cuenta que primero debes aceptar los términos beta de Image and Video. Además, los usuarios Free solo pueden generar imágenes; para vídeo necesitas al menos Starter (5 $/mes).

Acceder a voces personalizadas con el SDK de Python de ElevenLabs
Para usar el SDK de Python, primero debes tener Python instalado. Luego crea un entorno de Python e instala el SDK de ElevenLabs con lo siguiente: pip install "elevenlabs[pyaudio]"
Después, ve al panel de desarrolladores de ElevenLabs haciendo clic en la parte inferior de la barra lateral y selecciona API Keys -> Create Key.

Luego elige a qué herramientas dará acceso la API y pulsa Create Key.

Aparecerá tu clave de API y debes copiarla o la perderás para siempre.

Guarda la clave en un archivo .env en un lugar seguro o en la carpeta de tu proyecto.
Después, en el panel de Voices selecciona My Voices y copia el Voice ID de tu voz. Guárdalo a mano.

Ya puedes crear un script para usar tu voz de ElevenLabs. Aquí tienes un ejemplo sencillo:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Conclusión
VoiceLab ofrece tres caminos según tus necesidades. Voice Design es perfecto para experimentar, Instant Voice Cloning va genial para prototipos rápidos y Professional Voice Cloning es lo que necesitas para una calidad de producción.
Si estás empezando, te recomiendo quedarte primero con Voice Design. Sube de plan solo cuando tengas un caso de uso claro.
Si quieres profundizar en la creación de aplicaciones con IA, echa un vistazo a nuestro itinerario de aprendizaje Developing AI Applications, donde aprenderás a usar las últimas herramientas para desarrolladores de IA, como la OpenAI API, Hugging Face y LangChain.
Preguntas frecuentes sobre ElevenLabs VoiceLab
¿ElevenLabs es gratis?
Sí. El plan gratuito te da unos 10.000 créditos al mes (aprox. 10 minutos de audio), además de Voice Design y la biblioteca de voces base. Pero no se puede usar con fines comerciales y no incluye clonación de voz; para Instant Voice Cloning y una licencia comercial necesitas al menos el plan Starter.
¿Necesito un plan de pago para usar las voces de ElevenLabs con fines comerciales?
Sí. El plan gratuito exige atribución a ElevenLabs y no concede derechos comerciales, así que no puedes monetizar ese audio. La licencia comercial empieza en el plan Starter (unos 6 $/mes, o 5 $ al año), mientras que Professional Voice Cloning para voces de nivel producción requiere el plan Creator (22 $/mes) o superior.
¿Puedo clonar la voz de otra persona con ElevenLabs?
Solo con permiso explícito, y las normas cambian según el método. Instant Voice Cloning te permite clonar cualquier voz para la que estés autorizado, pero Professional Voice Cloning se limita a tu propia voz y requiere una verificación en directo (incluso con consentimiento). Usar una voz clonada para suplantación o fraude es ilegal en la mayoría de jurisdicciones.
¿Cuál es la diferencia entre Instant y Professional Voice Cloning?
Instant Voice Cloning (IVC) genera un clon utilizable en segundos con solo 1–2 minutos de audio y es ideal para prototipos, aunque puede perder matices. Professional Voice Cloning (PVC) entrena un modelo dedicado con 30 minutos a 3 horas de audio y tarda unas horas en procesarse, logrando un resultado mucho más fiel y listo para producción. Usa IVC para probar rápido y PVC cuando la calidad importe.
¿Puedo usar mi voz personalizada de ElevenLabs fuera de la plataforma?
No directamente. Los clones de voz no se pueden exportar y solo funcionan dentro de ElevenLabs. Aun así, puedes usarlos en cualquier producto de la plataforma que genere audio, incluido Text to Speech, Studio y de forma programática mediante la API de ElevenLabs y el SDK de Python, que es como la mayoría integra su voz personalizada en apps o flujos propios.
Soy un científico de datos con experiencia en análisis espacial, aprendizaje automático y canalización de datos. He trabajado con GCP, Hadoop, Hive, Snowflake, Airflow y otros procesos de ciencia/ingeniería de datos.





