Ir al contenido principal

Clonación de voz con ElevenLabs: guía práctica de VoiceLab

Aprende a clonar tu voz con Instant y Professional Voice Cloning en ElevenLabs, desde grabar audio limpio hasta generar voz con el SDK de Python.
Actualizado 3 ago 2026  · 13 min leer

Explorar con IA

Abrir en ChatGPTAbrir en ClaudeAbrir en Perplexity

Seguro que alguna vez has encontrado una gran voz de texto a voz, para darte cuenta después de que el uso completo está bloqueado en un plan más caro, no puedes ajustarla a tu marca y, desde luego, no puedes llamarla tuya. Ahí es donde mucha gente se atasca con la IA de voz. ElevenLabs VoiceLab cambia el juego.

En esta guía, voy a mostrarte las tres herramientas de ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) y Professional Voice Cloning (PVC). Iremos paso a paso para que sepas qué esperar en cada fase.

Antes de empezar, esto es lo que necesitas:

  • Una cuenta gratuita de ElevenLabs es suficiente para Voice Design
  • Plan Starter (6 $/mes) para Instant Voice Cloning
  • Plan Creator (22 $/mes) para Professional Voice Cloning

Al terminar, tendrás al menos una voz personalizada guardada en tu biblioteca, lista para usar en Speech Synthesis (Text to Speech), Studio o incluso vía API.

¿Qué es ElevenLabs VoiceLab?

A grandes rasgos, VoiceLab es la suite de ElevenLabs para crear y gestionar voces personalizadas. Es donde vas cuando buscas algo original, no una voz prefabricada.

Aquí tienes una comparación rápida de las tres herramientas de VoiceLab:

Herramienta

Qué hace

Calidad

Entrada necesaria

Tiempo de creación

Plan necesario

Mejor caso de uso

Voice Design

Genera voces sintéticas

Buena

Ninguna

Instantáneo

Gratis

Experimentación

IVC

Clona una voz a partir de audio corto

Buena

~1–5 min de audio

Instantáneo

Starter+

Prototipos

PVC

Clonación de voz de alta fidelidad

Excelente

30 min a 3+ horas

1–2 días

Creator+

Producción

Si quieres profundizar en el uso de voces de forma programática, te recomiendo nuestra guía de la API de ElevenLabs.

Trabajar con la API de OpenAI

Comienza tu viaje desarrollando aplicaciones potenciadas por IA con la API OpenAI.
Explora El Curso

VoiceLab vs. Voice Library

Es importante no confundirlo con la Voice Library.

  • Voice Library: explora y usa voces prediseñadas
  • VoiceLab: crea y gestiona tus propias voces

Cuando creas una voz en VoiceLab, puedes publicarla en la Voice Library para que otros la utilicen. Pero, por defecto, se mantiene privada en tu cuenta.

Configurar tu cuenta de ElevenLabs

Empezar es muy sencillo. 

  1. Ve a elevenlabs.io
  2. Haz clic en Sign Up
  3. Usa Google o tu email
  4. Elige tu plataforma inicial. Selecciona Eleven Creative para centrarte en las herramientas de creación de voz.

Elige entre ElevenCreative y ElevenAgents

  1. Verifica tu cuenta

Una vez dentro, ve a la sección VoiceLab:

  • Haz clic en Voices en la barra lateral izquierda.
  • Haz clic en + Create Voice

ElevenLabs VoiceLab Voices

Verás cuatro opciones:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Opciones para crear voz

Ten en cuenta que no todas estas funciones están disponibles en todos los planes. Consulta la tabla siguiente para saber qué incluye cada nivel:

Plan

Voice Design

IVC

PVC

Licencia comercial

Free

No

No

No

Starter

No

Creator

Crear una voz sintética con Voice Design

Voice Design es el punto de partida más sencillo. No necesitas grabaciones: genera una voz desde cero. Además, es la única opción disponible en el plan gratuito, perfecta para empezar.

El flujo es simple:

  1. Escribe un prompt con algunos ajustes clave
  2. Genera
  3. Previsualiza
  4. Guarda

Un consejo práctico: genera al menos entre 5 y 10 variaciones antes de elegir. Incluso con la misma configuración, los resultados pueden variar bastante. Para empezar, haz clic en el botón Voice Design del menú Create Voice. Se abrirá una ventana para que escribas el prompt de tu voz.

Prompt de Voice Design

Puedes tocar Settings para ajustar dos parámetros:

  • Loudness: volumen de la voz generada.
  • Guidance level: parecido a la temperatura en otros modelos; indica cuánto debe ceñirse la IA a tu prompt. Un guidance alto sigue más estrictamente lo que pides; uno bajo le da más libertad.

Ajustar volumen y guidance

Puedes dejar que el agente de IA use su propio texto de vista previa o proporcionar tu propio guion desactivando el ajuste y pegando tu texto en el cuadro de preview.

Texto de vista previa

Definir parámetros en el prompt

Usa el área de prompt para configurar tu voz. Prueba con esta plantilla para centrarte en parámetros clave:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Cada parámetro influye en el resultado:

  • VoiceLabs es multilingüe, así que el idioma determina la tonalidad
  • El acento cambia los patrones de pronunciación
  • La edad afecta al tono y la altura
  • El género influye en el rango vocal
  • El nivel de calidad determina lo limpio que suena el audio

Lo interesante es cómo se combinan. A veces, las mezclas menos obvias dan los mejores resultados, así que merece la pena probar.

Generar, previsualizar y guardar

Haz clic en Generate voice y ElevenLabs creará una muestra corta.

Voces generadas de ejemplo

Puedes regenerar tantas veces como quieras. Cada versión será ligeramente distinta.

Cuando encuentres una que te guste:

  • Haz clic en Save

  • Usa un nombre descriptivo como narrator_us_male_30s

Tras guardarla, la voz aparecerá en My Voices y en el desplegable de Speech Synthesis.

Clonar una voz con Instant Voice Cloning (IVC)

Instant Voice Cloning te permite replicar una voz usando solo una muestra breve de audio. Es rápido y sorprendentemente eficaz, aunque no perfecto. Recuerda que necesitas el plan Starter (6 $/mes) o superior.

Aviso importante: clona solo voces para las que tengas permiso. La plataforma te pedirá confirmación y debes tomártelo en serio. El proceso es simple:

  • Prepara tu audio
  • Sube el audio
  • Pon nombre y guarda tu clon de voz
  • Prueba en Text to Speech

Preparar tu muestra de audio

El audio debe tener la longitud, el formato y la calidad adecuados. El mínimo es alrededor de un minuto, pero 3 a 5 minutos suelen dar mejores resultados.

Sube archivos MP3 o WAV de menos de 50 MB, y puedes cargar varios a la vez. 

Para un mejor clonado y buena calidad, te recomiendo grabar así:

  • Habitación silenciosa
  • Sin ruido de fondo
  • Distancia al micrófono constante

Evita lo siguiente:

  • Varios interlocutores
  • Grabaciones con móvil
  • Postprocesado agresivo

Subir y crear el clon

Vuelve al panel de Voices y haz lo siguiente:

  1. Haz clic en + Create Voice
  2. Selecciona Instant Voice Cloning
  3. Sube tu audio y pulsa Next

Instant Voice Clone

  1. Pon nombre a tu voz; opcionalmente añade etiquetas y una descripción
  2. Confirma el consentimiento
  3. Haz clic en Save Voice

Las etiquetas disponibles en el desplegable son:

  • Language
  • Accent (muestra opciones según el idioma)
  • Gender
  • Age (opciones: young, middle-aged u old)

La voz estará lista al instante y podrás probarla en el generador de texto a voz. Prueba varias frases y fíjate dónde suena natural y dónde flojea.

Para ello, haz clic en Text to Speech en la barra lateral izquierda. (En algunas versiones aparece como Speech Synthesis).

Text to Speec

Se abrirá una ventana con un campo de texto similar. 

Ventana de Text to Speech

A la derecha, abre el desplegable Voice y elige tu voz en My Voices.

Selección de voz

Escribe una frase de prueba y haz clic en Generate speech.

Generar voz

Esto generará un audio con la voz elegida. Ajusta los parámetros de la derecha a tu gusto. Puedes modificar, por ejemplo:

  • Speed
  • Stability
  • Similarity
  • Style Exaggeration 

Cambiar de modelo también puede abrir más opciones.

Ajustar voz generada

Para guardar el archivo, haz clic en el botón de descarga de la derecha y guarda el audio generado.

Guardar voz generada

Crear un clon de alta fidelidad con Professional Voice Cloning (PVC)

Si IVC te da una aproximación, PVC te acerca mucho más al original. Aquí se capturan matices como el ritmo, la respiración y la emoción.

Requiere el plan Creator (22 $/mes). Según ElevenLabs, el procesamiento suele tardar entre 2 y 6 horas, aunque el entrenamiento total puede llegar a 24 horas según la carga de servidores. 

Es la opción más adecuada para crear voces de nivel producción: narraciones, audiolibros o asistentes de voz de marca. Cosas con uso comercial o a gran escala.

Grabar y seleccionar tus datos de entrenamiento

Como buscamos el mejor modelo posible, suben los requisitos. El mínimo son 30 minutos de audio limpio, pero para resultados óptimos apunta a 3+ horas. Lo ideal es dividir el audio en bloques de 30 minutos.

Algunos consejos para aprovechar la grabación:

  • Graba en un entorno silencioso
  • Usa un micrófono de calidad
  • Incluye contenido variado; no leas solo de una misma fuente

Por ejemplo, puedes variar tu estilo de narración:

  • Incluye distintos tipos de diálogo. Lee algunos textos instructivos. 
  • Recita números y listas. Aporta variedad de pronunciación y sintaxis. 
  • Además, graba a distintos ritmos y con emociones diferentes. Más matices ayudan a crear un mejor modelo.

Como siempre, evita audio de mala calidad como:

  • Ruido de fondo
  • Compresión agresiva
  • Muletillas como “eh” o “um”

Enviar y esperar al entrenamiento

Una vez tengas el audio listo, los pasos son sencillos:

  1. Selecciona Professional Voice Clone
  2. Haz clic en Create new clone

Crear un clon de voz profesional

  1. Sube todas las grabaciones y rellena nombre, idioma y etiquetas

Detalles de PVC

  1. Completa los datos de consentimiento
  2. Envía

Antes de entrenar tu clon, ElevenLabs te hace demostrar que la voz es tuya.

Esta es la gran diferencia con IVC: la clonación profesional solo te permite clonar tu propia voz, así que no puedes clonar la de otra persona, ni siquiera con su consentimiento. Si un compañero quiere prestarla, debe crear y verificar su PVC en su propia cuenta y luego compartirla contigo con un enlace privado.

La verificación es una grabación corta en directo. Leerás unas líneas en pantalla por el micrófono. Dos puntos críticos:

  • Usa el mismo equipo, o muy similar, que el de las muestras y mantén un tono y entrega parecidos. Un desajuste aquí es la causa más común de fallo.
  • Lee cada línea solo una vez y pulsa Stop. Repetir líneas puede hacer que falle la verificación.

Si falla, puedes esperar 24 horas y volver a intentarlo o contactar con soporte. Aviso: cuando entras en la fase de verificación, el clon queda bloqueado. No puedes borrar un PVC no verificado por tu cuenta, así que asegúrate de que tus muestras están bien antes de llegar aquí.

¡Te avisarán cuando tu clon esté listo! Un truco útil es comparar los resultados de IVC y PVC con la misma frase. La diferencia suele ser evidente.

Usar tus voces de VoiceLab en proyectos

Una vez guardada, tu voz está disponible en toda la plataforma, allá donde ElevenLabs genera audio.

Puedes usarla en:

  • Text to Speech (Speech Synthesis) para generar rápido
  • Studio para proyectos largos
  • Python API para uso programático

Voy a repasar cómo usar tu voz en cada una de estas herramientas. La guía para principiantes de la API de ElevenLabs es la mejor forma de empezar con la API de Python.

Usar voces personalizadas en Text to Speech y Studio

En Text to Speech solo tienes que seleccionar tu voz en Voices -> My Voices, como hemos visto arriba.

Consejos de ajuste para Text to Speech:

  • Empieza con Stability al 40–50%
  • Pon Similarity alrededor del 75%
  • Ajusta según el resultado

Puede que necesites varios intentos hasta clavar la voz y la toma exactas, pero cuanto más experimentes, mejor entenderás el proceso de generación.

En Studio es parecido. Ve a Studio en la barra lateral y selecciona + New Blank Project. Después, elige el tipo de proyecto:

  • Audio Project o
  • Video Project

Un proyecto de audio te permite crear contenido conversacional de larga duración con varias voces. En un proyecto de vídeo, subes primero un vídeo y luego añades voces para el doblaje.

El proyecto de audio de Studio te permite crear un archivo con varios locutores. Es ideal para podcasts o contenido conversacional; incluso para audiolibros con distintos personajes. 

El panel de audio de Studio es un lienzo en blanco. Aquí nos centraremos en la parte de voz, pero siéntete libre de explorar.

Proyecto de audio en Studio

A la izquierda verás una sección de voz ya seleccionada. Al escribir en el área de texto, se resaltará el discurso de ese personaje.

Crear nuevo párrafo

Al pasar a la siguiente línea, puedes seleccionar otra voz y crear otro personaje. Cada línea es un “párrafo”:

Seleccionar voz para un párrafo

Los límites de Studio son amplios: cada proyecto puede tener hasta 500 capítulos, cada uno con hasta 400 párrafos. Cada párrafo admite hasta 5.000 caracteres.

El número de proyectos depende de tu plan:

  • Free: 5 proyectos
  • Starter: 20 proyectos
  • Creator: 1.000 proyectos

Sigue los mismos pasos, pero elige un proyecto de vídeo. Irás a un lienzo en blanco donde subir tu vídeo:Proyecto de vídeo en Studio

Una vez subido, lo verás a la izquierda y podrás previsualizarlo. Puedes añadir varios clips si lo necesitas.

Después, en la izquierda, elige Speech.

Archivos del proyecto de vídeo

Igual que en audio, puedes elegir varias voces y escribir las frases. Al escribir, pulsa Enter para pasar a una línea nueva. Puedes asignar voces distintas por línea para simular una conversación.

Añadir voz a un vídeo

Abajo puedes ajustar fácilmente los tiempos de cada línea arrastrándolas en la línea de tiempo.

Edición de vídeo con voz generada

Si no tienes fotos o vídeo, puedes generarlos desde la pestaña Video de la izquierda. Escribe un prompt y se generará la imagen o el vídeo que necesites. 

Ten en cuenta que primero debes aceptar los términos beta de Image and Video. Además, los usuarios Free solo pueden generar imágenes; para vídeo necesitas al menos Starter (5 $/mes).

Generar vídeo

Acceder a voces personalizadas con el SDK de Python de ElevenLabs

Para usar el SDK de Python, primero debes tener Python instalado. Luego crea un entorno de Python e instala el SDK de ElevenLabs con lo siguiente: pip install "elevenlabs[pyaudio]"

Después, ve al panel de desarrolladores de ElevenLabs haciendo clic en la parte inferior de la barra lateral y selecciona API Keys -> Create Key.

Consola de desarrollador de ElevenLabs

Luego elige a qué herramientas dará acceso la API y pulsa Create Key.

Crear clave de API

Aparecerá tu clave de API y debes copiarla o la perderás para siempre.

Clave de API creada

Guarda la clave en un archivo .env en un lugar seguro o en la carpeta de tu proyecto.

Después, en el panel de Voices selecciona My Voices y copia el Voice ID de tu voz. Guárdalo a mano.

Copiar Voice ID

Ya puedes crear un script para usar tu voz de ElevenLabs. Aquí tienes un ejemplo sencillo:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Conclusión

VoiceLab ofrece tres caminos según tus necesidades. Voice Design es perfecto para experimentar, Instant Voice Cloning va genial para prototipos rápidos y Professional Voice Cloning es lo que necesitas para una calidad de producción.

Si estás empezando, te recomiendo quedarte primero con Voice Design. Sube de plan solo cuando tengas un caso de uso claro.

Si quieres profundizar en la creación de aplicaciones con IA, echa un vistazo a nuestro itinerario de aprendizaje Developing AI Applications, donde aprenderás a usar las últimas herramientas para desarrolladores de IA, como la OpenAI API, Hugging Face y LangChain.

Preguntas frecuentes sobre ElevenLabs VoiceLab

¿ElevenLabs es gratis?

Sí. El plan gratuito te da unos 10.000 créditos al mes (aprox. 10 minutos de audio), además de Voice Design y la biblioteca de voces base. Pero no se puede usar con fines comerciales y no incluye clonación de voz; para Instant Voice Cloning y una licencia comercial necesitas al menos el plan Starter.

¿Necesito un plan de pago para usar las voces de ElevenLabs con fines comerciales?

Sí. El plan gratuito exige atribución a ElevenLabs y no concede derechos comerciales, así que no puedes monetizar ese audio. La licencia comercial empieza en el plan Starter (unos 6 $/mes, o 5 $ al año), mientras que Professional Voice Cloning para voces de nivel producción requiere el plan Creator (22 $/mes) o superior.

¿Puedo clonar la voz de otra persona con ElevenLabs?

Solo con permiso explícito, y las normas cambian según el método. Instant Voice Cloning te permite clonar cualquier voz para la que estés autorizado, pero Professional Voice Cloning se limita a tu propia voz y requiere una verificación en directo (incluso con consentimiento). Usar una voz clonada para suplantación o fraude es ilegal en la mayoría de jurisdicciones.

¿Cuál es la diferencia entre Instant y Professional Voice Cloning?

Instant Voice Cloning (IVC) genera un clon utilizable en segundos con solo 1–2 minutos de audio y es ideal para prototipos, aunque puede perder matices. Professional Voice Cloning (PVC) entrena un modelo dedicado con 30 minutos a 3 horas de audio y tarda unas horas en procesarse, logrando un resultado mucho más fiel y listo para producción. Usa IVC para probar rápido y PVC cuando la calidad importe.

¿Puedo usar mi voz personalizada de ElevenLabs fuera de la plataforma?

No directamente. Los clones de voz no se pueden exportar y solo funcionan dentro de ElevenLabs. Aun así, puedes usarlos en cualquier producto de la plataforma que genere audio, incluido Text to Speech, Studio y de forma programática mediante la API de ElevenLabs y el SDK de Python, que es como la mayoría integra su voz personalizada en apps o flujos propios.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Soy un científico de datos con experiencia en análisis espacial, aprendizaje automático y canalización de datos. He trabajado con GCP, Hadoop, Hive, Snowflake, Airflow y otros procesos de ciencia/ingeniería de datos.

Temas

¡Aprende IA con DataCamp!

programa

Desarrollo de aplicaciones de IA

21 h
Aprende a crear aplicaciones potenciadas por IA con las últimas herramientas para desarrolladores de IA, como la API OpenAI, Hugging Face y LangChain.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado
An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Cómo aprender PNL desde cero en 2026: Una guía experta

En esta guía, descubrirás cómo aprender el procesamiento del lenguaje natural (NLP) desde cero. Con un plan de aprendizaje claro y semanal, explorarás conceptos esenciales de la PNL, aplicaciones prácticas y proyectos prácticos para desarrollar tus habilidades.
Laiba Siddiqui's photo

Laiba Siddiqui

13 min

An AI transcribes audio to text

Tutorial

Convertir voz en texto con la API Whisper de OpenAI

Descubra las potentes funciones de la API Python de OpenAI Whisper para transcripción y traducción. Dispone de soporte multilingüe y mejora rápida para una transcripción precisa.
Abid Ali Awan's photo

Abid Ali Awan

Tutorial

Cómo utilizar la API de conversión de texto a voz de OpenAI

La API TTS de OpenAI es un punto final que permite a los usuarios interactuar con su modelo de inteligencia artificial TTS, que convierte el texto en lenguaje hablado con sonido natural.
Kurtis Pykes 's photo

Kurtis Pykes

Tutorial

Ajuste fino de LLaMA 2: Guía paso a paso para personalizar el modelo de lenguaje grande

Aprende a ajustar Llama-2 en Colab utilizando nuevas técnicas para superar las limitaciones de memoria y computación y hacer más accesibles los grandes modelos lingüísticos de código abierto.
Abid Ali Awan's photo

Abid Ali Awan

Tutorial

Guía para principiantes de la API de OpenAI: Tutorial práctico y prácticas recomendadas

Este tutorial te presenta la API de OpenAI, sus casos de uso, un enfoque práctico para utilizar la API y todas las prácticas recomendadas que debes seguir.
Arunn Thevapalan's photo

Arunn Thevapalan

Ver MásVer Más