Cursus
Vous avez sans doute déjà trouvé une excellente voix de synthèse, avant de découvrir que l’usage complet était réservé à une formule plus chère, qu’elle ne correspondait pas à votre identité de marque et qu’il était impossible de vous l’approprier. C’est souvent là que l’on bute avec l’IA vocale. Avec ElevenLabs VoiceLab, tout change.
Dans ce guide, je vous présente les trois outils de VoiceLab : Voice Design, Instant Voice Cloning (IVC) et Professional Voice Cloning (PVC). Nous avancerons pas à pas, avec un aperçu précis de ce qui vous attend à chaque étape.
Avant de commencer, voici ce qu’il vous faut :
- Un compte ElevenLabs gratuit suffit pour Voice Design
- Le plan Starter (6 $ / mois) est requis pour l’Instant Voice Cloning
- Le plan Creator (22 $ / mois) est requis pour le Professional Voice Cloning
À la fin, vous aurez au moins une voix personnalisée enregistrée dans votre bibliothèque, prête à être utilisée dans Speech Synthesis (Text to Speech), Studio ou même via l’API.
Qu’est-ce que ElevenLabs VoiceLab ?
En bref, VoiceLab est la suite d’outils d’ElevenLabs dédiée à la création et à la gestion de voix personnalisées. C’est l’endroit où aller quand vous voulez du sur‑mesure, pas juste une voix préconfigurée.
Voici une comparaison rapide des trois outils VoiceLab :
|
Outil |
Fonction |
Qualité |
Entrée requise |
Délai de création |
Abonnement requis |
Meilleur cas d’usage |
|
Voice Design |
Génère des voix synthétiques |
Bonne |
Aucune |
Instantané |
Gratuit |
Expérimentation |
|
IVC |
Clone une voix à partir d’un court audio |
Bonne |
~1–5 min d’audio |
Instantané |
Starter+ |
Prototypes |
|
PVC |
Clonage de voix haute fidélité |
Excellente |
30 min à 3 h+ |
1–2 jours |
Creator+ |
Production |
Si vous souhaitez aller plus loin dans l’utilisation programmatique des voix, consultez notre guide de l’API ElevenLabs.
Travailler avec l'API OpenAI
VoiceLab vs Voice Library
Ne confondez pas VoiceLab avec la Voice Library.
- Voice Library : parcourir et utiliser des voix prêtes à l’emploi
- VoiceLab : créer et gérer vos propres voix
Une fois votre voix créée dans VoiceLab, vous pouvez, si vous le souhaitez, la publier dans la Voice Library pour que d’autres l’utilisent. Par défaut, elle reste privée dans votre compte.
Configurer votre compte ElevenLabs
La prise en main est simple.
- Allez sur elevenlabs.io
- Cliquez sur Sign Up
- Inscrivez-vous avec Google ou votre e‑mail
- Choisissez votre espace initial. Sélectionnez Eleven Creative pour vous concentrer sur les outils de création de voix.

- Vérifiez votre compte
Une fois connecté, accédez à la zone VoiceLab :
- Cliquez sur Voices dans la barre latérale gauche.
- Cliquez sur + Create Voice

Vous verrez quatre options :
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Notez que toutes ces fonctionnalités ne sont pas disponibles pour tous les abonnements. Consultez le tableau ci‑dessous pour connaître ce qui est inclus à chaque niveau :
|
Formule |
Voice Design |
IVC |
PVC |
Licence commerciale |
|
Free |
Oui |
Non |
Non |
Non |
|
Starter |
Oui |
Oui |
Non |
Oui |
|
Creator |
Oui |
Oui |
Oui |
Oui |
Créer une voix synthétique avec Voice Design
Voice Design est le meilleur point de départ. Aucun enregistrement n’est nécessaire : la voix est générée de zéro. C’est aussi la seule option disponible avec le plan gratuit, idéale pour débuter.
Le déroulé est simple :
- Rédiger un prompt avec quelques réglages clés
- Générer
- Préécouter
- Enregistrer
Conseil d’expérience : générez au moins 5 à 10 variantes avant de choisir. Même avec les mêmes réglages, les résultats peuvent beaucoup varier. Pour commencer, cliquez sur le bouton Voice Design dans le menu Create Voice. Une fenêtre s’ouvre pour saisir le prompt décrivant votre voix.

Vous pouvez ouvrir Settings pour ajuster deux paramètres :
- Loudness : le niveau sonore de la voix générée.
- Guidance level : proche de la « température » dans d’autres modèles, il indique à quel point l’IA doit suivre votre prompt. Plus la guidance est élevée, plus elle colle à votre description ; plus elle est basse, plus elle a de liberté.

Vous pouvez laisser l’agent IA utiliser son propre texte de préécoute, ou fournir votre script en désactivant le réglage et en collant votre texte dans la zone prévue.

Paramétrer le prompt de voix
Utilisez la zone de prompt pour définir vos configurations. Essayez ce modèle afin de cibler des paramètres précis :
Locuteur natif <Langue>. <Accent>, <Genre>, <Tranche d'âge>, <Niveau de qualité>.
Persona : <2–5 mots>. Émotion : <2–3 adjectifs>.
<1–2 phrases sur le timbre, le débit, l'interprétation>
Chaque paramètre influe sur le rendu :
- VoiceLab est multilingue : la langue détermine la tonalité et la prosodie
- L’accent modifie les schémas de prononciation
- L’âge influence la hauteur et le timbre
- Le genre influe sur l’étendue vocale
- Le niveau de qualité conditionne la propreté du son
L’intérêt vient de leurs combinaisons. Des mélanges inattendus donnent parfois les meilleurs résultats : n’hésitez pas à expérimenter.
Générer, préécouter et enregistrer
Cliquez sur Generate voice : ElevenLabs produit un court échantillon.

Vous pouvez régénérer autant de fois que nécessaire. Chaque version sera légèrement différente.
Une fois votre préférée trouvée :
-
Cliquez sur Save
-
Donnez un nom explicite, par exemple
narrator_us_male_30s
Après enregistrement, la voix apparaît dans My Voices et dans la liste déroulante de Speech Synthesis.
Cloner une voix avec Instant Voice Cloning (IVC)
Instant Voice Cloning vous permet de reproduire une voix à partir d’un court extrait audio. C’est rapide et étonnamment efficace, même si perfectible. Rappel : il faut au minimum le plan Starter (6 $ / mois).
Point crucial : ne clonez que des voix pour lesquelles vous avez l’autorisation. La plateforme vous le fait confirmer, et il faut le prendre au sérieux. Le processus est simple :
- Préparer votre audio
- Téléverser l’audio
- Nommer et enregistrer votre clone
- Tester dans Text to Speech
Préparer votre échantillon audio
Votre audio doit avoir la bonne durée, le bon format et une qualité correcte. La durée minimale est d’environ 1 minute, mais 3 à 5 minutes donnent des résultats nettement meilleurs.
Chargez des fichiers MP3 ou WAV de moins de 50 Mo ; vous pouvez en téléverser plusieurs à la fois.
Pour un clonage optimal et un audio propre, je recommande :
- Pièce calme
- Absence de bruit de fond
- Distance micro constante
À éviter absolument :
- Plusieurs intervenants
- Enregistrements au téléphone
- Post‑traitement lourd
Téléverser et créer le clone
Revenez au tableau de bord Voices et procédez ainsi :
- Cliquez sur + Create Voice
- Sélectionnez Instant Voice Cloning
- Téléversez votre audio et cliquez sur Next

- Nommez votre voix, ajoutez éventuellement des labels et une description
- Confirmez le consentement
- Cliquez sur Save Voice
Les labels suivants sont disponibles dans une liste déroulante :
- Language
- Accent (options selon la langue)
- Gender
- Age (options : young, middle‑aged, old)
La voix est prête immédiatement et vous pouvez la tester aussitôt dans le générateur Text‑to‑Speech. Essayez plusieurs phrases et repérez ce qui sonne naturel et ce qui pèche.
Pour cela, cliquez sur Text to Speech dans la barre latérale gauche. (Dans certaines versions, l’outil est nommé Speech Synthesis.)

Une fenêtre similaire de saisie de texte s’ouvre.

À droite, ouvrez le menu Voice et sélectionnez votre voix dans My Voices.

Saisissez une phrase de test et cliquez sur Generate speech.

Un échantillon audio est généré avec la voix choisie. Ajustez les réglages à droite selon vos préférences. Vous pouvez notamment agir sur :
- Speed
- Stability
- Similarity
- Style Exaggeration
Le choix d’un autre modèle peut aussi débloquer des options différentes !

Pour sauvegarder le fichier, cliquez sur le bouton de téléchargement à droite pour enregistrer l’audio généré.

Créer un clone haute fidélité avec Professional Voice Cloning (PVC)
Si l’IVC offre une approximation, le PVC se rapproche bien davantage de l’original. C’est là que vous capturez les nuances : rythme, respiration, émotion.
Il nécessite le plan Creator (22 $ / mois). Selon ElevenLabs, le traitement prend généralement 2 à 6 heures, avec un entraînement total pouvant aller jusqu’à 24 heures selon la charge serveur.
C’est l’option à privilégier pour créer des actifs vocaux de niveau production : narration, livres audio, agents vocaux de marque… bref, des usages commerciaux ou à grande échelle.
Enregistrer et sélectionner vos données d’entraînement
Comme nous visons le meilleur modèle possible, les exigences montent. Par exemple, la durée minimale est de 30 minutes d’audio propre, mais pour un résultat optimal, visez 3 heures ou plus. L’idéal est de soumettre des segments de 30 minutes.
Quelques conseils pour optimiser vos enregistrements :
- Un environnement silencieux
- Un bon microphone
- Des contenus variés : ne lisez pas un seul document en continu
Par exemple, variez votre style de narration :
- Alternez dialogues et textes didactiques.
- Lisez des chiffres et des listes : cela enrichit la variété de prononciation et de syntaxe.
- Enregistrez à différents rythmes, avec diverses émotions : plus de style aide le modèle à mieux apprendre.
Comme toujours, évitez la mauvaise qualité audio :
- Bruit de fond
- Compression excessive
- Tics de langage comme « euh », « hum »
Soumettre et attendre l’entraînement
Une fois vos audios prêts, la suite est très simple :
- Sélectionnez Professional Voice Clone
- Cliquez sur Create new clone

- Téléversez tous les enregistrements, renseignez le nom, la langue et les autres labels

- Renseignez les informations de consentement
- Soumettez
Avant d’entraîner votre clone, ElevenLabs vous demande de prouver que la voix est bien la vôtre.
Grosse différence avec l’IVC : le clonage professionnel n’autorise que le clonage de votre propre voix. Vous ne pouvez pas cloner celle de quelqu’un d’autre, même avec consentement. Si un collègue veut prêter sa voix, il doit créer et vérifier le PVC sur son propre compte, puis vous le partager via un lien privé.
La vérification consiste en un court enregistrement en direct : vous lisez quelques lignes affichées à l’écran. Deux points sont déterminants :
- Utilisez le même matériel (ou très proche) que pour vos échantillons et gardez un ton et une diction similaires. Un écart ici est la cause d’échec la plus fréquente.
- Lisez chaque ligne une seule fois, puis arrêtez l’enregistrement. Relire la ligne peut faire échouer la vérification.
En cas d’échec, attendez 24 heures pour retenter, ou contactez le support. Attention : une fois à l’étape de vérification, le clone est verrouillé. Vous ne pouvez pas supprimer vous‑même un PVC non vérifié ; assurez‑vous donc que vos échantillons soient corrects avant d’y arriver.
Vous serez averti lorsque votre clone est prêt ! Un bon test consiste à comparer les sorties IVC et PVC sur la même phrase : la différence saute généralement aux oreilles.
Utiliser vos voix VoiceLab dans des projets
Une fois enregistrée, votre voix est disponible partout où ElevenLabs génère de l’audio.
Vous pouvez l’utiliser dans :
- Text to Speech (Speech Synthesis) pour des générations rapides
- Studio pour des projets au long cours
- Python API pour un usage programmatique
Je vais passer en revue comment exploiter votre voix dans chacun de ces outils. Le Beginner’s Guide to the ElevenLabs API est la meilleure porte d’entrée pour le SDK Python.
Utiliser des voix personnalisées dans Text to Speech et Studio
Dans Text to Speech, sélectionnez simplement votre voix via Voices -> My Voices, comme indiqué plus haut.
Quelques réglages de départ pour Text to Speech :
- Commencez avec Stability entre 40 % et 50 %
- Réglez Similarity autour de 75 %
- Ajustez selon le rendu
Il faudra parfois plusieurs essais pour obtenir exactement la voix et la prise souhaitées, mais plus vous expérimentez, mieux vous comprendrez le processus de synthèse vocale.
Dans Studio, c’est similaire. Allez dans Studio dans la barre latérale, puis sélectionnez + New Blank Project. Choisissez ensuite le type de projet :
- Audio Project ou
- Video Project
Un projet audio permet de créer du contenu conversationnel long avec plusieurs voix. Un projet vidéo nécessite d’abord de téléverser une vidéo, sur laquelle vous ajouterez ensuite une voix off.
Navigation d’un projet audio dans Studio
Le projet audio de Studio permet de créer un fichier multi‑intervenants. Parfait pour des podcasts, des dialogues, voire des livres audio avec des personnages distincts.
Le tableau de bord audio est une page blanche. Nous allons nous concentrer sur la partie voix, mais n’hésitez pas à explorer.

À gauche, une section voix est présélectionnée. À mesure que vous saisissez le texte, la réplique du personnage correspondant est surlignée.

À la ligne suivante, vous pouvez sélectionner une autre voix et incarner un autre personnage. Chacune de ces lignes correspond à un « paragraphe » :

Les limites de Studio sont élevées : jusqu’à 500 chapitres par projet, chacun contenant jusqu’à 400 paragraphes, et 5 000 caractères par paragraphe.
Le nombre de projets dépend de votre formule :
- Free : 5 projets
- Starter : 20 projets
- Creator : 1 000 projets
Navigation d’un projet vidéo dans Studio
Reprenez les mêmes étapes, mais choisissez un projet vidéo. Vous arrivez sur un canevas vierge pour téléverser une vidéo :
Après téléversement, la vidéo apparaît à gauche ; cliquez sur lecture pour prévisualiser. Vous pouvez ajouter plusieurs vidéos si besoin.
Ensuite, dans le menu de gauche, choisissez Speech.

Comme pour un projet audio, vous pouvez choisir plusieurs voix et saisir les répliques ligne par ligne. Appuyez sur Entrée pour créer une nouvelle ligne, et attribuez des voix différentes pour composer un dialogue.

En bas, ajustez facilement le minutage de chaque réplique par glisser‑déposer sur la timeline.

Si vous n’avez ni photos ni vidéos, vous pouvez en générer via l’onglet Video à gauche : saisissez un prompt et générez l’image ou la vidéo souhaitée.
Notez que vous devez d’abord accepter les conditions bêta Image et Vidéo. De plus, les membres gratuits ne peuvent générer que des images ; il faut au minimum le plan Starter (5 $ / mois) pour générer de la vidéo.

Accéder à vos voix personnalisées via le SDK Python ElevenLabs
Pour utiliser le SDK Python, vous devez d’abord installer Python. Créez ensuite un environnement Python et installez le SDK ElevenLabs avec : pip install "elevenlabs[pyaudio]"
Ensuite, ouvrez le tableau de bord développeur ElevenLabs en bas de la barre latérale gauche et sélectionnez API Keys -> Create Key.

Choisissez ensuite les outils à autoriser via l’API et cliquez sur Create Key.

Une clé API s’affiche : copiez‑la immédiatement, sinon elle sera perdue définitivement.

Enregistrez ensuite la clé API dans un fichier .env en lieu sûr ou dans le dossier de votre projet.
Puis, dans le tableau de bord Voices, ouvrez My Voices et copiez l’identifiant (Voice ID) de votre voix. Conservez‑le quelque part d’accessible.

Vous pouvez maintenant écrire un script pour faire parler votre voix ElevenLabs ! Voici un exemple simple :
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Conclusion
VoiceLab propose trois approches selon vos besoins. Voice Design est idéal pour expérimenter, Instant Voice Cloning pour des prototypes rapides, et Professional Voice Cloning pour une qualité digne de la production.
Si vous débutez, commencez par Voice Design. N’upgradez que lorsque votre cas d’usage est clair.
Si vous souhaitez aller plus loin dans la création d’applications dopées à l’IA, découvrez notre parcours de compétences Developing AI Applications, qui vous apprend à utiliser les tout derniers outils pour développeurs IA, dont l’OpenAI API, Hugging Face et LangChain.
FAQ sur ElevenLabs VoiceLab
ElevenLabs est‑il gratuit ?
Oui. Le plan gratuit vous accorde environ 10 000 crédits par mois (soit environ 10 minutes d’audio), ainsi que Voice Design et la bibliothèque de voix de base. En revanche, il n’autorise pas l’usage commercial et n’inclut pas le clonage de voix ; vous aurez besoin au minimum du plan Starter pour l’Instant Voice Cloning et d’une licence commerciale.
Ai‑je besoin d’un abonnement payant pour un usage commercial des voix ElevenLabs ?
Oui. Le plan gratuit impose l’attribution ElevenLabs et ne confère aucun droit commercial ; vous ne pouvez donc pas monétiser cet audio. Une licence commerciale est incluse à partir du plan Starter (environ 6 $ / mois, ou 5 $ facturés annuellement), tandis que le Professional Voice Cloning pour des voix de niveau production nécessite le plan Creator (22 $ / mois) ou plus.
Puis‑je cloner la voix de quelqu’un d’autre avec ElevenLabs ?
Uniquement avec permission explicite, et les règles varient selon la méthode. L’Instant Voice Cloning permet de cloner toute voix que vous êtes autorisé à utiliser, mais le Professional Voice Cloning est limité à votre propre voix et exige un enregistrement de vérification en direct (même avec consentement). L’usage d’une voix clonée pour de l’usurpation d’identité ou de la fraude est illégal dans la plupart des juridictions.
Quelle est la différence entre Instant et Professional Voice Cloning ?
L’Instant Voice Cloning (IVC) produit en quelques secondes un clone exploitable à partir de 1–2 minutes d’audio et convient aux prototypes, même s’il peut manquer de subtilités. Le Professional Voice Cloning (PVC) entraîne un modèle dédié sur 30 minutes à 3 heures d’audio et nécessite quelques heures de traitement pour un résultat bien plus fidèle, prêt pour la production. Utilisez IVC pour tester vite, et PVC quand la qualité prime.
Puis‑je utiliser ma voix ElevenLabs personnalisée en dehors de la plateforme ?
Pas directement. Les clones de voix ne peuvent pas être exportés et ne fonctionnent qu’au sein d’ElevenLabs. Vous pouvez toutefois les utiliser partout où la plateforme génère de l’audio, y compris dans Text to Speech, Studio, et de façon programmatique via l’API ElevenLabs et le SDK Python — la méthode la plus courante pour intégrer une voix personnalisée à vos applications ou pipelines.
Je suis un data scientist avec de l'expérience dans l'analyse spatiale, l'apprentissage automatique et les pipelines de données. J'ai travaillé avec GCP, Hadoop, Hive, Snowflake, Airflow et d'autres processus d'ingénierie et de science des données.

