track
Probabil ai găsit deja o voce text-to-speech excelentă, ca să descoperi apoi că folosirea completă e blocată în spatele unui abonament mai scump, nu o poți face să sune ca brandul tău și sigur nu o poți numi a ta. Acolo se împiedică, de obicei, majoritatea oamenilor cu AI-ul de voce. ElevenLabs VoiceLab este locul unde asta se schimbă.
În acest ghid, te voi conduce prin toate cele trei instrumente din ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) și Professional Voice Cloning (PVC). Vom parcurge pașii pe rând și îți voi arăta exact la ce să te aștepți în fiecare etapă.
Înainte să începem, iată de ce ai nevoie:
- Un cont ElevenLabs gratuit este suficient pentru Voice Design
- Planul Starter (6 $/lună) este necesar pentru Instant Voice Cloning
- Planul Creator (22 $/lună) este necesar pentru Professional Voice Cloning
La final, vei avea cel puțin o voce personalizată salvată în bibliotecă, gata de folosit în Speech Synthesis (Text to Speech), Studio sau chiar prin API.
Ce este ElevenLabs VoiceLab?
La modul general, VoiceLab este suita dedicată ElevenLabs pentru crearea și gestionarea vocilor personalizate. Aici vii când vrei ceva original, nu doar ceva predefinit.
Iată o comparație rapidă a celor trei instrumente VoiceLab:
|
Instrument |
Ce face |
Calitate |
Input necesar |
Timp de creare |
Plan necesar |
Caz de utilizare optim |
|
Voice Design |
Generează voci sintetice |
Bună |
Niciunul |
Instant |
Gratuit |
Experimentare |
|
IVC |
Clonează vocea din audio scurt |
Bună |
~1–5 min audio |
Instant |
Starter+ |
Protoptipuri |
|
PVC |
Clonare de voce cu fidelitate ridicată |
Excelentă |
30 min până la 3+ ore |
1–2 zile |
Creator+ |
Producție |
Dacă vrei să aprofundezi folosirea vocilor programatic, îți recomand ghidul nostru pentru ElevenLabs API.
VoiceLab vs. Biblioteca de Voci
E important să nu le confunzi cu Biblioteca de Voci.
- Biblioteca de Voci: Caută și folosește voci predefinite
- VoiceLab: Creează și gestionează propriile tale voci
După ce creezi o voce în VoiceLab, o poți publica opțional în Biblioteca de Voci pentru ca și alții să o folosească. Implicit, rămâne privată în contul tău.
Configurarea contului tău ElevenLabs
Să începi e simplu.
- Mergi la elevenlabs.io
- Apasă Sign Up
- Folosește Google sau emailul
- Alege platforma inițială. Alege Eleven Creative dacă vrei să te concentrezi pe instrumentele de creare a vocii.

- Verifică-ți contul
După ce intri, navighează la zona VoiceLab:
- Apasă Voices în bara laterală din stânga.
- Apasă + Create Voice

Vei vedea patru opțiuni:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Reține că nu toate aceste funcționalități sunt disponibile pentru toate nivelurile. Verifică tabelul de mai jos ca să știi ce e disponibil la fiecare nivel:
|
Plan |
Voice Design |
IVC |
PVC |
Licență comercială |
|
Free |
Da |
Nu |
Nu |
Nu |
|
Starter |
Da |
Da |
Nu |
Da |
|
Creator |
Da |
Da |
Da |
Da |
Crearea unei voci sintetice cu Voice Design
Voice Design este cel mai ușor loc de început. Nu ai nevoie de nicio înregistrare. Generează o voce de la zero. Este și singura opțiune disponibilă în planul gratuit, ceea ce o face perfectă pentru începători.
Fluxul de lucru e simplu:
- Scrie un prompt cu câteva setări cheie
- Generează
- Previzualizează
- Salvează
Un sfat din experiență: generează cel puțin 5–10 variații înainte să alegi una. Chiar și cu aceleași setări, rezultatele pot varia destul de mult. Ca să începem, dă clic pe butonul Voice Design din meniul Create Voice. Se va deschide un meniu în care poți scrie un prompt pentru vocea ta.

Poți apăsa Settings pentru a ajusta două detalii:
- Loudness: cât de tare va fi vocea generată.
- Guidance level: similar cu temperatura în alte modele, indică cât de îndeaproape ar trebui ca AI-ul să urmeze promptul tău. O ghidare mai mare înseamnă că respectă mai strict ce spui. O ghidare mai mică îi oferă mai multă libertate.

Poți alege să lași agentul AI să-și folosească propriul text de previzualizare sau poți furniza propriul tău script dezactivând setarea și introducând textul tău în căsuța de previzualizare.

Parametri pentru promptingul vocii
Vei folosi zona de prompt pentru a genera configurațiile. Încearcă următorul șablon de prompt pentru a evidenția anumiți parametri pe care îi dorești:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Fiecare parametru influențează rezultatul:
- VoiceLabs este multilingv, deci limba determină tonalitatea vocală
- Accentul schimbă tiparele de pronunție
- Vârsta afectează înălțimea și timbrul
- Genul influențează plaja vocală
- Nivelul de calitate determină cât de curat sună audio
Partea interesantă este cum se combină acestea. Uneori, combinații neașteptate produc cele mai bune rezultate, așa că merită să experimentezi.
Generare, previzualizare și salvare
Apasă Generate voice, iar ElevenLabs produce un eșantion scurt.

Poți regenera de câte ori vrei. Fiecare versiune va fi ușor diferită.
După ce găsești una care îți place:
-
Apasă Save
-
Folosește un nume descriptiv, de tipul
narrator_us_male_30s
După salvare, vocea va apărea la My Voices și în meniul derulant Speech Synthesis.
Clonarea unei voci cu Instant Voice Cloning (IVC)
Instant Voice Cloning îți permite să reproduci o voce folosind doar un eșantion audio mic. E rapid și surprinzător de eficient, deși nu perfect. Reține că ai nevoie de planul Starter (6 $/lună) sau unul superior pentru asta.
Notă importantă: clonează doar voci pentru care ai permisiune. Platforma îți cere să confirmi acest lucru, iar tu ar trebui să îl tratezi serios. întregul flux este destul de simplu:
- Pregătește-ți fișierul audio
- Încarcă audio
- Denumește și salvează clona de voce
- Testează în Text to Speech
Pregătirea eșantionului audio
Vrei ca audio-ul tău să aibă lungimea potrivită, formatul corect și o calitate decentă. Lungimea minimă e de aproximativ un minut, dar am observat că 3 până la 5 minute oferă rezultate mult mai bune.
Ar trebui să încarci fișiere MP3 sau WAV sub 50 MB și poți încărca oricând mai multe fișiere simultan.
Pentru cea mai bună experiență de clonare și o calitate bună a audio-ului, recomand următoarele la înregistrare:
- Cameră liniștită
- Fără zgomot de fundal
- Distanță constantă față de microfon
Ai grijă să eviți următoarele:
- Mai mulți vorbitori
- Înregistrări de pe telefon
- Post-procesare puternică
Încărcarea și crearea clonei
Navighează înapoi în tabloul de bord Voices și fă următoarele:
- Apasă + Create Voice
- Selectează Instant Voice Cloning
- Încarcă audio și apasă Next

- Denumește-ți vocea, opțional adaugă etichete și o descriere
- Confirmă consimțământul
- Apasă Save Voice
Următoarele etichete pot fi alese dintr-un meniu derulant:
- Language
- Accent (se deschid opțiuni în funcție de limbă)
- Gender
- Age (opțiuni: young, middle-aged sau old)
Vocea este gata imediat și o poți testa pe loc în generatorul text-to-speech. Încearcă câteva propoziții diferite și fii atent unde sună natural și unde are dificultăți.
Pentru asta, dă clic pe Text to Speech din bara laterală stângă. (Reține că unele versiuni au numit acest instrument Speech Synthesis.)

Se deschide o fereastră cu un prompt de text similar.

În partea dreaptă, apasă pe meniul derulant Voice și selectează-ți vocea din fereastra My Voices.

Scrie o propoziție de test și apasă Generate speech.

Se va genera un eșantion audio cu vocea aleasă. Poți ajusta setările din dreapta după preferințe. Poți modifica, de exemplu:
- Viteza
- Stabilitatea
- Similaritatea
- Style Exaggeration
Alegerea unor modele diferite poate oferi și opțiuni diferite!

Pentru a-ți salva fișierul, apasă butonul de descărcare din dreapta pentru a salva audio-ul generat.

Construirea unei clone cu fidelitate ridicată cu Professional Voice Cloning (PVC)
Dacă IVC îți oferă o aproximare grosieră, PVC îți oferă ceva mult mai apropiat de realitate. Aici surprinzi nuanțe precum ritmul, respirația și emoția.
Necesită planul Creator (22 $/lună). Conform ElevenLabs, procesarea durează de obicei 2–6 ore, deși timpul total de antrenare poate ajunge la 24 de ore în funcție de încărcarea serverelor.
Este cea mai relevantă opțiune dacă încerci să creezi active vocale de nivel producție. Gândește-te la narațiune, audiobooks și agenți vocali de brand. Lucruri care pot avea utilizare comercială sau larg răspândită.
Înregistrarea și curatarea datelor de antrenament
Deoarece încercăm să creăm cel mai bun model posibil, cerințele cresc. De exemplu, timpul minim de înregistrare este de 30 de minute de audio curat, dar pentru rezultate optime urmărește peste 3 ore. Cel mai bun mod de a trimite atât de mult audio este să îl împarți în mostre de 30 de minute.
Iată câteva sfaturi ca să profiți la maximum de înregistrare:
- Folosește un mediu de înregistrare liniștit
- Încearcă să folosești un microfon bun
- Include conținut variat, nu citi doar dintr-un singur document
De exemplu, ai putea varia stilul de narațiune:
- Folosește tipuri diferite de dialog. Citește câteva texte instructive.
- Parcurge niște numere și o listă. Asta oferă multă varietate de pronunție și sintaxă.
- În plus, încearcă să înregistrezi vocea în ritmuri diferite, cu emoții diferite și așa mai departe. Un plus de expresivitate ajută la construirea unui model mai bun.
Ca de obicei, evită audio de calitate slabă, precum:
- Zgomot de fundal
- Compresie puternică
- Umpluturi precum „ăă” și „îî”
Trimiterea și așteptarea antrenării
După ce termini pregătirea audio-ului, pașii sunt destul de ușori:
- Selectează Professional Voice Clone
- Apasă butonul Create new clone

- Încarcă toate înregistrările, completează numele, limba și celelalte etichete

- Completează detaliile de consimțământ
- Trimite
Înainte ca ElevenLabs să îți antreneze clona, te pun să dovedești că vocea îți aparține.
Aceasta este marea diferență față de IVC: clonarea profesională îți permite să îți clonezi doar propria voce, deci nu poți clona pe altcineva, nici măcar cu consimțământul lor. Dacă un coleg vrea să își împrumute vocea, trebuie să creeze și să verifice PVC-ul în propriul cont, apoi să ți-l share-uiască printr-un link privat.
Verificarea constă într-o înregistrare live scurtă. Vei citi câteva rânduri afișate pe ecran la microfon. Două lucruri sunt critice:
- Folosește același echipament sau unul foarte similar cu cel folosit pentru mostre și menține un ton și o livrare similare. Un neconcordanță aici e cel mai des motiv de eșec.
- Citește fiecare rând o singură dată, apoi apasă Stop. Citirea de mai multe ori poate duce la eșecul verificării.
Dacă eșuează, poți aștepta 24 de ore și reîncerci sau contactezi suportul. Un heads-up: odată ce ajungi la etapa de verificare, clona e blocată. Nu poți șterge singur un PVC neverificat, așa că asigură-te că mostrele sunt corecte înainte să ajungi aici.
Vei fi notificat când clona ta vocală este gata! După aceea, un truc util este să compari ieșirile IVC și PVC folosind aceeași propoziție. Diferența este de obicei foarte clară.
Folosirea vocilor VoiceLab în proiecte
După ce îți salvezi vocea, ea devine disponibilă în toată platforma, oriunde ElevenLabs generează audio.
O poți folosi în:
- Text to Speech (Speech Synthesis) pentru generare rapidă
- Studio pentru proiecte pe termen lung
- Python API pentru utilizare programatică
Voi trece în revistă cum poți folosi vocea în fiecare dintre aceste instrumente. Beginner’s Guide to the ElevenLabs API este cea mai bună cale de a începe cu Python API.
Folosirea vocilor personalizate în Text to Speech și Studio
În Text to Speech trebuie doar să îți selectezi vocea din meniul derulant Voices -> My Voices așa cum am menționat mai sus.
Câteva sfaturi de reglaj pentru instrumentul Text to Speech:
- Începe cu Stability la 40–50%
- Setează Similarity la aproximativ 75%
- Ajustează în funcție de rezultat
Poate dura câteva încercări până obții exact vocea și înregistrarea dorită, dar cu cât experimentezi mai mult, cu atât înțelegi mai bine procesul de generare a vorbirii.
În Studio, e oarecum similar. Începi navigând la Studio în bara laterală din stânga, apoi selectezi + New Blank Project. În continuare, poți alege tipul de proiect:
- Audio Project sau
- Video Project
Un proiect audio este exact asta; îți permite să creezi conținut conversațional de format lung cu mai multe voci. Un proiect video îți cere mai întâi să încarci un clip video, după care poți adăuga voci pentru voice-over.
Navigarea într-un proiect audio în Studio
Proiectul audio din Studio îți permite să creezi un fișier audio cu mai mulți vorbitori. Este excelent pentru a genera podcasturi sau conținut conversațional. Chiar și conținut de tip audiobook în care vrei voci sau personaje diferite.
Tabloul de bord audio din Studio este o pânză goală pe care să lucrezi. Ne vom concentra aici pe componenta cheie de voce, dar simte-te liber să experimentezi.

În stânga, vei vedea o secțiune de voce selectată pentru tine. Pe măsură ce tastezi în zona de prompt, se va evidenția vorbirea personajului.

Când treci la rândul următor, poți selecta apoi o voce diferită și să ai un personaj diferit. Fiecare dintre aceste rânduri este un „paragraf”:

Limitele sunt destul de generoase pentru Studio. Fiecare proiect poate avea până la 500 de capitole, fiecare cu până la 400 de paragrafe. Fiecare paragraf poate avea până la 5000 de caractere.
Numărul de proiecte pe care le poți avea depinde de nivelul tău:
- Free: 5 proiecte
- Starter: 20 de proiecte
- Creator: 1.000 de proiecte
Navigarea într-un proiect video în Studio
Urmează aceiași pași, dar de data aceasta alege un proiect video. Vei ajunge pe o pânză goală și ți se va cere să încarci un video:
După ce ai încărcat un clip video, îl poți vedea în stânga și poți apăsa play pentru previzualizare. Poți adăuga mai multe videoclipuri dacă e nevoie.
Apoi mergi în stânga și alege Speech.

Similar cu un proiect audio, poți alege voci multiple și să tastezi propozițiile dorite. Pe măsură ce tastezi, poți apăsa Enter pentru a trece la o linie nouă. Poți alege voci diferite pentru fiecare linie pentru a crea o conversație.

În partea de jos, poți ajusta ușor intervalele de timp pentru fiecare linie, trăgându-le și plasându-le pe cronologie.

Dacă nu ai fotografii sau video, le poți genera folosind fila Video din stânga. Pur și simplu scrii un prompt, iar apoi se generează imaginea sau video-ul dorit.
Te rugăm să reții că mai întâi trebuie să accepți termenii beta pentru Image and Video. De asemenea, membrii gratuiți pot genera doar imagini; pentru a genera video ai nevoie de cel puțin un abonament Starter (5 $/lună).

Accesarea vocilor personalizate prin ElevenLabs Python SDK
Pentru a folosi Python SDK, trebuie mai întâi să ai Python instalat. Apoi vrei să creezi un mediu Python unde poți instala ElevenLabs SDK folosind următoarea comandă: pip install "elevenlabs[pyaudio]"
Apoi, mergi la tabloul de bord pentru developeri ElevenLabs, dând clic în partea de jos a barei laterale din stânga și selectând API Keys -> Create Key.

Vei selecta apoi ce instrumente vrei să aibă acces la API și apeși Create Key.

Se va afișa o cheie API pe care trebuie să o copiezi, altfel o vei pierde pentru totdeauna.

Apoi, salvează cheia API într-un fișier .env într-un loc sigur sau într-un folder de proiect.
După aceea, mergi la tabloul tău de bord Voices și selectează My Voices. Va trebui să copiezi Voice ID-ul vocii tale. Ține-l undeva de unde îl poți accesa ușor mai târziu.

Acum poți crea un script pentru a rula vocea ta ElevenLabs! Iată un exemplu simplu:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Concluzie
VoiceLab oferă trei căi dintre care poți alege, în funcție de nevoile tale. Voice Design e perfect pentru experimentare, Instant Voice Cloning e grozav pentru prototipuri rapide, iar Professional Voice Cloning e locul unde obții calitate de nivel producție.
Dacă abia începi, îți recomand să rămâi mai întâi la Voice Design. Fă upgrade doar când ai un caz de utilizare clar.
Dacă vrei să aprofundezi construirea de aplicații alimentate de AI, aruncă o privire la Developing AI Applications, skill track-ul nostru care te învață să folosești cele mai noi instrumente pentru developeri AI, inclusiv OpenAI API, Hugging Face și LangChain.
Întrebări frecvente despre ElevenLabs VoiceLab
ElevenLabs este gratuit de folosit?
Da. Planul gratuit îți oferă aproximativ 10.000 de credite pe lună (circa 10 minute de audio) plus Voice Design și biblioteca de voci standard. Dar nu poate fi folosit comercial și nu include clonarea vocii; ai nevoie de cel puțin planul Starter pentru Instant Voice Cloning și o licență comercială.
Am nevoie de un plan plătit pentru a folosi vocile ElevenLabs comercial?
Da. Planul gratuit necesită atribuire ElevenLabs și nu oferă drepturi comerciale, deci nu poți monetiza acel audio. O licență comercială începe cu planul Starter (aprox. 6 $/lună, sau 5 $ facturați anual), în timp ce Professional Voice Cloning pentru voci de nivel producție necesită planul Creator (22 $/lună) sau superior.
Pot clona vocea altcuiva cu ElevenLabs?
Doar cu permisiune explicită, iar regulile diferă în funcție de metodă. Instant Voice Cloning îți permite să clonezi orice voce pe care ești autorizat să o folosești, dar Professional Voice Cloning este restricționat la propria ta voce și necesită o înregistrare live de verificare (chiar și cu consimțământ). Folosirea unei voci clonate pentru impersonare sau fraudă este ilegală în majoritatea jurisdicțiilor.
Care e diferența dintre Instant și Professional Voice Cloning?
Instant Voice Cloning (IVC) produce o clonă utilizabilă în câteva secunde din doar 1–2 minute de audio și este ideal pentru prototipuri, deși poate rata nuanțele subtile. Professional Voice Cloning (PVC) antrenează un model dedicat pe 30 de minute până la 3 ore de audio și durează câteva ore pentru procesare, oferind un rezultat mult mai precis, gata de producție. Folosește IVC pentru a testa rapid și PVC când calitatea contează.
Îmi pot folosi vocea personalizată ElevenLabs în afara platformei?
Nu direct. Clonele de voce nu pot fi exportate și funcționează doar în ElevenLabs. Totuși, le poți folosi oriunde platforma generează audio, inclusiv în Text to Speech, Studio și programatic prin ElevenLabs API și Python SDK, ceea ce este modul în care majoritatea integrează o voce personalizată în propriile aplicații sau fluxuri.