Programma
Probabilmente ti è già capitato di trovare una voce text-to-speech fantastica, salvo poi scoprire che l'uso completo è bloccato dietro un piano più costoso, che non puoi farla suonare come il tuo brand e di certo non puoi chiamarla tua. Di solito qui è dove molti si fermano con l'AI vocale. Con ElevenLabs VoiceLab è qui che le cose cambiano.
In questa guida ti accompagno attraverso i tre strumenti di ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) e Professional Voice Cloning (PVC). Procederemo passo dopo passo e ti mostrerò cosa aspettarti in ogni fase.
Prima di iniziare, ecco cosa ti serve:
- Un account ElevenLabs gratuito è sufficiente per Voice Design
- Il piano Starter (6 $/mese) è richiesto per l'Instant Voice Cloning
- Il piano Creator (22 $/mese) è richiesto per il Professional Voice Cloning
Alla fine avrai almeno una voce personalizzata salvata nella tua libreria, pronta da usare in Speech Synthesis (Text to Speech), in Studio o anche via API.
Che cos'è ElevenLabs VoiceLab?
In sintesi, VoiceLab è la suite dedicata di ElevenLabs per creare e gestire voci personalizzate. È dove vai quando vuoi qualcosa di originale, non solo qualcosa di predefinito.
Ecco un rapido confronto dei tre strumenti di VoiceLab:
|
Strumento |
Cosa fa |
Qualità |
Input richiesto |
Tempo di creazione |
Piano richiesto |
Miglior caso d'uso |
|
Voice Design |
Genera voci sintetiche |
Buona |
Nessuno |
Istantaneo |
Gratis |
Sperimentazione |
|
IVC |
Clona una voce da audio breve |
Buona |
~1–5 min di audio |
Istantaneo |
Starter+ |
Prototipi |
|
PVC |
Clonazione vocale ad alta fedeltà |
Eccellente |
Da 30 min a 3+ ore |
1–2 giorni |
Creator+ |
Produzione |
Se vuoi approfondire l'uso delle voci in modo programmatico, ti consiglio la nostra guida all'API di ElevenLabs.
VoiceLab vs. Voice Library
È importante non confonderlo con la Voice Library.
- Voice Library: esplora e usa voci predefinite
- VoiceLab: crea e gestisci le tue voci
Una volta creata una voce in VoiceLab, puoi pubblicarla facoltativamente nella Voice Library per consentirne l'uso ad altri. Per impostazione predefinita, resta privata nel tuo account.
Configurare il tuo account ElevenLabs
Iniziare è semplice.
- Vai su elevenlabs.io
- Clicca su Sign Up
- Usa Google o email
- Scegli la tua piattaforma iniziale. Seleziona Eleven Creative per concentrarti sugli strumenti di creazione vocale.

- Verifica il tuo account
Una volta dentro, vai all'area VoiceLab:
- Clicca su Voices nella barra laterale sinistra.
- Clicca su + Create Voice

Vedrai quattro opzioni:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Tieni presente che non tutte queste funzionalità sono disponibili per tutti i piani. Consulta la tabella seguente per sapere cosa è disponibile in ciascun livello:
|
Piano |
Voice Design |
IVC |
PVC |
Licenza commerciale |
|
Free |
Sì |
No |
No |
No |
|
Starter |
Sì |
Sì |
No |
Sì |
|
Creator |
Sì |
Sì |
Sì |
Sì |
Creare una voce sintetica con Voice Design
Voice Design è il punto di partenza più semplice. Non ti servono registrazioni. Genera una voce da zero. È anche l'unica opzione disponibile con il piano gratuito, perfetta per chi inizia.
Il flusso di lavoro è semplice:
- Scrivi un prompt con alcune impostazioni chiave
- Genera
- Ascolta l'anteprima
- Salva
Un consiglio dall'esperienza: genera almeno 5-10 varianti prima di sceglierne una. Anche con le stesse impostazioni, i risultati variano parecchio. Per iniziare, clicca sul pulsante Voice Design nel menu Create Voice. Si aprirà un menu in cui potrai scrivere un prompt per la tua voce.

Puoi toccare Settings per regolare due dettagli:
- Loudness: quanto sarà alta la voce generata.
- Guidance level: simile alla temperatura in altri modelli, indica quanto fedelmente l'AI deve seguire il tuo prompt. Un valore più alto significa che aderisce più rigidamente a quanto richiesto; più basso le lascia più libertà.

Puoi lasciare che l'agente AI usi un proprio testo di anteprima, oppure fornire tu stesso lo script disattivando l'impostazione e inserendo il tuo testo nella casella di anteprima.

Impostare i parametri della voce con il prompt
Usa l'area del prompt per generare le configurazioni. Prova il seguente modello di prompt per definire alcuni parametri specifici che vuoi:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Ogni parametro influisce sul risultato:
- VoiceLabs è multilingue, quindi la lingua determina la tonalità della voce
- L'accento cambia i modelli di pronuncia
- L'età influisce su intonazione e timbro
- Il genere influenza l'estensione vocale
- Il livello di qualità determina quanto pulito suoni l'audio
La parte interessante è come questi elementi si combinano. A volte combinazioni inaspettate producono i risultati migliori, quindi vale la pena sperimentare.
Generare, ascoltare l'anteprima e salvare
Clicca su Generate voice e ElevenLabs produrrà un breve campione.

Puoi rigenerare quante volte vuoi. Ogni versione sarà leggermente diversa.
Quando ne trovi una che ti piace:
-
Clicca su Save
-
Usa un nome descrittivo come
narrator_us_male_30s
Dopo il salvataggio, la voce apparirà in My Voices e nel menu a discesa di Speech Synthesis.
Clonare una voce con Instant Voice Cloning (IVC)
Instant Voice Cloning ti permette di replicare una voce usando solo un piccolo campione audio. È veloce e sorprendentemente efficace, anche se non perfetto. Ricorda che ti serve il piano Starter (6 $/mese) o superiore.
Nota importante: clona solo voci per cui hai l'autorizzazione. La piattaforma ti chiede di confermarlo ed è bene prenderlo sul serio. L'intero processo è piuttosto lineare:
- Prepara il tuo audio
- Carica l'audio
- Assegna un nome e salva il clone della voce
- Testalo in Text to Speech
Preparare il tuo campione audio
Il tuo audio deve avere la lunghezza giusta, il formato corretto e una qualità decente. La lunghezza minima è circa un minuto, ma ho visto che 3-5 minuti danno risultati molto migliori.
Dovresti caricare file MP3 o WAV sotto i 50 MB, e puoi sempre caricare più file alla volta.
Per garantire la migliore esperienza di clonazione e una buona qualità audio, consiglio quanto segue in registrazione:
- Stanza silenziosa
- Nessun rumore di fondo
- Distanza dal microfono costante
Assicurati di evitare quanto segue:
- Più speaker
- Registrazioni da telefono
- Pesante post-produzione
Caricare e creare il clone
Torna alla dashboard Voices e procedi così:
- Clicca su + Create Voice
- Seleziona Instant Voice Cloning
- Carica il tuo audio e clicca su Next

- Assegna un nome alla voce, facoltativamente aggiungi etichette e una descrizione
- Conferma il consenso
- Clicca su Save Voice
Le seguenti etichette possono essere scelte da un menu a discesa:
- Language
- Accent (apre opzioni a seconda della lingua)
- Gender
- Age (opzioni: young, middle-aged, o old)
La voce è pronta subito e puoi testarla immediatamente nel generatore text-to-speech. Prova frasi diverse e fai attenzione a dove suona naturale e dove fa più fatica.
Per farlo, clicca su Text to Speech nella barra laterale sinistra. (In alcune versioni è indicato come Speech Synthesis.)

Si apre una finestra con un prompt testuale simile.

A destra, clicca sul menu a discesa Voice e seleziona la tua voce nella finestra My Voices.

Scrivi una frase di test e clicca su Generate speech.

Questo genererà un campione audio con la voce scelta. Sentiti libero di regolare le impostazioni a destra in base alle tue preferenze. Puoi modificare parametri come:
- Speed
- Stability
- Similarity
- Style Exaggeration
La scelta di modelli diversi può offrire anche opzioni differenti!

Per salvare il file, clicca sul pulsante di download a destra per salvare l'audio generato.

Creare un clone ad alta fedeltà con Professional Voice Cloning (PVC)
Se IVC ti fornisce un'approssimazione, PVC ti dà qualcosa di molto più vicino all'originale. È qui che si catturano sfumature come ritmo, respiro ed emozione.
Richiede il piano Creator (22 $/mese). Secondo ElevenLabs, l'elaborazione richiede in genere da 2 a 6 ore, anche se il tempo totale di training può arrivare fino a 24 ore a seconda del carico dei server.
È l'opzione più rilevante se vuoi costruire asset vocali di livello produzione. Pensa a narrazione, audiolibri e agenti vocali di brand. Cose che potrebbero avere uso commerciale o su larga scala.
Registrare e curare i tuoi dati di training
Dato che vogliamo creare il miglior modello possibile, i requisiti aumentano. Ad esempio, il tempo minimo di registrazione è 30 minuti di audio pulito, ma per risultati ottimali punta a 3+ ore. Il modo migliore per inviare così tanto audio è suddividerlo in campioni da 30 minuti.
Ecco alcuni consigli per ottenere il massimo dalla registrazione:
- Usa un ambiente di registrazione silenzioso
- Cerca di usare un buon microfono
- Includi contenuti vari, non leggere solo da un unico documento
Ad esempio, potresti variare lo stile di narrazione:
- Usa diversi tipi di dialogo. Leggi qualche testo istruzionale.
- Passa in rassegna alcuni numeri e un elenco. Questo offre molta varietà in termini di pronuncia e sintassi.
- Inoltre, prova a registrare la voce con ritmi diversi, con emozioni differenti, e così via. Aggiungere espressività e stile aiuta a costruire un modello migliore.
Come sempre, evita audio di scarsa qualità come i seguenti:
- Rumore di fondo
- Forte compressione
- Intercalari come “ehm” e “uh”
Inviare e attendere il training
Una volta preparato l'audio, i passaggi sono piuttosto semplici:
- Seleziona Professional Voice Clone
- Clicca sul pulsante Create new clone

- Carica tutte le registrazioni, compila nome, lingua e altre etichette

- Compila i dettagli di consenso
- Invia
Prima di addestrare il tuo clone, ElevenLabs ti fa dimostrare che la voce è davvero tua.
Questa è la grande differenza rispetto a IVC: la clonazione professionale ti permette di clonare solo la tua voce, quindi non puoi clonare quella di qualcun altro, anche con il suo consenso. Se un collega vuole prestare la sua, deve creare e verificare il PVC sul proprio account, poi condividerlo con te tramite un link privato.
La verifica è una breve registrazione dal vivo. Leggerai alcune righe a schermo nel microfono. Due aspetti la determinano:
- Usa la stessa attrezzatura o molto simile a quella con cui hai registrato i campioni e mantieni un tono e una resa simili. Una mancata corrispondenza è la causa più comune di fallimento.
- Leggi ogni riga una sola volta, poi premi Stop. Rileggerla più volte può causare l'errore della verifica.
Se fallisce, puoi attendere 24 ore e riprovare o contattare il supporto. Attenzione: una volta raggiunta la fase di verifica, il clone viene bloccato. Non puoi eliminare autonomamente un PVC non verificato, quindi assicurati che i campioni siano corretti prima di arrivare qui.
Riceverai una notifica quando il clone della tua voce è pronto! A quel punto, un trucco utile è confrontare gli output IVC e PVC usando la stessa frase. La differenza di solito è molto chiara.
Usare le tue voci di VoiceLab nei progetti
Una volta salvata, la tua voce diventa disponibile in tutta la piattaforma ovunque ElevenLabs generi audio.
Puoi usarla in:
- Text to Speech (Speech Synthesis) per generazioni rapide
- Studio per progetti a lungo termine
- Python API per l'uso programmatico
Ti mostrerò come usare la tua voce in ognuno di questi strumenti. La Guida per principianti all'API di ElevenLabs è il modo migliore per iniziare con la Python API.
Usare voci personalizzate in Text to Speech e in Studio
In Text to Speech ti basta selezionare la tua voce dal menu a discesa Voices -> My Voices come detto sopra.
Alcuni suggerimenti di tuning per lo strumento Text to Speech:
- Inizia con Stability al 40-50%
- Imposta Similarity intorno al 75%
- Regola in base all'output
Potrebbero volerci alcuni tentativi per ottenere esattamente la voce e la registrazione che vuoi, ma più sperimenti e meglio capirai il processo di generazione vocale.
In Studio è simile. Vai su Studio nella barra laterale sinistra, quindi seleziona + New Blank Project. Poi puoi scegliere il tipo di progetto:
- Audio Project oppure
- Video Project
Un progetto audio è semplicemente tale; ti consente di creare contenuti conversazionali di lunga durata con più voci. Un progetto video richiede prima il caricamento di un video, al quale potrai poi aggiungere voci per un voice-over.
Navigazione di un progetto audio nello Studio
Lo Studio per i progetti audio consente di creare un file audio multi-speaker. È ottimo per generare podcast o contenuti conversazionali. Anche contenuti per audiolibri in cui vuoi voci o personaggi diversi.
La dashboard audio dello Studio è una tela bianca su cui lavorare. Qui ci concentriamo sulla componente vocale principale, ma sentiti libero di esplorare.

A sinistra vedrai una sezione voce già selezionata. Mentre digiti nell'area del prompt, verrà evidenziato il parlato del personaggio.

Alla riga successiva puoi selezionare una voce diversa e avere un personaggio differente. Ognuna di queste righe è un “paragrafo”:

I limiti sono piuttosto alti per lo Studio. Ogni progetto può avere fino a 500 capitoli, ciascuno con fino a 400 paragrafi. Ogni paragrafo può avere fino a 5000 caratteri.
Il numero di progetti che puoi avere dipende dal tuo piano:
- Free: 5 progetti
- Starter: 20 progetti
- Creator: 1.000 progetti
Navigazione di un progetto video nello Studio
Segui gli stessi passaggi, ma questa volta scegli un progetto video. Arriverai su una tela bianca e ti verrà chiesto di caricare un video:
Dopo aver caricato una clip, la vedrai a sinistra e potrai premere play per l'anteprima. Se necessario, puoi aggiungere più video.
Poi vai a sinistra e scegli Speech.

Come in un progetto audio, puoi scegliere più voci e digitare le frasi di interesse. Mentre scrivi, puoi premere Enter per passare alla riga successiva. È possibile scegliere voci diverse per ogni riga per creare una conversazione.

In basso puoi regolare facilmente le tempistiche di ogni riga trascinandole sulla timeline.

Se non hai foto o video, puoi generarli usando la scheda Video a sinistra. Ti basta scrivere un prompt, che genererà l'immagine o il video desiderato.
Nota che devi prima accettare i termini di servizio beta per Immagini e Video. Inoltre, i membri free possono generare solo immagini; per generare video devi avere almeno un abbonamento Starter (5 $/mese).

Accedere alle voci personalizzate tramite l'SDK Python di ElevenLabs
Per usare l'SDK Python, devi prima avere Python installato. Poi crea un ambiente Python in cui potrai quindi installare l'SDK di ElevenLabs usando il seguente comando: pip install "elevenlabs[pyaudio]"
Poi vai alla dashboard sviluppatori di ElevenLabs cliccando in basso nella barra laterale sinistra e selezionando API Keys -> Create Key.

Poi seleziona a quali strumenti vuoi concedere l'accesso API e clicca su Create Key.

Verrà mostrata un'API Key che devi copiare altrimenti la perderai per sempre.

Poi salva la chiave API in un file .env in un luogo sicuro o nella cartella di un progetto.
Dopodiché, vai alla dashboard Voices e seleziona My Voices. Copia il Voice ID della tua voce. Salvalo in un posto facile da recuperare.

Ora puoi creare uno script per eseguire la tua voce ElevenLabs! Ecco un semplice esempio:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Conclusione
VoiceLab offre tre strade tra cui scegliere, in base alle tue esigenze. Voice Design è perfetto per sperimentare, Instant Voice Cloning è ideale per prototipi veloci e Professional Voice Cloning è dove andare per una qualità da produzione.
Se stai iniziando, ti consiglio di restare prima su Voice Design. Passa di piano solo quando hai un caso d'uso chiaro.
Se vuoi approfondire la creazione di applicazioni basate sull'AI, dai un'occhiata alla nostra skill track Developing AI Applications, che ti insegna a usare i più recenti strumenti per sviluppatori AI, tra cui OpenAI API, Hugging Face e LangChain.
Domande frequenti su ElevenLabs VoiceLab
ElevenLabs è gratuito?
Sì. Il piano gratuito ti offre circa 10.000 crediti al mese (circa 10 minuti di audio), oltre a Voice Design e la libreria di voci stock. Ma non è utilizzabile a fini commerciali e non include la clonazione vocale; ti serve almeno il piano Starter per l'Instant Voice Cloning e una licenza commerciale.
Mi serve un piano a pagamento per usare commercialmente le voci di ElevenLabs?
Sì. Il piano gratuito richiede l'attribuzione ElevenLabs e non concede diritti commerciali, quindi non puoi monetizzare quell'audio. Una licenza commerciale parte dal piano Starter (circa 6 $/mese, o 5 $ con fatturazione annuale), mentre il Professional Voice Cloning per voci di livello produzione richiede il piano Creator (22 $/mese) o superiore.
Posso clonare la voce di qualcun altro con ElevenLabs?
Solo con autorizzazione esplicita, e le regole variano in base al metodo. L'Instant Voice Cloning ti consente di clonare qualsiasi voce per cui sei autorizzato, ma il Professional Voice Cloning è limitato alla tua voce e richiede una registrazione di verifica dal vivo (anche con consenso). Usare una voce clonata per impersonificazione o frode è illegale nella maggior parte delle giurisdizioni.
Qual è la differenza tra Instant e Professional Voice Cloning?
Instant Voice Cloning (IVC) produce un clone utilizzabile in pochi secondi partendo da appena 1–2 minuti di audio ed è ideale per i prototipi, anche se può perdere sfumature sottili. Professional Voice Cloning (PVC) addestra un modello dedicato su 30 minuti fino a 3 ore di audio e impiega alcune ore per l'elaborazione, offrendo un risultato molto più accurato e pronto per la produzione. Usa IVC per test rapidi e PVC quando conta la qualità.
Posso usare la mia voce personalizzata di ElevenLabs fuori dalla piattaforma?
Non direttamente. I cloni vocali non possono essere esportati e funzionano solo all'interno di ElevenLabs. Puoi comunque usarli ovunque la piattaforma generi audio, inclusi Text to Speech, Studio e in modo programmatico tramite l'API di ElevenLabs e l'SDK Python, che è come la maggior parte integra una voce personalizzata nelle proprie app o pipeline.
Sono una data scientist con esperienza in analisi spaziale, machine learning e pipeline dei dati. Ho lavorato con GCP, Hadoop, Hive, Snowflake, Airflow e altri processi di data science/engineering.


