Vai al contenuto principale

Clonazione vocale con ElevenLabs: guida pratica a VoiceLab

Impara a clonare la tua voce con Instant e Professional Voice Cloning in ElevenLabs, dalla registrazione dell'audio pulito alla generazione vocale tramite Python SDK.
Aggiornato 3 ago 2026  · 13 min leggi

Esplora con l'AI

Apri in ChatGPTApri in ClaudeApri in Perplexity

Probabilmente ti è già capitato di trovare una voce text-to-speech fantastica, salvo poi scoprire che l'uso completo è bloccato dietro un piano più costoso, che non puoi farla suonare come il tuo brand e di certo non puoi chiamarla tua. Di solito qui è dove molti si fermano con l'AI vocale. Con ElevenLabs VoiceLab è qui che le cose cambiano.

In questa guida ti accompagno attraverso i tre strumenti di ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) e Professional Voice Cloning (PVC). Procederemo passo dopo passo e ti mostrerò cosa aspettarti in ogni fase.

Prima di iniziare, ecco cosa ti serve:

  • Un account ElevenLabs gratuito è sufficiente per Voice Design
  • Il piano Starter (6 $/mese) è richiesto per l'Instant Voice Cloning
  • Il piano Creator (22 $/mese) è richiesto per il Professional Voice Cloning

Alla fine avrai almeno una voce personalizzata salvata nella tua libreria, pronta da usare in Speech Synthesis (Text to Speech), in Studio o anche via API.

Che cos'è ElevenLabs VoiceLab?

In sintesi, VoiceLab è la suite dedicata di ElevenLabs per creare e gestire voci personalizzate. È dove vai quando vuoi qualcosa di originale, non solo qualcosa di predefinito.

Ecco un rapido confronto dei tre strumenti di VoiceLab:

Strumento

Cosa fa

Qualità

Input richiesto

Tempo di creazione

Piano richiesto

Miglior caso d'uso

Voice Design

Genera voci sintetiche

Buona

Nessuno

Istantaneo

Gratis

Sperimentazione

IVC

Clona una voce da audio breve

Buona

~1–5 min di audio

Istantaneo

Starter+

Prototipi

PVC

Clonazione vocale ad alta fedeltà

Eccellente

Da 30 min a 3+ ore

1–2 giorni

Creator+

Produzione

Se vuoi approfondire l'uso delle voci in modo programmatico, ti consiglio la nostra guida all'API di ElevenLabs.

VoiceLab vs. Voice Library

È importante non confonderlo con la Voice Library.

  • Voice Library: esplora e usa voci predefinite
  • VoiceLab: crea e gestisci le tue voci

Una volta creata una voce in VoiceLab, puoi pubblicarla facoltativamente nella Voice Library per consentirne l'uso ad altri. Per impostazione predefinita, resta privata nel tuo account.

Configurare il tuo account ElevenLabs

Iniziare è semplice. 

  1. Vai su elevenlabs.io
  2. Clicca su Sign Up
  3. Usa Google o email
  4. Scegli la tua piattaforma iniziale. Seleziona Eleven Creative per concentrarti sugli strumenti di creazione vocale.

Scegli tra ElevenCreative ed ElevenAgents

  1. Verifica il tuo account

Una volta dentro, vai all'area VoiceLab:

  • Clicca su Voices nella barra laterale sinistra.
  • Clicca su + Create Voice

ElevenLabs VoiceLab Voices

Vedrai quattro opzioni:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Opzioni di creazione voce

Tieni presente che non tutte queste funzionalità sono disponibili per tutti i piani. Consulta la tabella seguente per sapere cosa è disponibile in ciascun livello:

Piano

Voice Design

IVC

PVC

Licenza commerciale

Free

No

No

No

Starter

No

Creator

Creare una voce sintetica con Voice Design

Voice Design è il punto di partenza più semplice. Non ti servono registrazioni. Genera una voce da zero. È anche l'unica opzione disponibile con il piano gratuito, perfetta per chi inizia.

Il flusso di lavoro è semplice:

  1. Scrivi un prompt con alcune impostazioni chiave
  2. Genera
  3. Ascolta l'anteprima
  4. Salva

Un consiglio dall'esperienza: genera almeno 5-10 varianti prima di sceglierne una. Anche con le stesse impostazioni, i risultati variano parecchio. Per iniziare, clicca sul pulsante Voice Design nel menu Create Voice. Si aprirà un menu in cui potrai scrivere un prompt per la tua voce.

Prompt di Voice Design

Puoi toccare Settings per regolare due dettagli:

  • Loudness: quanto sarà alta la voce generata. 
  • Guidance level: simile alla temperatura in altri modelli, indica quanto fedelmente l'AI deve seguire il tuo prompt. Un valore più alto significa che aderisce più rigidamente a quanto richiesto; più basso le lascia più libertà.

Regolare loudness e guidance scale

Puoi lasciare che l'agente AI usi un proprio testo di anteprima, oppure fornire tu stesso lo script disattivando l'impostazione e inserendo il tuo testo nella casella di anteprima.

Testo di anteprima

Impostare i parametri della voce con il prompt

Usa l'area del prompt per generare le configurazioni. Prova il seguente modello di prompt per definire alcuni parametri specifici che vuoi:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Ogni parametro influisce sul risultato:

  • VoiceLabs è multilingue, quindi la lingua determina la tonalità della voce
  • L'accento cambia i modelli di pronuncia
  • L'età influisce su intonazione e timbro
  • Il genere influenza l'estensione vocale
  • Il livello di qualità determina quanto pulito suoni l'audio

La parte interessante è come questi elementi si combinano. A volte combinazioni inaspettate producono i risultati migliori, quindi vale la pena sperimentare.

Generare, ascoltare l'anteprima e salvare

Clicca su Generate voice e ElevenLabs produrrà un breve campione.

Voci generate di esempio

Puoi rigenerare quante volte vuoi. Ogni versione sarà leggermente diversa.

Quando ne trovi una che ti piace:

  • Clicca su Save

  • Usa un nome descrittivo come narrator_us_male_30s

Dopo il salvataggio, la voce apparirà in My Voices e nel menu a discesa di Speech Synthesis.

Clonare una voce con Instant Voice Cloning (IVC)

Instant Voice Cloning ti permette di replicare una voce usando solo un piccolo campione audio. È veloce e sorprendentemente efficace, anche se non perfetto. Ricorda che ti serve il piano Starter (6 $/mese) o superiore.

Nota importante: clona solo voci per cui hai l'autorizzazione. La piattaforma ti chiede di confermarlo ed è bene prenderlo sul serio. L'intero processo è piuttosto lineare:

  • Prepara il tuo audio
  • Carica l'audio
  • Assegna un nome e salva il clone della voce
  • Testalo in Text to Speech

Preparare il tuo campione audio

Il tuo audio deve avere la lunghezza giusta, il formato corretto e una qualità decente. La lunghezza minima è circa un minuto, ma ho visto che 3-5 minuti danno risultati molto migliori.

Dovresti caricare file MP3 o WAV sotto i 50 MB, e puoi sempre caricare più file alla volta. 

Per garantire la migliore esperienza di clonazione e una buona qualità audio, consiglio quanto segue in registrazione:

  • Stanza silenziosa
  • Nessun rumore di fondo
  • Distanza dal microfono costante

Assicurati di evitare quanto segue:

  • Più speaker
  • Registrazioni da telefono
  • Pesante post-produzione

Caricare e creare il clone

Torna alla dashboard Voices e procedi così:

  1. Clicca su + Create Voice
  2. Seleziona Instant Voice Cloning
  3. Carica il tuo audio e clicca su Next

Instant Voice Clone

  1. Assegna un nome alla voce, facoltativamente aggiungi etichette e una descrizione
  2. Conferma il consenso
  3. Clicca su Save Voice

Le seguenti etichette possono essere scelte da un menu a discesa:

  • Language
  • Accent (apre opzioni a seconda della lingua)
  • Gender
  • Age (opzioni: young, middle-aged, o old)

La voce è pronta subito e puoi testarla immediatamente nel generatore text-to-speech. Prova frasi diverse e fai attenzione a dove suona naturale e dove fa più fatica.

Per farlo, clicca su Text to Speech nella barra laterale sinistra. (In alcune versioni è indicato come Speech Synthesis.)

Text to Speec

Si apre una finestra con un prompt testuale simile. 

Finestra Text to Speech

A destra, clicca sul menu a discesa Voice e seleziona la tua voce nella finestra My Voices.

Selezione della voce

Scrivi una frase di test e clicca su Generate speech.

Genera parlato

Questo genererà un campione audio con la voce scelta. Sentiti libero di regolare le impostazioni a destra in base alle tue preferenze. Puoi modificare parametri come:

  • Speed
  • Stability
  • Similarity
  • Style Exaggeration 

La scelta di modelli diversi può offrire anche opzioni differenti!

Regolare il parlato generato

Per salvare il file, clicca sul pulsante di download a destra per salvare l'audio generato.

Salva il parlato generato

Creare un clone ad alta fedeltà con Professional Voice Cloning (PVC)

Se IVC ti fornisce un'approssimazione, PVC ti dà qualcosa di molto più vicino all'originale. È qui che si catturano sfumature come ritmo, respiro ed emozione.

Richiede il piano Creator (22 $/mese). Secondo ElevenLabs, l'elaborazione richiede in genere da 2 a 6 ore, anche se il tempo totale di training può arrivare fino a 24 ore a seconda del carico dei server. 

È l'opzione più rilevante se vuoi costruire asset vocali di livello produzione.  Pensa a narrazione, audiolibri e agenti vocali di brand. Cose che potrebbero avere uso commerciale o su larga scala.

Registrare e curare i tuoi dati di training

Dato che vogliamo creare il miglior modello possibile, i requisiti aumentano. Ad esempio, il tempo minimo di registrazione è 30 minuti di audio pulito, ma per risultati ottimali punta a 3+ ore. Il modo migliore per inviare così tanto audio è suddividerlo in campioni da 30 minuti.

Ecco alcuni consigli per ottenere il massimo dalla registrazione:

  • Usa un ambiente di registrazione silenzioso
  • Cerca di usare un buon microfono
  • Includi contenuti vari, non leggere solo da un unico documento

Ad esempio, potresti variare lo stile di narrazione:

  • Usa diversi tipi di dialogo. Leggi qualche testo istruzionale. 
  • Passa in rassegna alcuni numeri e un elenco. Questo offre molta varietà in termini di pronuncia e sintassi. 
  • Inoltre, prova a registrare la voce con ritmi diversi, con emozioni differenti, e così via. Aggiungere espressività e stile aiuta a costruire un modello migliore.

Come sempre, evita audio di scarsa qualità come i seguenti:

  • Rumore di fondo
  • Forte compressione
  • Intercalari come “ehm” e “uh”

Inviare e attendere il training

Una volta preparato l'audio, i passaggi sono piuttosto semplici:

  1. Seleziona Professional Voice Clone
  2. Clicca sul pulsante Create new clone

Crea un Professional Voice Clone

  1. Carica tutte le registrazioni, compila nome, lingua e altre etichette

Dettagli PVC

  1. Compila i dettagli di consenso
  2. Invia

Prima di addestrare il tuo clone, ElevenLabs ti fa dimostrare che la voce è davvero tua.

Questa è la grande differenza rispetto a IVC: la clonazione professionale ti permette di clonare solo la tua voce, quindi non puoi clonare quella di qualcun altro, anche con il suo consenso. Se un collega vuole prestare la sua, deve creare e verificare il PVC sul proprio account, poi condividerlo con te tramite un link privato.

La verifica è una breve registrazione dal vivo. Leggerai alcune righe a schermo nel microfono. Due aspetti la determinano:

  • Usa la stessa attrezzatura o molto simile a quella con cui hai registrato i campioni e mantieni un tono e una resa simili. Una mancata corrispondenza è la causa più comune di fallimento.
  • Leggi ogni riga una sola volta, poi premi Stop. Rileggerla più volte può causare l'errore della verifica.

Se fallisce, puoi attendere 24 ore e riprovare o contattare il supporto. Attenzione: una volta raggiunta la fase di verifica, il clone viene bloccato. Non puoi eliminare autonomamente un PVC non verificato, quindi assicurati che i campioni siano corretti prima di arrivare qui.

Riceverai una notifica quando il clone della tua voce è pronto! A quel punto, un trucco utile è confrontare gli output IVC e PVC usando la stessa frase. La differenza di solito è molto chiara.

Usare le tue voci di VoiceLab nei progetti

Una volta salvata, la tua voce diventa disponibile in tutta la piattaforma ovunque ElevenLabs generi audio.

Puoi usarla in:

  • Text to Speech (Speech Synthesis) per generazioni rapide
  • Studio per progetti a lungo termine
  • Python API per l'uso programmatico

Ti mostrerò come usare la tua voce in ognuno di questi strumenti. La Guida per principianti all'API di ElevenLabs è il modo migliore per iniziare con la Python API.

Usare voci personalizzate in Text to Speech e in Studio

In Text to Speech ti basta selezionare la tua voce dal menu a discesa Voices -> My Voices come detto sopra.

Alcuni suggerimenti di tuning per lo strumento Text to Speech:

  • Inizia con Stability al 40-50%
  • Imposta Similarity intorno al 75%
  • Regola in base all'output

Potrebbero volerci alcuni tentativi per ottenere esattamente la voce e la registrazione che vuoi, ma più sperimenti e meglio capirai il processo di generazione vocale.

In Studio è simile. Vai su Studio nella barra laterale sinistra, quindi seleziona + New Blank Project. Poi puoi scegliere il tipo di progetto:

  • Audio Project oppure
  • Video Project

Un progetto audio è semplicemente tale; ti consente di creare contenuti conversazionali di lunga durata con più voci. Un progetto video richiede prima il caricamento di un video, al quale potrai poi aggiungere voci per un voice-over.

Lo Studio per i progetti audio consente di creare un file audio multi-speaker. È ottimo per generare podcast o contenuti conversazionali. Anche contenuti per audiolibri in cui vuoi voci o personaggi diversi. 

La dashboard audio dello Studio è una tela bianca su cui lavorare. Qui ci concentriamo sulla componente vocale principale, ma sentiti libero di esplorare.

Progetto audio nello Studio

A sinistra vedrai una sezione voce già selezionata. Mentre digiti nell'area del prompt, verrà evidenziato il parlato del personaggio.

Creare un nuovo paragrafo

Alla riga successiva puoi selezionare una voce diversa e avere un personaggio differente. Ognuna di queste righe è un “paragrafo”:

Selezionare una voce per un paragrafo

I limiti sono piuttosto alti per lo Studio. Ogni progetto può avere fino a 500 capitoli, ciascuno con fino a 400 paragrafi. Ogni paragrafo può avere fino a 5000 caratteri.

Il numero di progetti che puoi avere dipende dal tuo piano:

  • Free: 5 progetti
  • Starter: 20 progetti
  • Creator: 1.000 progetti

Segui gli stessi passaggi, ma questa volta scegli un progetto video. Arriverai su una tela bianca e ti verrà chiesto di caricare un video:Progetto video in Studio

Dopo aver caricato una clip, la vedrai a sinistra e potrai premere play per l'anteprima. Se necessario, puoi aggiungere più video.

Poi vai a sinistra e scegli Speech.

File del progetto video

Come in un progetto audio, puoi scegliere più voci e digitare le frasi di interesse. Mentre scrivi, puoi premere Enter per passare alla riga successiva. È possibile scegliere voci diverse per ogni riga per creare una conversazione.

Aggiungi voce a un video

In basso puoi regolare facilmente le tempistiche di ogni riga trascinandole sulla timeline.

Editing video con parlato generato

Se non hai foto o video, puoi generarli usando la scheda Video a sinistra. Ti basta scrivere un prompt, che genererà l'immagine o il video desiderato. 

Nota che devi prima accettare i termini di servizio beta per Immagini e Video. Inoltre, i membri free possono generare solo immagini; per generare video devi avere almeno un abbonamento Starter (5 $/mese).

Genera video

Accedere alle voci personalizzate tramite l'SDK Python di ElevenLabs

Per usare l'SDK Python, devi prima avere Python installato. Poi crea un ambiente Python in cui potrai quindi installare l'SDK di ElevenLabs usando il seguente comando: pip install "elevenlabs[pyaudio]"

Poi vai alla dashboard sviluppatori di ElevenLabs cliccando in basso nella barra laterale sinistra e selezionando API Keys -> Create Key.

Console sviluppatore ElevenLabs

Poi seleziona a quali strumenti vuoi concedere l'accesso API e clicca su Create Key.

Crea API key

Verrà mostrata un'API Key che devi copiare altrimenti la perderai per sempre.

API key creata

Poi salva la chiave API in un file .env in un luogo sicuro o nella cartella di un progetto.

Dopodiché, vai alla dashboard Voices e seleziona My Voices. Copia il Voice ID della tua voce. Salvalo in un posto facile da recuperare.

Copia il Voice ID

Ora puoi creare uno script per eseguire la tua voce ElevenLabs! Ecco un semplice esempio:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Conclusione

VoiceLab offre tre strade tra cui scegliere, in base alle tue esigenze. Voice Design è perfetto per sperimentare, Instant Voice Cloning è ideale per prototipi veloci e Professional Voice Cloning è dove andare per una qualità da produzione.

Se stai iniziando, ti consiglio di restare prima su Voice Design. Passa di piano solo quando hai un caso d'uso chiaro.

Se vuoi approfondire la creazione di applicazioni basate sull'AI, dai un'occhiata alla nostra skill track Developing AI Applications, che ti insegna a usare i più recenti strumenti per sviluppatori AI, tra cui OpenAI API, Hugging Face e LangChain.

Domande frequenti su ElevenLabs VoiceLab

ElevenLabs &egrave; gratuito?

Sì. Il piano gratuito ti offre circa 10.000 crediti al mese (circa 10 minuti di audio), oltre a Voice Design e la libreria di voci stock. Ma non è utilizzabile a fini commerciali e non include la clonazione vocale; ti serve almeno il piano Starter per l'Instant Voice Cloning e una licenza commerciale.

Mi serve un piano a pagamento per usare commercialmente le voci di ElevenLabs?

Sì. Il piano gratuito richiede l'attribuzione ElevenLabs e non concede diritti commerciali, quindi non puoi monetizzare quell'audio. Una licenza commerciale parte dal piano Starter (circa 6 $/mese, o 5 $ con fatturazione annuale), mentre il Professional Voice Cloning per voci di livello produzione richiede il piano Creator (22 $/mese) o superiore.

Posso clonare la voce di qualcun altro con ElevenLabs?

Solo con autorizzazione esplicita, e le regole variano in base al metodo. L'Instant Voice Cloning ti consente di clonare qualsiasi voce per cui sei autorizzato, ma il Professional Voice Cloning è limitato alla tua voce e richiede una registrazione di verifica dal vivo (anche con consenso). Usare una voce clonata per impersonificazione o frode è illegale nella maggior parte delle giurisdizioni.

Qual &egrave; la differenza tra Instant e Professional Voice Cloning?

Instant Voice Cloning (IVC) produce un clone utilizzabile in pochi secondi partendo da appena 1–2 minuti di audio ed è ideale per i prototipi, anche se può perdere sfumature sottili. Professional Voice Cloning (PVC) addestra un modello dedicato su 30 minuti fino a 3 ore di audio e impiega alcune ore per l'elaborazione, offrendo un risultato molto più accurato e pronto per la produzione. Usa IVC per test rapidi e PVC quando conta la qualità.

Posso usare la mia voce personalizzata di ElevenLabs fuori dalla piattaforma?

Non direttamente. I cloni vocali non possono essere esportati e funzionano solo all'interno di ElevenLabs. Puoi comunque usarli ovunque la piattaforma generi audio, inclusi Text to Speech, Studio e in modo programmatico tramite l'API di ElevenLabs e l'SDK Python, che è come la maggior parte integra una voce personalizzata nelle proprie app o pipeline.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Sono una data scientist con esperienza in analisi spaziale, machine learning e pipeline dei dati. Ho lavorato con GCP, Hadoop, Hive, Snowflake, Airflow e altri processi di data science/engineering.

Argomenti

Impara l'AI con DataCamp!

Programma

Sviluppare applicazioni AI

21 h
Impara a creare applicazioni basate sull'intelligenza artificiale con i più recenti strumenti per sviluppatori di AI, tra cui OpenAI API, Hugging Face e LangChain.
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro