Hoppa till huvudinnehållet

ElevenLabs röstkloning: En praktisk guide till VoiceLab

Lär dig klona din röst med Instant och Professional Voice Cloning i ElevenLabs – från att spela in rent ljud till att generera tal via Python SDK.
Uppdaterad 3 aug. 2026  · 13 min läsa

Utforska med AI

Öppna i ChatGPTÖppna i ClaudeÖppna i Perplexity

Du har säkert hittat en fantastisk text-till-tal-röst tidigare, bara för att upptäcka att full användning ligger bakom en dyrare nivå, att du inte kan få den att låta som ditt varumärke och definitivt inte kan kalla den din egen. Där tar det oftast stopp för många med röst-AI. ElevenLabs VoiceLab är där det förändras.

I den här guiden går jag igenom alla tre verktygen i ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) och Professional Voice Cloning (PVC). Vi tar det steg för steg, och jag visar exakt vad du kan förvänta dig i varje steg.

Innan vi börjar, detta behöver du:

  • Ett gratis ElevenLabs-konto räcker för Voice Design
  • Starter-plan ($6/månad) krävs för Instant Voice Cloning
  • Creator-plan ($22/månad) krävs för Professional Voice Cloning

När vi är klara har du minst en anpassad röst sparad i ditt bibliotek, redo att använda i Speech Synthesis (Text to Speech), Studio eller till och med via API.

Vad är ElevenLabs VoiceLab?

På en övergripande nivå är VoiceLab ElevenLabs dedikerade svit för att skapa och hantera anpassade röster. Det är dit du går när du vill ha något originellt, inte bara något förbyggt.

Här är en snabb jämförelse av de tre VoiceLab‑verktygen:

Verktyg

Vad det gör

Kvalitet

Krav på input

Tid att skapa

Krävd plan

Bästa användningsfall

Voice Design

Genererar syntetiska röster

Bra

Ingen

Omedelbart

Gratis

Experimentering

IVC

Klonar röst från kort ljud

Bra

~1–5 min ljud

Omedelbart

Starter+

Prototyper

PVC

Högkvalitativ röstkloning

Utmärkt

30 min till 3+ timmar

1–2 dagar

Creator+

Produktion

Om du vill fördjupa dig i att använda röster programmatiskt rekommenderar jag vår guide till ElevenLabs API.

VoiceLab vs. Voice Library

Det är viktigt att inte förväxla detta med Voice Library.

  • Voice Library: Bläddra bland och använd färdiga röster
  • VoiceLab: Skapa och hantera dina egna röster

När du skapat en röst i VoiceLab kan du om du vill publicera den i Voice Library för andra att använda. Men som standard förblir den privat i ditt konto.

Konfigurera ditt ElevenLabs-konto

Det är enkelt att komma igång. 

  1. Gå till elevenlabs.io
  2. Klicka på Sign Up
  3. Använd Google eller e‑post
  4. Välj din första plattform. Välj Eleven Creative för att fokusera på verktygen för röstskapande.

Välj mellan ElevenCreative och ElevenAgents

  1. Verifiera ditt konto

När du är inne, navigera till VoiceLab‑området:

  • Klicka på Voices i vänsterspalten.
  • Klicka på + Create Voice

ElevenLabs VoiceLab Voices

Du ser fyra alternativ:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Alternativ för att skapa röst

Observera att inte alla dessa funktioner är tillgängliga för alla nivåer. Kontrollera tabellen nedan för att se vad som är tillgängligt på varje nivå:

Plan

Voice Design

IVC

PVC

Kommersiell licens

Free

Ja

Nej

Nej

Nej

Starter

Ja

Ja

Nej

Ja

Creator

Ja

Ja

Ja

Ja

Skapa en syntetisk röst med Voice Design

Voice Design är det enklaste stället att börja på. Du behöver inga inspelningar. Det genererar en röst från grunden. Det är också det enda alternativet som finns i gratisplanen, vilket gör det perfekt för nybörjare.

Arbetsflödet är enkelt:

  1. Skriv en prompt med några nyckelinställningar
  2. Generera
  3. Förhandsgranska
  4. Spara

Ett tips från erfarenhet: generera minst 5 till 10 variationer innan du väljer en. Även med samma inställningar varierar resultaten en hel del. För att komma igång, klicka på Voice Design‑knappen i menyn Create Voice. Detta öppnar en meny där du kan skriva en prompt för din röst.

Voice Design-prompt

Du kan trycka på Settings för att justera två detaljer:

  • Loudness: hur hög rösten blir när den genereras. 
  • Guidance level: liknar temperatur i andra modeller och anger hur nära AI:n ska följa din prompt. Högre guidance betyder att den håller sig mer strikt till det du säger. Lägre guidance ger den mer frihet.

Justera loudness och guidance-skala

Du kan låta AI-agenten ha sin egen förhandsvisningstext, eller så kan du ge den ditt eget manus genom att stänga av inställningen och lägga in din egen text i rutan för förhandsvisningstext.

Förhandsvisningstext

Att prompta röstparametrar

Du vill använda promptytan för att generera dina konfigurationer. Prova följande promptmall för att ringa in specifika parametrar du vill ha:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Varje parameter påverkar resultatet:

  • VoiceLabs är flerspråkigt, så språk avgör röstens språkliga tonalitet
  • Accent ändrar uttalsmönster
  • Ålder påverkar tonhöjd och klang
  • Kön påverkar röstomfång
  • Kvalitetsnivån avgör hur rent ljudet låter

Det intressanta är hur dessa kombineras. Ibland ger oväntade kombinationer bäst resultat, så det är värt att experimentera.

Generera, förhandsgranska och spara

Klicka på Generate voice, så skapar ElevenLabs ett kort prov.

Exempel på genererade röster

Du kan generera om hur många gånger du vill. Varje version blir lite annorlunda.

När du hittar en du gillar:

  • Klicka på Save

  • Använd ett beskrivande namn som narrator_us_male_30s

Efter att ha sparat visas rösten under My Voices och i rullgardinsmenyn för Speech Synthesis.

Klona en röst med Instant Voice Cloning (IVC)

Instant Voice Cloning låter dig återskapa en röst med bara ett litet ljudprov. Det går snabbt och är förvånansvärt effektivt, om än inte perfekt. Kom ihåg att du behöver minst planen Starter ($6/mån) för detta.

Viktigt: klona bara röster du har tillåtelse att använda. Plattformen kräver att du bekräftar detta, och det ska tas på allvar. Hela flödet är ganska rakt på sak:

  • Förbered ditt ljud
  • Ladda upp ljudet
  • Namnge och spara din röstklon
  • Testa i Text to Speech

Förbereda ditt ljudprov

Du vill att ditt ljud ska ha rätt längd, rätt format och hyfsad kvalitet. Minimilängden är omkring en minut, men jag har märkt att 3 till 5 minuter ger betydligt bättre resultat.

Du bör ladda upp antingen MP3- eller WAV‑filer under 50 MB, och du kan alltid ladda upp flera filer samtidigt. 

För att säkerställa bästa möjliga kloning och god ljudkvalitet rekommenderar jag följande vid inspelning:

  • Tyst rum
  • Inget bakgrundsbrus
  • Konsekvent mikrofonavstånd

Se till att undvika följande:

  • Flera talare
  • Telefoninspelningar
  • Tung efterbearbetning

Ladda upp och skapa klonen

Gå tillbaka till din Voices‑instrumentpanel och gör följande:

  1. Klicka på + Create Voice
  2. Välj Instant Voice Cloning
  3. Ladda upp ditt ljud och klicka på Next

Instant Voice Clone

  1. Namnge din röst, lägg eventuellt till etiketter och en beskrivning
  2. Bekräfta samtycke
  3. Klicka på Save Voice

Följande etiketter kan väljas från en rullgardinsmeny:

  • Language
  • Accent (öppnar alternativ beroende på språk)
  • Gender
  • Age (alternativ: young, middle-aged eller old)

Rösten är redo direkt, och du kan testa den på en gång i text‑till‑tal‑generatorn. Prova några olika meningar och notera var den låter naturlig och var den har svårt.

För att göra detta, klicka på Text to Speech i vänsterspalten. (Observera att vissa versioner har kallat detta Speech Synthesis.)

Text to Speec

Detta öppnar ett fönster med en liknande textruta för prompt. 

Text to Speech-fönster

Till höger, klicka på rullgardinsmenyn Voice och välj din röst i fönstret My Voices.

Val av röst

Skriv en testmening och klicka på Generate speech.

Generera tal

Detta genererar ett ljudprov med din valda röst. Justera gärna inställningarna till höger efter dina preferenser. Du kan justera inställningar som:

  • Hastighet
  • Stability
  • Similarity
  • Style Exaggeration 

Att välja olika modeller kan också ge olika alternativ!

Justera genererat tal

För att spara din fil, klicka på nedladdningsknappen till höger för att spara det genererade ljudet.

Spara genererat tal

Bygga en högupplöst klon med Professional Voice Cloning (PVC)

Om IVC ger dig en grov approximation, ger PVC något mycket närmare originalet. Här fångar du nyanser som takt, andning och känsla.

Det kräver Creator‑planen ($22/mån). Enligt ElevenLabs tar bearbetningen vanligtvis 2 till 6 timmar, men den totala träningstiden kan vara upp till 24 timmar beroende på serverbelastning. 

Det är det mest relevanta alternativet om vi försöker bygga röstresurser för produktion. Tänk berättarröster, ljudböcker och varumärkesröstagenter. Saker som kan få kommersiell eller bred användning.

Spela in och kurera din träningsdata

Eftersom vi försöker skapa den bästa möjliga modellen har kraven ökat. Till exempel är minsta inspelningstid 30 minuter rent ljud, men för bästa resultat, sikta på 3+ timmar. Det bästa sättet att skicka in så mycket ljud är att dela upp det i 30‑minutersprov.

Här är några tips för att få ut mesta möjliga av din inspelning:

  • Använd en tyst inspelningsmiljö
  • Försök använda en bra mikrofon
  • Inkludera varierat innehåll, läs inte bara från en enda källtext

Du kan till exempel variera din berättarstil:

  • Använd olika typer av dialog. Läs några instruktiva texter. 
  • Gå igenom några siffror och en lista. Detta ger stor variation i uttal och syntax. 
  • Utöver det, försök spela in rösten i olika tempon, med olika känslor och så vidare. Mer uttryck och stil hjälper till att bygga en bättre modell.

Undvik som alltid dålig ljudkvalitet som följande:

  • Bakgrundsbrus
  • Tung komprimering
  • Utfyllnadsord som ”öh” och ”um”

Skicka in och vänta på träning

När du är klar med att förbereda ljudet är stegen ganska enkla:

  1. Välj Professional Voice Clone
  2. Klicka på knappen Create new clone

Skapa en Professional Voice Clone

  1. Ladda upp alla inspelningar, fyll i namn, språk och andra etiketter

PVC-detaljer

  1. Fyll i samtyckesuppgifter
  2. Skicka in

Innan ElevenLabs tränar din klon måste du bevisa att rösten faktiskt är din.

Detta är den stora skillnaden mot IVC: professionell kloning låter dig bara klona din egen röst, så du kan inte klona någon annans, ens med deras samtycke. Om en kollega vill låna ut sin röst måste hen skapa och verifiera PVC i sitt eget konto och sedan dela den med dig via en privat delningslänk.

Verifieringen är en kort livespelning. Du läser några rader på skärmen i din mikrofon. Två saker avgör det hela:

  • Använd samma eller mycket liknande utrustning som du använde för att spela in dina prover, och behåll en liknande ton och leverans. En mismatch här är det vanligaste felet.
  • Läs varje rad bara en gång och tryck sedan på Stop. Att läsa den fler gånger kan göra att verifieringen misslyckas.

Om det misslyckas kan du vänta 24 timmar och försöka igen, eller kontakta support. En heads‑up: när du väl når verifieringssteget är klonen låst. Du kan inte själv radera en overifierad PVC, så se till att dina prover är rätt innan du kommer hit.

Du får en avisering när din röstklon är klar! När så är fallet är ett bra knep att jämföra dina IVC‑ och PVC‑utdata med samma mening. Skillnaden är vanligtvis mycket tydlig.

Använda dina VoiceLab‑röster i projekt

När din röst är sparad blir den tillgänglig över hela plattformen, överallt där ElevenLabs genererar ljud.

Du kan använda den i:

  • Text to Speech (Speech Synthesis) för snabb generering
  • Studio för långsiktiga projekt
  • Python‑API för programmatisk användning

Jag går igenom hur vi kan använda din röst i vart och ett av dessa verktyg. Beginner’s Guide to the ElevenLabs API är det bästa sättet att komma igång med Python‑API:et.

Använda anpassade röster i Text to Speech och Studio

I Text to Speech behöver du bara välja din röst i rullgardinsmenyn Voices -> My Voices som vi nämnde ovan.

Några justeringstips för verktyget Text to Speech:

  • Börja med Stability på 40 till 50 procent
  • Sätt Similarity runt 75 procent
  • Justera baserat på resultatet

Det kan ta några försök att få exakt den röst och inspelning du vill ha, men ju mer du experimenterar, desto bättre förstår du talgenereringsprocessen.

I Studio är det snarlikt. Börja med att gå till Studio i vänsterspalten och välj sedan + New Blank Project. Därefter kan du välja typ av projekt:

  • Audio Project eller
  • Video Project

Ett ljudprojekt är precis det; det låter dig skapa långformat samtalsinnehåll med flera röster. Ett videoprojekt kräver att du först laddar upp en video, där du sedan kan lägga till röster för voice‑over.

Studio‑ljudprojektet låter dig skapa en ljudfil med flera talare. Detta kan vara utmärkt för att generera poddar eller samtalsinnehåll. Även ljudboksinnehåll där du vill ha olika röster eller olika karaktärer. 

Studions ljudinstrumentpanel är en tom duk för dig att arbeta på. Vi fokuserar på den viktiga röstkomponenten här, men utforska gärna.

Ljudprojekt i Studio

Till vänster ser du en röstsektion som är förvald åt dig. När du skriver i promptytan markeras karaktärens repliker åt dig.

Skapa nytt stycke

När du går till nästa rad kan du välja en annan röst och ha en annan karaktär. Varje rad är ett ”stycke”:

Välja röst för ett stycke

Gränserna är ganska generösa i Studio. Varje projekt kan ha upp till 500 kapitel, vart och ett med upp till 400 stycken. Varje stycke kan ha upp till 5 000 tecken.

Antalet projekt du kan ha beror på din nivå:

  • Free: 5 projekt
  • Starter: 20 projekt
  • Creator: 1 000 projekt

Följ samma steg, men välj den här gången ett videoprojekt. Du tas till en tom duk och ombeds ladda upp en video:Videoprojekt i Studio

När du laddat upp ett videoklipp kan du se det till vänster och trycka på play för att förhandsgranska. Du kan lägga till flera videor vid behov.

Gå sedan till vänster och välj Speech.

Videoprojektfiler

Precis som i ett ljudprojekt kan du välja flera röster och skriva de meningar du vill ha. När du skriver kan du trycka på Enter för att gå till en ny rad. Det är möjligt att välja olika röster för varje rad för att skapa en konversation.

Lägg till röst i en video

Längst ned kan du enkelt justera tidsramarna för varje rad genom att dra och släppa dem på tidslinjen.

Videoredigering med genererat tal

Om du inte har foton eller video kan du generera dem via fliken Video till vänster. Du skriver helt enkelt en prompt som sedan genererar den bild eller video du vill ha. 

Observera att du först måste acceptera beta‑villkoren för Image och Video. Gratisanvändare får bara generera bilder; du måste ha minst en Starter‑medlemskap ($5/mån) för att generera video.

Generera video

Komma åt anpassade röster via ElevenLabs Python SDK

För att använda Python SDK måste du först ha Python installerat. Skapa sedan en Python‑miljö där du kan installera ElevenLabs SDK med följande: pip install "elevenlabs[pyaudio]"

Gå därefter till din ElevenLabs‑utvecklarpanel genom att klicka längst ned i vänsterspalten och välja API Keys -> Create Key.

ElevenLabs utvecklarkonsol

Du väljer sedan vilka verktyg du vill ge API‑åtkomst och klickar på Create Key.

Skapa API‑nyckel

Detta öppnar en API‑nyckel som du måste kopiera, annars förlorar du den för alltid.

Skapad API‑nyckel

Spara sedan API‑nyckeln i en .env-fil på en säker plats eller i en projektmapp.

Gå därefter till din Voices‑instrumentpanel och välj My Voices. Kopiera Voice ID för din röst. Spara det gärna någonstans där du enkelt kommer åt det senare.

Kopiera röst-ID

Nu kan du skapa ett skript för att köra din ElevenLabs‑röst! Här är ett enkelt exempel:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Slutsats

VoiceLab erbjuder tre vägar att välja mellan, beroende på dina behov. Voice Design är perfekt för att experimentera, Instant Voice Cloning är utmärkt för snabba prototyper och Professional Voice Cloning är dit du vänder dig för kvalitet på produktionsnivå.

Om du precis börjar rekommenderar jag att du håller dig till Voice Design först. Uppgradera bara när du har ett tydligt användningsfall.

Om du vill fördjupa dig i att bygga AI‑drivna applikationer, kolla in vårt kompetensspår Developing AI Applications, som lär dig använda de senaste AI‑utvecklarverktygen, inklusive OpenAI API, Hugging Face och LangChain.

ElevenLabs VoiceLab – vanliga frågor

Är ElevenLabs gratis att använda?

Ja. Gratisplanen ger dig cirka 10 000 krediter per månad (ungefär 10 minuters ljud) plus Voice Design och det färdiga röstbiblioteket. Men den kan inte användas kommersiellt och inkluderar inte röstkloning; du behöver minst Starter‑planen för Instant Voice Cloning och en kommersiell licens.

Behöver jag en betald plan för att använda ElevenLabs‑röster kommersiellt?

Ja. Gratisplanen kräver ElevenLabs‑attribuering och ger inga kommersiella rättigheter, så du kan inte tjäna pengar på det ljudet. En kommersiell licens börjar med Starter‑planen (kring $6/månad, eller $5 vid årlig debitering), medan Professional Voice Cloning för produktionsklara röster kräver Creator‑planen ($22/månad) eller högre.

Kan jag klona någon annans röst med ElevenLabs?

Endast med uttryckligt tillstånd, och reglerna skiljer sig beroende på metod. Instant Voice Cloning låter dig klona vilken röst som helst som du har tillstånd att använda, men Professional Voice Cloning är begränsad till din egen röst och kräver en live verifieringsinspelning (även med samtycke). Att använda en klonad röst för personifiering eller bedrägeri är olagligt i de flesta jurisdiktioner.

Vad är skillnaden mellan Instant och Professional Voice Cloning?

Instant Voice Cloning (IVC) ger en användbar klon på sekunder från bara 1–2 minuters ljud och är idealisk för prototyper, även om den kan missa subtila nyanser. Professional Voice Cloning (PVC) tränar en dedikerad modell på 30 minuter till 3 timmar ljud och tar några timmar att bearbeta, vilket ger ett betydligt mer exakt, produktionsklart resultat. Använd IVC för att testa snabbt och PVC när kvaliteten är avgörande.

Kan jag använda min anpassade ElevenLabs‑röst utanför plattformen?

Inte direkt. Röstkloner kan inte exporteras och fungerar bara inne i ElevenLabs. Du kan fortfarande använda dem var som helst på plattformen där ljud genereras, inklusive Text to Speech, Studio och programmatiskt via ElevenLabs API och Python SDK, vilket är hur de flesta kopplar en anpassad röst till sina egna appar eller pipelines.

Ämnen

Lär dig AI med DataCamp!

track

Utveckla AI-applikationer

21 timmar
Lär dig skapa AI-drivna applikationer med de senaste AI-utvecklarverktygen, inklusive OpenAI API, Hugging Face och LangChain.
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow