Lernpfad
Wahrscheinlich hast du schon einmal eine starke Text-to-Speech-Stimme gefunden – nur um festzustellen, dass die volle Nutzung hinter einem teureren Tarif steckt, sie nicht zu deiner Marke passt und du sie schon gar nicht als deine eigene bezeichnen kannst. Genau hier stoßen viele mit Voice-KI an Grenzen. ElevenLabs VoiceLab ändert das.
In diesem Guide führe ich dich durch alle drei Tools im ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) und Professional Voice Cloning (PVC). Wir gehen Schritt für Schritt vor, damit du genau weißt, was dich in jeder Phase erwartet.
Bevor wir loslegen, das brauchst du:
- Ein kostenloses ElevenLabs-Konto reicht für Voice Design
- Starter-Plan (6 $/Monat) ist erforderlich für Instant Voice Cloning
- Creator-Plan (22 $/Monat) ist erforderlich für Professional Voice Cloning
Am Ende hast du mindestens eine eigene Stimme in deiner Bibliothek gespeichert – einsatzbereit für Speech Synthesis (Text to Speech), Studio oder sogar über die API.
Was ist das ElevenLabs VoiceLab?
Kurz gesagt ist VoiceLab die spezialisierte Suite von ElevenLabs zum Erstellen und Verwalten individueller Stimmen. Hier bekommst du etwas Eigenes – nicht nur eine vorgefertigte Stimme.
Hier ein schneller Vergleich der drei VoiceLab-Tools:
|
Tool |
Aufgabe |
Qualität |
Erforderlicher Input |
Erstellungszeit |
Benötigter Plan |
Beste Anwendung |
|
Voice Design |
Erzeugt synthetische Stimmen |
Gut |
Keine |
Sofort |
Kostenlos |
Experimente |
|
IVC |
Klonen aus kurzem Audio |
Gut |
~1–5 Min Audio |
Sofort |
Starter+ |
Prototypen |
|
PVC |
Hochwertiges Voice Cloning |
Exzellent |
30 Min bis 3+ Std |
1–2 Tage |
Creator+ |
Produktion |
Wenn du tiefer in die programmatische Nutzung einsteigen willst, empfehle ich unseren Guide zur ElevenLabs API.
Arbeiten mit der OpenAI API
VoiceLab vs. Voice Library
Verwechsele das nicht mit der Voice Library.
- Voice Library: Vorgefertigte Stimmen durchsuchen und nutzen
- VoiceLab: Eigene Stimmen erstellen und verwalten
Wenn du im VoiceLab eine Stimme erstellst, kannst du sie optional in der Voice Library veröffentlichen. Standardmäßig bleibt sie jedoch privat in deinem Konto.
Dein ElevenLabs-Konto einrichten
Der Einstieg ist unkompliziert.
- Gehe auf elevenlabs.io
- Klicke auf Sign Up
- Mit Google oder E-Mail registrieren
- Wähle deine Startplattform. Nimm Eleven Creative, um dich auf die Stimmerstellungstools zu konzentrieren.

- Bestätige dein Konto
Sobald du drin bist, wechsle in den VoiceLab-Bereich:
- Klicke in der linken Seitenleiste auf Voices.
- Klicke auf + Create Voice

Du siehst vier Optionen:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Beachte, dass nicht alle Funktionen in allen Tarifen verfügbar sind. Die folgende Tabelle zeigt dir, was pro Tarif enthalten ist:
|
Plan |
Voice Design |
IVC |
PVC |
Kommerzielle Lizenz |
|
Free |
Ja |
Nein |
Nein |
Nein |
|
Starter |
Ja |
Ja |
Nein |
Ja |
|
Creator |
Ja |
Ja |
Ja |
Ja |
Eine synthetische Stimme mit Voice Design erstellen
Voice Design ist der einfachste Einstieg. Du brauchst keine Aufnahmen – die Stimme wird von Grund auf generiert. Es ist außerdem die einzige Option im kostenlosen Plan und damit ideal für den Start.
So läuft es ab:
- Schreibe einen Prompt mit Schlüsseleinstellungen
- Generieren
- Vorhören
- Speichern
Praxistipp: Erzeuge mindestens 5 bis 10 Varianten, bevor du dich entscheidest. Selbst mit gleichen Einstellungen fallen die Ergebnisse recht unterschiedlich aus. Klicke zum Start auf den Voice Design-Button im Menü Create Voice. Dann öffnet sich ein Feld für deinen Prompt.

Unter Settings kannst du zwei Punkte anpassen:
- Loudness: Wie laut die Stimme generiert wird.
- Guidance level: Ähnlich wie die Temperatur bei anderen Modellen. Bestimmt, wie exakt die KI deinem Prompt folgt. Höhere Guidance = hält sich strenger daran, niedrigere Guidance = mehr Freiheit.

Du kannst einen eigenen Vorschautext eingeben oder den KI-Agenten eigenen Text vorschlagen lassen, indem du die Einstellung deaktivierst und deinen Text in das Vorschautextfeld schreibst.

Stimmenparameter per Prompt steuern
Nutze den Prompt-Bereich, um deine Konfigurationen zu definieren. Probiere diese Prompt-Vorlage, um gezielt Parameter festzulegen:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Jeder Parameter beeinflusst das Ergebnis:
- VoiceLab ist mehrsprachig – die Sprache bestimmt die Klangfarbe
- Akzent verändert die Aussprachemuster
- Alter beeinflusst Höhe und Timbre
- Geschlecht wirkt sich auf die Stimmlage aus
- Die Qualitätsstufe bestimmt, wie sauber das Audio klingt
Spannend wird es in der Kombination. Unerwartete Mixes liefern oft die besten Ergebnisse – Experimentieren lohnt sich.
Generieren, vorhören und speichern
Klicke auf Generate voice, und ElevenLabs erzeugt ein kurzes Sample.

Du kannst beliebig oft neu generieren. Jede Version klingt leicht anders.
Wenn du eine passende Variante gefunden hast:
-
Auf Save klicken
-
Einen aussagekräftigen Namen vergeben, z. B.
narrator_us_male_30s
Nach dem Speichern erscheint die Stimme unter My Voices und im Dropdown von Speech Synthesis.
Eine Stimme mit Instant Voice Cloning (IVC) klonen
Mit Instant Voice Cloning kannst du eine Stimme mit nur einem kleinen Audiosample replizieren. Das geht schnell und wirkt überraschend gut – auch wenn es nicht perfekt ist. Dafür brauchst du mindestens den Starter-Plan (6 $/Monat).
Wichtiger Hinweis: Klone nur Stimmen, für die du die Erlaubnis hast. Die Plattform verlangt eine Bestätigung – und die solltest du ernst nehmen. Der Ablauf ist simpel:
- Audio vorbereiten
- Audio hochladen
- Stimme benennen und speichern
- In Text to Speech testen
Dein Audiosample vorbereiten
Achte auf Länge, Format und ordentliche Qualität. Minimum ist etwa eine Minute, aber 3 bis 5 Minuten liefern deutlich bessere Ergebnisse.
Lade MP3- oder WAV-Dateien unter 50 MB hoch; du kannst mehrere Dateien gleichzeitig nutzen.
Für bestmögliches Klonen und gute Qualität empfehle ich beim Aufnehmen:
- Ruhiger Raum
- Kein Hintergrundrauschen
- Konstanter Mikrofonabstand
Vermeide Folgendes:
- Mehrere Sprecher
- Telefonaufnahmen
- Starkes Post-Processing
Hochladen und Clone erstellen
Gehe zurück zu deinem Voices-Dashboard und folge diesen Schritten:
- Klicke auf + Create Voice
- Wähle Instant Voice Cloning
- Lade dein Audio hoch und klicke auf Next

- Benenne deine Stimme, füge optional Labels und eine Beschreibung hinzu
- Bestätige die Zustimmung
- Klicke auf Save Voice
Folgende Labels stehen im Dropdown zur Auswahl:
- Language
- Accent (Optionen abhängig von der Sprache)
- Gender
- Age (young, middle-aged, old)
Die Stimme ist sofort einsatzbereit, und du kannst sie direkt im Text-to-Speech-Generator testen. Probiere mehrere Sätze und achte darauf, wo sie natürlich klingt und wo nicht.
Dafür klickst du links auf Text to Speech. (In einigen Versionen heißt das Speech Synthesis.)

Es öffnet sich ein Fenster mit einem ähnlichen Texteingabefeld.

Rechts öffnest du das Voice-Dropdown und wählst deine Stimme unter My Voices aus.

Schreibe einen Testsatz und klicke auf Generate speech.

Damit erzeugst du ein Audio mit deiner gewählten Stimme. Passe die Einstellungen rechts nach Bedarf an. Du kannst u. a. folgende Parameter verändern:
- Speed
- Stability
- Similarity
- Style Exaggeration
Auch unterschiedliche Modelle bieten teils andere Optionen!

Zum Speichern klickst du rechts auf das Download-Symbol und sicherst das generierte Audio.

Einen High-Fidelity-Clone mit Professional Voice Cloning (PVC) erstellen
Wenn IVC eine grobe Näherung liefert, kommt PVC dem Original deutlich näher. Hier werden Nuancen wie Sprechtempo, Atem und Emotion eingefangen.
Dafür brauchst du den Creator-Plan (22 $/Monat). Laut ElevenLabs dauert die Verarbeitung in der Regel 2 bis 6 Stunden, das gesamte Training kann je nach Serverlast bis zu 24 Stunden beanspruchen.
Das ist die beste Option, wenn du produktionsreife Sprachassets erstellen willst – etwa für Vertonung, Hörbücher oder gebrandete Voice-Agents. Also alles, was kommerziell oder breit genutzt wird.
Aufnahmen erstellen und Trainingsdaten kuratieren
Weil wir das bestmögliche Modell wollen, steigen die Anforderungen. Mindestdauer sind 30 Minuten sauberes Audio, optimal sind 3+ Stunden. Am besten reichst du das Material in 30-Minuten-Segmenten ein.
Tipps für die Aufnahme:
- Ruhige Aufnahmeumgebung
- Gutes Mikrofon verwenden
- Inhalte variieren, nicht nur aus einer Quelle vorlesen
Beispielsweise kannst du deinen Erzählstil variieren:
- Unterschiedliche Dialogarten. Lies einige Anleitungen vor.
- Nenne Zahlen und Listen. Das sorgt für Varianz in Aussprache und Syntax.
- Zusätzlich in verschiedenen Tempi und Stimmungen sprechen. Mehr Stilvielfalt führt zu einem besseren Modell.
Wie immer gilt: Schlechte Audioqualität vermeiden:
- Hintergrundgeräusche
- Starke Kompression
- Füllwörter wie „ähm“ und „äh“
Einreichen und auf das Training warten
Sind die Audios fertig, ist der Rest einfach:
- Professional Voice Clone wählen
- Auf Create new clone klicken

- Alle Aufnahmen hochladen, Name, Sprache und Labels ausfüllen

- Einverständnis angeben
- Absenden
Bevor ElevenLabs deinen Clone trainiert, musst du beweisen, dass die Stimme wirklich dir gehört.
Das ist der große Unterschied zu IVC: Professionelles Klonen erlaubt nur das Klonen der eigenen Stimme. Du kannst also nicht die Stimme anderer klonen – auch nicht mit deren Zustimmung. Wenn eine Kollegin oder ein Kollege ihre/seine Stimme teilen will, muss sie/er den PVC im eigenen Konto erstellen und verifizieren und dir dann über einen privaten Link freigeben.
Die Verifizierung erfolgt über eine kurze Live-Aufnahme. Du liest ein paar Zeilen vom Bildschirm ins Mikro. Zwei Dinge sind dabei entscheidend:
- Nutze dasselbe oder ein sehr ähnliches Equipment wie für die Samples und halte Ton und Vortrag ähnlich. Abweichungen sind der häufigste Grund für ein Scheitern.
- Lies jede Zeile nur einmal und drücke dann Stop. Mehrfaches Lesen kann zur Ablehnung führen.
Wenn es fehlschlägt, kannst du 24 Stunden warten und es erneut versuchen oder den Support kontaktieren. Wichtig: Sobald du die Verifizierungsphase erreichst, ist der Clone gesperrt. Du kannst einen nicht verifizierten PVC nicht selbst löschen – also stell sicher, dass deine Samples passen, bevor du so weit gehst.
Du wirst benachrichtigt, sobald dein Voice-Clone fertig ist! Ein guter Test ist dann der Vergleich von IVC- und PVC-Ausgaben mit demselben Satz – der Unterschied ist meist deutlich.
Deine VoiceLab-Stimmen in Projekten nutzen
Sobald deine Stimme gespeichert ist, steht sie plattformweit überall dort zur Verfügung, wo ElevenLabs Audio erzeugt.
Du kannst sie nutzen in:
- Text to Speech (Speech Synthesis) für schnelle Outputs
- Studio für langfristige Projekte
- Python API für den programmatischen Einsatz
Ich zeige dir, wie du deine Stimme in diesen Tools verwendest. Der Beginner’s Guide to the ElevenLabs API ist der beste Einstieg in die Python API.
Eigene Stimmen in Text to Speech und Studio nutzen
In Text to Speech wählst du einfach deine Stimme im Dropdown Voices -> My Voices aus, wie oben beschrieben.
Ein paar Tuning-Tipps für Text to Speech:
- Starte mit Stability bei 40 bis 50 Prozent
- Setze Similarity auf ca. 75 Prozent
- Passe anhand des Outputs an
Es braucht eventuell ein paar Versuche, bis Stimme und Aufnahme genau passen. Je mehr du ausprobierst, desto besser verstehst du die Sprachgenerierung.
Im Studio läuft es ähnlich. Navigiere links zu Studio und wähle + New Blank Project. Danach legst du den Projekttyp fest:
- Audio Project oder
- Video Project
Ein Audioprojekt dient der Erstellung längerer Inhalte mit mehreren Stimmen. Ein Videoprojekt erfordert zuerst einen Video-Upload, den du dann mit Voice-over versehen kannst.
Audioprojekt im Studio bedienen
Das Studio-Audioprojekt erlaubt dir, eine Multi-Speaker-Audiodatei zu erstellen – ideal für Podcasts, Gespräche oder Hörbücher mit verschiedenen Stimmen und Charakteren.
Das Audiodashboard ist eine leere Arbeitsfläche. Wir konzentrieren uns hier auf die Stimmen, aber probiere gern alles aus.

Links siehst du einen vorausgewählten Stimmenbereich. Wenn du Text eingibst, wird die jeweilige Figur markiert.

In der nächsten Zeile kannst du eine andere Stimme wählen – jede Zeile ist ein „Paragraph“:

Die Limits im Studio sind hoch: Pro Projekt bis zu 500 Kapitel, jedes mit bis zu 400 Paragraphen. Pro Paragraph sind bis zu 5000 Zeichen möglich.
Die Zahl deiner Projekte hängt von deinem Tarif ab:
- Free: 5 Projekte
- Starter: 20 Projekte
- Creator: 1.000 Projekte
Videoprojekt im Studio bedienen
Wähle diesmal ein Videoprojekt. Du landest auf einer leeren Fläche und wirst gebeten, ein Video hochzuladen:
Nach dem Upload siehst du den Clip links und kannst ihn abspielen. Bei Bedarf kannst du mehrere Videos hinzufügen.
Gehe dann links auf Speech.

Wie im Audioprojekt kannst du mehrere Stimmen wählen und die Sätze eingeben. Mit Enter wechselst du zur nächsten Zeile. So kannst du pro Zeile verschiedene Stimmen für ein Gespräch kombinieren.

Unten kannst du die Zeiträume jeder Zeile per Drag-and-drop auf der Timeline anpassen.

Wenn du keine Fotos oder Videos hast, kannst du sie über den Tab Video links generieren. Schreibe einfach einen Prompt, und es werden passende Bilder oder Videos erzeugt.
Beachte: Du musst zuerst die Beta-Nutzungsbedingungen für Bilder und Videos akzeptieren. Kostenlose Mitglieder können nur Bilder generieren; für Video brauchst du mindestens den Starter-Plan (5 $/Monat).

Zugriff auf Custom Voices über das ElevenLabs Python SDK
Um das Python SDK zu nutzen, musst du zuerst Python installiert haben. Danach erstellst du eine Python-Umgebung und installierst das ElevenLabs SDK mit folgendem Befehl: pip install "elevenlabs[pyaudio]"
Gehe als Nächstes im linken Seitenmenü unten zu den Developer-Einstellungen und wähle API Keys -> Create Key.

Lege fest, auf welche Tools der API-Schlüssel Zugriff bekommt, und klicke auf Create Key.

Daraufhin erscheint ein API Key, den du unbedingt jetzt kopieren musst – sonst ist er weg.

Speichere den API-Schlüssel anschließend in einer .env-Datei an einem sicheren Ort oder im Projektordner.
Gehe danach zu deinem Voices-Dashboard und wähle My Voices. Kopiere die Voice ID deiner Stimme und lege sie griffbereit ab.

Jetzt kannst du ein Skript erstellen, das deine ElevenLabs-Stimme nutzt! Hier ein einfaches Beispiel:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Fazit
VoiceLab bietet drei Wege – je nach Bedarf. Voice Design ist ideal zum Experimentieren, Instant Voice Cloning eignet sich für schnelle Prototypen, und Professional Voice Cloning liefert Qualität für die Produktion.
Wenn du gerade erst startest, bleib zuerst bei Voice Design. Upgrade erst, wenn du einen klaren Use Case hast.
Wenn du tiefer in KI-gestützte Anwendungen einsteigen möchtest, schau dir unseren Developing AI Applications Lernpfad an. Dort lernst du die neuesten Entwickler-Tools kennen – inklusive OpenAI API, Hugging Face und LangChain.
ElevenLabs VoiceLab FAQs
Ist ElevenLabs kostenlos nutzbar?
Ja. Der kostenlose Plan bietet rund 10.000 Credits pro Monat (etwa 10 Minuten Audio) plus Voice Design und die Stock Voice Library. Er ist jedoch nicht für die kommerzielle Nutzung freigegeben und enthält kein Voice Cloning; für Instant Voice Cloning und eine kommerzielle Lizenz brauchst du mindestens den Starter-Plan.
Brauche ich einen kostenpflichtigen Plan, um ElevenLabs-Stimmen kommerziell zu nutzen?
Ja. Im Free-Plan ist eine ElevenLabs-Nennung erforderlich und es gibt keine kommerziellen Rechte – du darfst dieses Audio also nicht monetarisieren. Eine kommerzielle Lizenz gibt es ab dem Starter-Plan (ca. 6 $/Monat bzw. 5 $ bei jährlicher Abrechnung). Professional Voice Cloning für produktionsreife Stimmen setzt den Creator-Plan (22 $/Monat) oder höher voraus.
Darf ich die Stimme einer anderen Person mit ElevenLabs klonen?
Nur mit ausdrücklicher Erlaubnis – und die Regeln unterscheiden sich je nach Methode. Instant Voice Cloning erlaubt das Klonen jeder Stimme, deren Nutzung du autorisiert bist. Professional Voice Cloning ist auf die eigene Stimme beschränkt und erfordert eine Live-Verifizierung (auch mit Einverständnis Dritter). Der Einsatz geklonter Stimmen zur Täuschung oder zu Betrug ist in den meisten Rechtsräumen illegal.
Was ist der Unterschied zwischen Instant und Professional Voice Cloning?
Instant Voice Cloning (IVC) erzeugt in Sekunden einen brauchbaren Clone aus nur 1–2 Minuten Audio und eignet sich ideal für Prototypen, verfehlt aber oft subtile Nuancen. Professional Voice Cloning (PVC) trainiert ein dediziertes Modell auf 30 Minuten bis 3 Stunden Audio und benötigt einige Stunden Verarbeitung – das Ergebnis ist deutlich genauer und produktionsreif. Nutze IVC für schnelle Tests und PVC, wenn die Qualität zählt.
Kann ich meine eigene ElevenLabs-Stimme außerhalb der Plattform nutzen?
Nicht direkt. Voice-Clones lassen sich nicht exportieren und funktionieren nur innerhalb von ElevenLabs. Du kannst sie aber überall dort nutzen, wo die Plattform Audio erzeugt – inklusive Text to Speech, Studio sowie programmatisch über die ElevenLabs API und das Python SDK. So binden die meisten ihre Custom Voice in eigene Apps oder Pipelines ein.
Ich bin Datenwissenschaftler mit Erfahrung in räumlicher Analyse, maschinellem Lernen und Datenpipelines. Ich habe mit GCP, Hadoop, Hive, Snowflake, Airflow und anderen Data Science/Engineering-Prozessen gearbeitet.

