Przejdź do głównej treści

Klonowanie głosu w ElevenLabs: praktyczny przewodnik po VoiceLab

Naucz się klonować swój głos za pomocą Instant i Professional Voice Cloning w ElevenLabs — od nagrywania czystego audio po generowanie mowy przez Python SDK.
Zaktualizowano 3 sie 2026  · 13 min Czytać

Eksploruj z AI

Otwórz w ChatGPTOtwórz w ClaudeOtwórz w Perplexity

Pewnie nie raz trafiłeś na świetny głos TTS, tylko po to, by odkryć, że pełne użycie jest zablokowane w droższym planie, nie da się go dopasować do twojej marki, a tym bardziej nazwać go swoim. W tym miejscu większość osób odbija się od ściany w pracy z voice AI. VoiceLab od ElevenLabs to moment, w którym to się zmienia.

W tym przewodniku przeprowadzę cię przez trzy narzędzia w ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) i Professional Voice Cloning (PVC). Przejdziemy wszystko krok po kroku, a ja pokażę ci dokładnie, czego się spodziewać na każdym etapie.

Zanim zaczniemy, oto czego potrzebujesz:

  • Darmowe konto ElevenLabs wystarczy do Voice Design
  • Plan Starter (6$ / miesiąc) jest wymagany do Instant Voice Cloning
  • Plan Creator (22$ / miesiąc) jest wymagany do Professional Voice Cloning

Na końcu będziesz mieć przynajmniej jeden własny głos zapisany w bibliotece, gotowy do użycia w Speech Synthesis (Text to Speech), Studio lub nawet przez API.

Czym jest ElevenLabs VoiceLab?

W skrócie VoiceLab to pakiet narzędzi ElevenLabs do tworzenia i zarządzania własnymi głosami. Trafiasz tu, gdy chcesz czegoś oryginalnego, a nie tylko gotowców.

Szybkie porównanie trzech narzędzi VoiceLab:

Narzędzie

Co robi

Jakość

Wymagane dane wejściowe

Czas tworzenia

Wymagany plan

Najlepsze zastosowanie

Voice Design

Generuje syntetyczne głosy

Dobra

Brak

Natychmiast

Darmowy

Eksperymenty

IVC

Klonuje głos z krótkiego nagrania

Dobra

~1–5 min audio

Natychmiast

Starter+

Prototypy

PVC

Wysokiej wierności klonowanie głosu

Znakomita

30 min do 3+ godzin

1–2 dni

Creator+

Produkcja

Jeśli chcesz wejść głębiej w programistyczne użycie głosów, polecam nasz przewodnik po API ElevenLabs.

VoiceLab a Voice Library

Ważne, by nie mylić tego z Voice Library.

  • Voice Library: Przeglądaj i używaj gotowych głosów
  • VoiceLab: Twórz i zarządzaj własnymi głosami

Gdy stworzysz głos w VoiceLab, możesz opcjonalnie opublikować go w Voice Library, by inni mogli go używać. Domyślnie jednak pozostaje prywatny na twoim koncie.

Konfiguracja konta ElevenLabs

Start jest prosty. 

  1. Wejdź na elevenlabs.io
  2. Kliknij Sign Up
  3. Użyj Google lub e-maila
  4. Wybierz początkową platformę. Wybierz Eleven Creative, by skupić się na narzędziach do tworzenia głosu.

Wybierz między ElevenCreative a ElevenAgents

  1. Zweryfikuj konto

Gdy już jesteś w środku, przejdź do sekcji VoiceLab:

  • Kliknij Voices w lewym pasku bocznym.
  • Kliknij + Create Voice

ElevenLabs VoiceLab Voices

Zobaczysz cztery opcje:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Opcje tworzenia głosu

Pamiętaj, że nie wszystkie funkcje są dostępne w każdym planie. Sprawdź tabelę poniżej, aby zobaczyć, co jest dostępne w poszczególnych progach:

Plan

Voice Design

IVC

PVC

Licencja komercyjna

Darmowy

Tak

Nie

Nie

Nie

Starter

Tak

Tak

Nie

Tak

Creator

Tak

Tak

Tak

Tak

Tworzenie syntetycznego głosu w Voice Design

Voice Design to najprostszy punkt startowy. Nie potrzebujesz żadnych nagrań. Głos generowany jest od zera. To też jedyna opcja dostępna w darmowym planie, co czyni ją idealną dla początkujących.

Schemat pracy jest prosty:

  1. Napisz prompt z kluczowymi ustawieniami
  2. Wygeneruj
  3. Przesłuchaj
  4. Zapisz

Z doświadczenia: wygeneruj co najmniej 5–10 wariantów przed wyborem. Nawet przy tych samych ustawieniach wyniki potrafią się mocno różnić. Na początek kliknij przycisk Voice Design w menu Create Voice. Otworzy się okno do wpisania promptu dla twojego głosu.

Prompt Voice Design

Możesz kliknąć Settings, by ustawić dwie rzeczy:

  • Loudness: jak głośny będzie wygenerowany głos. 
  • Guidance level: podobne do temperatury w innych modelach — określa, jak ściśle AI ma trzymać się twojego promptu. Wyższe guidance = większa zgodność; niższe = więcej swobody.

Dopasuj głośność i guidance

Możesz pozwolić agentowi AI użyć własnego tekstu podglądu lub podać własny skrypt, wyłączając to ustawienie i wklejając swój tekst w polu podglądu.

Tekst podglądu

Parametry w promptach dla głosu

W polu promptu ustawisz konfiguracje. Spróbuj użyć poniższego szablonu promptu, by wskazać konkretne parametry:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Każdy parametr wpływa na wynik:

  • VoiceLabs jest wielojęzyczny, więc język określa brzmienie językowe głosu
  • Akcent zmienia wzorce wymowy
  • Wiek wpływa na wysokość i barwę
  • Płeć wpływa na skalę głosu
  • Poziom jakości determinuje czystość brzmienia

Najciekawsze są kombinacje. Czasem nieoczywiste połączenia dają najlepsze rezultaty, więc warto eksperymentować.

Generowanie, podgląd i zapis

Kliknij Generate voice, a ElevenLabs wygeneruje krótki próbnik.

Przykładowe wygenerowane głosy

Możesz regenerować dowolną liczbę razy. Każda wersja będzie nieco inna.

Gdy znajdziesz wersję, która ci się podoba:

  • Kliknij Save

  • Użyj opisowej nazwy, np. narrator_us_male_30s

Po zapisaniu głos pojawi się w My Voices oraz na liście w Speech Synthesis.

Klonowanie głosu w Instant Voice Cloning (IVC)

Instant Voice Cloning pozwala odtworzyć głos z niewielkiej próbki audio. Jest szybkie i zaskakująco skuteczne, choć nieidealne. Pamiętaj, że potrzebujesz planu Starter (6$ / mies.) lub wyższego.

Ważne: klonuj wyłącznie głosy, do których masz uprawnienia. Platforma wymaga potwierdzenia i należy traktować to poważnie. Cały proces jest prosty:

  • Przygotuj swoje nagranie
  • Prześlij plik
  • Nazwij i zapisz swój klon głosu
  • Przetestuj w Text to Speech

Przygotowanie próbki audio

Twoje audio powinno mieć odpowiednią długość, format i przyzwoitą jakość. Minimalnie około minuty, ale 3–5 minut daje zwykle znacznie lepsze rezultaty.

Prześlij pliki MP3 lub WAV poniżej 50 MB; możesz też dodać wiele plików naraz. 

Aby zapewnić najlepszy efekt klonowania i dobrą jakość nagrania, polecam podczas nagrywania:

  • Ciche pomieszczenie
  • Brak szumów tła
  • Stałą odległość od mikrofonu

Unikaj:

  • Wielu mówców
  • Nagrań telefonem
  • Mocnej obróbki postprocessingu

Przesyłanie i tworzenie klonu

Wróć do pulpitu Voices i zrób to:

  1. Kliknij + Create Voice
  2. Wybierz Instant Voice Cloning
  3. Prześlij audio i kliknij Next

Instant Voice Clone

  1. Nazwij głos, opcjonalnie dodaj etykiety i opis
  2. Potwierdź zgodę
  3. Kliknij Save Voice

Z listy rozwijanej możesz wybrać następujące etykiety:

  • Language
  • Accent (otwiera opcje zależnie od języka)
  • Gender
  • Age (opcje: young, middle-aged, old)

Głos jest gotowy od razu i możesz go natychmiast przetestować w generatorze text-to-speech. Wypróbuj kilka zdań i zwróć uwagę, gdzie brzmi naturalnie, a gdzie się gubi.

Aby to zrobić, kliknij Text to Speech w lewym pasku bocznym. (W niektórych wersjach nazywa się to Speech Synthesis.)

Text to Speec

Otworzy się okno z podobnym polem na tekst. 

Okno Text to Speech

Po prawej rozwiń listę Voice i wybierz swój głos z okna My Voices.

Wybór głosu

Napisz zdanie testowe i kliknij Generate speech.

Generate speech

To wygeneruje próbkę audio z wybranym głosem. Swobodnie dostosuj ustawienia po prawej stronie. Możesz zmieniać m.in.:

  • Speed
  • Stability
  • Similarity
  • Style Exaggeration 

Wybór różnych modeli również daje inne opcje!

Dopasowywanie wygenerowanej mowy

Aby zapisać plik, kliknij przycisk pobierania po prawej i zapisz wygenerowane audio.

Zapisz wygenerowaną mowę

Wysokiej jakości klon z Professional Voice Cloning (PVC)

IVC daje przybliżenie, PVC — coś znacznie bliższego oryginałowi. Tu łapiesz niuanse, jak tempo, oddech czy emocje.

Wymaga planu Creator (22$ / mies.). Według ElevenLabs przetwarzanie trwa zwykle 2–6 godzin, choć łączny czas treningu może sięgnąć 24 godzin w zależności od obciążenia serwerów. 

To najwłaściwsza opcja, gdy tworzysz zasoby głosowe klasy produkcyjnej — np. narracje, audiobooki czy firmowych asystentów głosowych. Rzeczy do komercyjnego lub szerokiego użycia.

Nagrywanie i kuracja danych treningowych

Ponieważ celujemy w najwyższą jakość modelu, wymagania rosną. Minimalny czas nagrań to 30 minut czystego audio, ale dla najlepszych efektów celuj w 3+ godziny. Najlepiej przesyłać audio w próbkach po 30 minut.

Kilka wskazówek, by jak najlepiej wykorzystać nagrania:

  • Użyj cichego środowiska nagraniowego
  • Postaraj się użyć dobrego mikrofonu
  • Różnicuj treści — nie czytaj tylko jednego dokumentu

Na przykład możesz urozmaicić styl narracji:

  • Różne rodzaje dialogu. Przeczytaj kilka tekstów instruktażowych. 
  • Przejdź przez liczby i listę. To zapewnia dużą różnorodność wymowy i składni. 
  • Spróbuj też różnych temp, emocji i tak dalej. Więcej stylu pomaga zbudować lepszy model.

Jak zawsze unikaj słabej jakości audio, jak:

  • Hałas tła
  • Mocna kompresja
  • Wypełniacze typu „yyy”, „eee”

Zgłoszenie i oczekiwanie na trening

Gdy przygotujesz audio, dalsze kroki są proste:

  1. Wybierz Professional Voice Clone
  2. Kliknij przycisk Create new clone

Utwórz Professional Voice Clone

  1. Prześlij wszystkie nagrania, uzupełnij nazwę, język i inne etykiety

Szczegóły PVC

  1. Uzupełnij zgodę
  2. Wyślij

Zanim ElevenLabs wytrenuje twój klon, musisz udowodnić, że głos jest faktycznie twój.

To główna różnica względem IVC: profesjonalne klonowanie pozwala klonować tylko własny głos, więc nie sklonujesz cudzego nawet za zgodą. Jeśli kolega chce użyczyć swojego, musi sam utworzyć i zweryfikować PVC na swoim koncie, a potem udostępnić ci je prywatnym linkiem.

Weryfikacja to krótkie nagranie na żywo. Przeczytasz kilka linijek z ekranu do mikrofonu. Dwie rzeczy są kluczowe:

  • Użyj tego samego lub bardzo podobnego sprzętu, co do próbek, i utrzymaj zbliżony ton oraz sposób mówienia. Niedopasowanie to najczęstsza przyczyna niepowodzenia.
  • Każdą linijkę przeczytaj tylko raz, potem kliknij Stop. Wielokrotne czytanie może unieważnić weryfikację.

Jeśli się nie uda, możesz odczekać 24 godziny i spróbować ponownie albo skontaktować się ze wsparciem. Uwaga: po wejściu w etap weryfikacji klon jest zablokowany. Nie możesz sam usunąć niezweryfikowanego PVC, więc upewnij się, że próbki są właściwe, zanim tu dojdziesz.

Dostaniesz powiadomienie, gdy klon głosu będzie gotowy! Warto wtedy porównać wyniki IVC i PVC na tym samym zdaniu — różnica zwykle jest bardzo wyraźna.

Korzystanie z głosów VoiceLab w projektach

Po zapisaniu twój głos jest dostępny w całej platformie — wszędzie tam, gdzie ElevenLabs generuje audio.

Możesz używać go w:

  • Text to Speech (Speech Synthesis) do szybkiego generowania
  • Studio do projektów długoterminowych
  • Python API do użycia programistycznego

Pokażę, jak użyć twojego głosu w każdym z tych narzędzi. Beginner’s Guide to the ElevenLabs API to najlepszy start z Python API.

Używanie własnych głosów w Text to Speech i Studio

W Text to Speech po prostu wybierz swój głos z listy Voices -> My Voices, jak wyżej.

Kilka wskazówek strojenia dla Text to Speech:

  • Zacznij od Stability na poziomie 40–50%
  • Ustaw Similarity około 75%
  • Dostosuj na podstawie wyniku

Może to zająć kilka prób, by uzyskać dokładnie taki głos i nagranie, jakiego chcesz, ale im więcej eksperymentujesz, tym lepiej rozumiesz proces generowania mowy.

W Studio jest podobnie. Przejdź do Studio w lewym pasku, następnie wybierz + New Blank Project. Potem wybierz typ projektu:

  • Audio Project lub
  • Video Project

Projekt audio to po prostu możliwość tworzenia dłuższych treści konwersacyjnych z wieloma głosami. Projekt wideo wymaga najpierw przesłania wideo, do którego dodasz lektora.

Nawigacja w projekcie audio w Studio

Projekt audio w Studio pozwala stworzyć plik audio z wieloma mówcami. Świetne do podcastów czy dialogów, a nawet audiobooków z różnymi głosami/postaciami. 

Pulpit audio w Studio to czyste płótno. Skupimy się na kluczowym komponencie głosu, ale śmiało eksploruj resztę.

Projekt audio w Studio

Po lewej zobaczysz sekcję głosu wybraną dla ciebie. Gdy piszesz w polu promptu, podświetla się kwestia postaci.

Tworzenie nowego akapitu

Po przejściu do kolejnej linijki możesz wybrać inny głos i inną postać. Każda linia to „paragraph”:

Wybór głosu dla akapitu

Limity w Studio są dość wysokie. Każdy projekt może mieć do 500 rozdziałów, każdy do 400 akapitów. Każdy akapit może mieć do 5000 znaków.

Liczba projektów zależy od planu:

  • Darmowy: 5 projektów
  • Starter: 20 projektów
  • Creator: 1000 projektów

Nawigacja w projekcie wideo w Studio

Przejdź te same kroki, ale wybierz projekt wideo. Zobaczysz puste płótno i prośbę o przesłanie wideo:Projekt wideo w Studio

Po przesłaniu klipu zobaczysz go po lewej i możesz odtworzyć podgląd. W razie potrzeby dodasz wiele wideo.

Następnie po lewej wybierz Speech.

Pliki projektu wideo

Podobnie jak w projekcie audio, możesz wybrać wiele głosów i wpisywać kwestie. W trakcie pisania naciśnij Enter, by przejść do nowej linii. Dla każdej linii możesz wybrać inny głos i stworzyć dialog.

Dodaj głos do wideo

Na dole łatwo dopasujesz ramy czasowe poszczególnych linii, przeciągając je na osi czasu.

Edycja wideo z wygenerowaną mową

Jeśli nie masz zdjęć lub wideo, możesz je wygenerować w zakładce Video po lewej. Wpisujesz prompt, a narzędzie tworzy obraz lub wideo.

Pamiętaj, że najpierw musisz zaakceptować warunki beta dla obrazów i wideo. Darmowi użytkownicy mogą generować tylko obrazy; do generowania wideo potrzebny jest co najmniej plan Starter (5$ / mies.).

Generowanie wideo

Dostęp do własnych głosów przez ElevenLabs Python SDK

Aby użyć Python SDK, musisz najpierw mieć zainstalowanego Pythona. Następnie utwórz środowisko Pythona, w którym zainstalujesz ElevenLabs SDK poleceniem: pip install "elevenlabs[pyaudio]"

Potem przejdź do panelu deweloperskiego ElevenLabs, klikając na dole lewego paska i wybierając API Keys -> Create Key.

Konsola deweloperska ElevenLabs

Wybierz, do jakich narzędzi chcesz dać dostęp przez API i kliknij Create Key.

Utwórz klucz API

Pojawi się klucz API, który musisz skopiować, inaczej stracisz go na zawsze.

Utworzony klucz API

Następnie zapisz klucz API w pliku .env w bezpiecznym miejscu lub w folderze projektu.

Potem przejdź do pulpitu Voices i wybierz My Voices. Skopiuj Voice ID twojego głosu. Zapisz go w łatwo dostępnym miejscu.

Skopiuj Voice ID

Teraz możesz stworzyć skrypt uruchamiający twój głos ElevenLabs! Oto prosty przykład:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Podsumowanie

VoiceLab oferuje trzy ścieżki, zależnie od potrzeb. Voice Design jest idealny do eksperymentów, Instant Voice Cloning świetny do szybkich prototypów, a Professional Voice Cloning zapewnia jakość produkcyjną.

Jeśli dopiero zaczynasz, polecam najpierw Voice Design. Aktualizuj plan dopiero, gdy masz konkretny use case.

Jeśli chcesz wejść głębiej w budowanie aplikacji zasilanych AI, sprawdź naszą ścieżkę umiejętności Developing AI Applications, w której nauczysz się korzystać z najnowszych narzędzi dla deweloperów AI, w tym OpenAI API, Hugging Face i LangChain.

ElevenLabs VoiceLab — FAQ

Czy ElevenLabs jest darmowy?

Tak. Darmowy plan daje około 10 000 kredytów miesięcznie (mniej więcej 10 minut audio) plus Voice Design i bibliotekę gotowych głosów. Nie można go jednak używać komercyjnie i nie obejmuje klonowania głosu — do Instant Voice Cloning i licencji komercyjnej potrzebujesz co najmniej planu Starter.

Czy potrzebuję płatnego planu, by komercyjnie używać głosów ElevenLabs?

Tak. Darmowy plan wymaga atrybucji ElevenLabs i nie daje praw komercyjnych, więc nie możesz monetyzować takiego audio. Licencja komercyjna zaczyna się od planu Starter (około 6$ / mies., 5$ przy rozliczeniu rocznym), a Professional Voice Cloning dla głosów produkcyjnych wymaga planu Creator (22$ / mies.) lub wyższego.

Czy mogę sklonować czyjś głos w ElevenLabs?

Tylko za wyraźną zgodą i zasady różnią się w zależności od metody. Instant Voice Cloning pozwala klonować dowolny głos, do którego masz uprawnienia, natomiast Professional Voice Cloning jest ograniczone do twojego własnego głosu i wymaga nagrania weryfikacyjnego na żywo (nawet za zgodą). Używanie sklonowanego głosu do podszywania się lub oszustw jest nielegalne w większości jurysdykcji.

Jaka jest różnica między Instant a Professional Voice Cloning?

Instant Voice Cloning (IVC) tworzy użyteczny klon w kilka sekund z zaledwie 1–2 minut audio i nadaje się do prototypów, choć może gubić subtelne niuanse. Professional Voice Cloning (PVC) trenuje dedykowany model na 30 minutach do 3 godzin audio i zajmuje kilka godzin, dając znacznie dokładniejszy, gotowy do produkcji efekt. Używaj IVC do szybkich testów, a PVC, gdy liczy się jakość.

Czy mogę używać własnego głosu z ElevenLabs poza platformą?

Nie bezpośrednio. Klonów głosu nie da się wyeksportować i działają tylko w ElevenLabs. Nadal możesz używać ich wszędzie tam, gdzie platforma generuje audio, w tym w Text to Speech, Studio oraz programistycznie przez ElevenLabs API i Python SDK — to najczęstszy sposób na wpięcie własnego głosu do aplikacji lub pipeline’ów.

Tematy

Ucz się AI z DataCamp!

Track

Tworzenie aplikacji AI

21 godz.
Naucz się tworzyć aplikacje oparte na AI z wykorzystaniem najnowszych narzędzi dla deweloperów AI, w tym OpenAI API, Hugging Face i LangChain.
Zobacz szczegółyRight Arrow
Rozpocznij Kurs
Zobacz więcejRight Arrow