Track
Pewnie nie raz trafiłeś na świetny głos TTS, tylko po to, by odkryć, że pełne użycie jest zablokowane w droższym planie, nie da się go dopasować do twojej marki, a tym bardziej nazwać go swoim. W tym miejscu większość osób odbija się od ściany w pracy z voice AI. VoiceLab od ElevenLabs to moment, w którym to się zmienia.
W tym przewodniku przeprowadzę cię przez trzy narzędzia w ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) i Professional Voice Cloning (PVC). Przejdziemy wszystko krok po kroku, a ja pokażę ci dokładnie, czego się spodziewać na każdym etapie.
Zanim zaczniemy, oto czego potrzebujesz:
- Darmowe konto ElevenLabs wystarczy do Voice Design
- Plan Starter (6$ / miesiąc) jest wymagany do Instant Voice Cloning
- Plan Creator (22$ / miesiąc) jest wymagany do Professional Voice Cloning
Na końcu będziesz mieć przynajmniej jeden własny głos zapisany w bibliotece, gotowy do użycia w Speech Synthesis (Text to Speech), Studio lub nawet przez API.
Czym jest ElevenLabs VoiceLab?
W skrócie VoiceLab to pakiet narzędzi ElevenLabs do tworzenia i zarządzania własnymi głosami. Trafiasz tu, gdy chcesz czegoś oryginalnego, a nie tylko gotowców.
Szybkie porównanie trzech narzędzi VoiceLab:
|
Narzędzie |
Co robi |
Jakość |
Wymagane dane wejściowe |
Czas tworzenia |
Wymagany plan |
Najlepsze zastosowanie |
|
Voice Design |
Generuje syntetyczne głosy |
Dobra |
Brak |
Natychmiast |
Darmowy |
Eksperymenty |
|
IVC |
Klonuje głos z krótkiego nagrania |
Dobra |
~1–5 min audio |
Natychmiast |
Starter+ |
Prototypy |
|
PVC |
Wysokiej wierności klonowanie głosu |
Znakomita |
30 min do 3+ godzin |
1–2 dni |
Creator+ |
Produkcja |
Jeśli chcesz wejść głębiej w programistyczne użycie głosów, polecam nasz przewodnik po API ElevenLabs.
VoiceLab a Voice Library
Ważne, by nie mylić tego z Voice Library.
- Voice Library: Przeglądaj i używaj gotowych głosów
- VoiceLab: Twórz i zarządzaj własnymi głosami
Gdy stworzysz głos w VoiceLab, możesz opcjonalnie opublikować go w Voice Library, by inni mogli go używać. Domyślnie jednak pozostaje prywatny na twoim koncie.
Konfiguracja konta ElevenLabs
Start jest prosty.
- Wejdź na elevenlabs.io
- Kliknij Sign Up
- Użyj Google lub e-maila
- Wybierz początkową platformę. Wybierz Eleven Creative, by skupić się na narzędziach do tworzenia głosu.

- Zweryfikuj konto
Gdy już jesteś w środku, przejdź do sekcji VoiceLab:
- Kliknij Voices w lewym pasku bocznym.
- Kliknij + Create Voice

Zobaczysz cztery opcje:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Pamiętaj, że nie wszystkie funkcje są dostępne w każdym planie. Sprawdź tabelę poniżej, aby zobaczyć, co jest dostępne w poszczególnych progach:
|
Plan |
Voice Design |
IVC |
PVC |
Licencja komercyjna |
|
Darmowy |
Tak |
Nie |
Nie |
Nie |
|
Starter |
Tak |
Tak |
Nie |
Tak |
|
Creator |
Tak |
Tak |
Tak |
Tak |
Tworzenie syntetycznego głosu w Voice Design
Voice Design to najprostszy punkt startowy. Nie potrzebujesz żadnych nagrań. Głos generowany jest od zera. To też jedyna opcja dostępna w darmowym planie, co czyni ją idealną dla początkujących.
Schemat pracy jest prosty:
- Napisz prompt z kluczowymi ustawieniami
- Wygeneruj
- Przesłuchaj
- Zapisz
Z doświadczenia: wygeneruj co najmniej 5–10 wariantów przed wyborem. Nawet przy tych samych ustawieniach wyniki potrafią się mocno różnić. Na początek kliknij przycisk Voice Design w menu Create Voice. Otworzy się okno do wpisania promptu dla twojego głosu.

Możesz kliknąć Settings, by ustawić dwie rzeczy:
- Loudness: jak głośny będzie wygenerowany głos.
- Guidance level: podobne do temperatury w innych modelach — określa, jak ściśle AI ma trzymać się twojego promptu. Wyższe guidance = większa zgodność; niższe = więcej swobody.

Możesz pozwolić agentowi AI użyć własnego tekstu podglądu lub podać własny skrypt, wyłączając to ustawienie i wklejając swój tekst w polu podglądu.

Parametry w promptach dla głosu
W polu promptu ustawisz konfiguracje. Spróbuj użyć poniższego szablonu promptu, by wskazać konkretne parametry:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Każdy parametr wpływa na wynik:
- VoiceLabs jest wielojęzyczny, więc język określa brzmienie językowe głosu
- Akcent zmienia wzorce wymowy
- Wiek wpływa na wysokość i barwę
- Płeć wpływa na skalę głosu
- Poziom jakości determinuje czystość brzmienia
Najciekawsze są kombinacje. Czasem nieoczywiste połączenia dają najlepsze rezultaty, więc warto eksperymentować.
Generowanie, podgląd i zapis
Kliknij Generate voice, a ElevenLabs wygeneruje krótki próbnik.

Możesz regenerować dowolną liczbę razy. Każda wersja będzie nieco inna.
Gdy znajdziesz wersję, która ci się podoba:
-
Kliknij Save
-
Użyj opisowej nazwy, np.
narrator_us_male_30s
Po zapisaniu głos pojawi się w My Voices oraz na liście w Speech Synthesis.
Klonowanie głosu w Instant Voice Cloning (IVC)
Instant Voice Cloning pozwala odtworzyć głos z niewielkiej próbki audio. Jest szybkie i zaskakująco skuteczne, choć nieidealne. Pamiętaj, że potrzebujesz planu Starter (6$ / mies.) lub wyższego.
Ważne: klonuj wyłącznie głosy, do których masz uprawnienia. Platforma wymaga potwierdzenia i należy traktować to poważnie. Cały proces jest prosty:
- Przygotuj swoje nagranie
- Prześlij plik
- Nazwij i zapisz swój klon głosu
- Przetestuj w Text to Speech
Przygotowanie próbki audio
Twoje audio powinno mieć odpowiednią długość, format i przyzwoitą jakość. Minimalnie około minuty, ale 3–5 minut daje zwykle znacznie lepsze rezultaty.
Prześlij pliki MP3 lub WAV poniżej 50 MB; możesz też dodać wiele plików naraz.
Aby zapewnić najlepszy efekt klonowania i dobrą jakość nagrania, polecam podczas nagrywania:
- Ciche pomieszczenie
- Brak szumów tła
- Stałą odległość od mikrofonu
Unikaj:
- Wielu mówców
- Nagrań telefonem
- Mocnej obróbki postprocessingu
Przesyłanie i tworzenie klonu
Wróć do pulpitu Voices i zrób to:
- Kliknij + Create Voice
- Wybierz Instant Voice Cloning
- Prześlij audio i kliknij Next

- Nazwij głos, opcjonalnie dodaj etykiety i opis
- Potwierdź zgodę
- Kliknij Save Voice
Z listy rozwijanej możesz wybrać następujące etykiety:
- Language
- Accent (otwiera opcje zależnie od języka)
- Gender
- Age (opcje: young, middle-aged, old)
Głos jest gotowy od razu i możesz go natychmiast przetestować w generatorze text-to-speech. Wypróbuj kilka zdań i zwróć uwagę, gdzie brzmi naturalnie, a gdzie się gubi.
Aby to zrobić, kliknij Text to Speech w lewym pasku bocznym. (W niektórych wersjach nazywa się to Speech Synthesis.)

Otworzy się okno z podobnym polem na tekst.

Po prawej rozwiń listę Voice i wybierz swój głos z okna My Voices.

Napisz zdanie testowe i kliknij Generate speech.

To wygeneruje próbkę audio z wybranym głosem. Swobodnie dostosuj ustawienia po prawej stronie. Możesz zmieniać m.in.:
- Speed
- Stability
- Similarity
- Style Exaggeration
Wybór różnych modeli również daje inne opcje!

Aby zapisać plik, kliknij przycisk pobierania po prawej i zapisz wygenerowane audio.

Wysokiej jakości klon z Professional Voice Cloning (PVC)
IVC daje przybliżenie, PVC — coś znacznie bliższego oryginałowi. Tu łapiesz niuanse, jak tempo, oddech czy emocje.
Wymaga planu Creator (22$ / mies.). Według ElevenLabs przetwarzanie trwa zwykle 2–6 godzin, choć łączny czas treningu może sięgnąć 24 godzin w zależności od obciążenia serwerów.
To najwłaściwsza opcja, gdy tworzysz zasoby głosowe klasy produkcyjnej — np. narracje, audiobooki czy firmowych asystentów głosowych. Rzeczy do komercyjnego lub szerokiego użycia.
Nagrywanie i kuracja danych treningowych
Ponieważ celujemy w najwyższą jakość modelu, wymagania rosną. Minimalny czas nagrań to 30 minut czystego audio, ale dla najlepszych efektów celuj w 3+ godziny. Najlepiej przesyłać audio w próbkach po 30 minut.
Kilka wskazówek, by jak najlepiej wykorzystać nagrania:
- Użyj cichego środowiska nagraniowego
- Postaraj się użyć dobrego mikrofonu
- Różnicuj treści — nie czytaj tylko jednego dokumentu
Na przykład możesz urozmaicić styl narracji:
- Różne rodzaje dialogu. Przeczytaj kilka tekstów instruktażowych.
- Przejdź przez liczby i listę. To zapewnia dużą różnorodność wymowy i składni.
- Spróbuj też różnych temp, emocji i tak dalej. Więcej stylu pomaga zbudować lepszy model.
Jak zawsze unikaj słabej jakości audio, jak:
- Hałas tła
- Mocna kompresja
- Wypełniacze typu „yyy”, „eee”
Zgłoszenie i oczekiwanie na trening
Gdy przygotujesz audio, dalsze kroki są proste:
- Wybierz Professional Voice Clone
- Kliknij przycisk Create new clone

- Prześlij wszystkie nagrania, uzupełnij nazwę, język i inne etykiety

- Uzupełnij zgodę
- Wyślij
Zanim ElevenLabs wytrenuje twój klon, musisz udowodnić, że głos jest faktycznie twój.
To główna różnica względem IVC: profesjonalne klonowanie pozwala klonować tylko własny głos, więc nie sklonujesz cudzego nawet za zgodą. Jeśli kolega chce użyczyć swojego, musi sam utworzyć i zweryfikować PVC na swoim koncie, a potem udostępnić ci je prywatnym linkiem.
Weryfikacja to krótkie nagranie na żywo. Przeczytasz kilka linijek z ekranu do mikrofonu. Dwie rzeczy są kluczowe:
- Użyj tego samego lub bardzo podobnego sprzętu, co do próbek, i utrzymaj zbliżony ton oraz sposób mówienia. Niedopasowanie to najczęstsza przyczyna niepowodzenia.
- Każdą linijkę przeczytaj tylko raz, potem kliknij Stop. Wielokrotne czytanie może unieważnić weryfikację.
Jeśli się nie uda, możesz odczekać 24 godziny i spróbować ponownie albo skontaktować się ze wsparciem. Uwaga: po wejściu w etap weryfikacji klon jest zablokowany. Nie możesz sam usunąć niezweryfikowanego PVC, więc upewnij się, że próbki są właściwe, zanim tu dojdziesz.
Dostaniesz powiadomienie, gdy klon głosu będzie gotowy! Warto wtedy porównać wyniki IVC i PVC na tym samym zdaniu — różnica zwykle jest bardzo wyraźna.
Korzystanie z głosów VoiceLab w projektach
Po zapisaniu twój głos jest dostępny w całej platformie — wszędzie tam, gdzie ElevenLabs generuje audio.
Możesz używać go w:
- Text to Speech (Speech Synthesis) do szybkiego generowania
- Studio do projektów długoterminowych
- Python API do użycia programistycznego
Pokażę, jak użyć twojego głosu w każdym z tych narzędzi. Beginner’s Guide to the ElevenLabs API to najlepszy start z Python API.
Używanie własnych głosów w Text to Speech i Studio
W Text to Speech po prostu wybierz swój głos z listy Voices -> My Voices, jak wyżej.
Kilka wskazówek strojenia dla Text to Speech:
- Zacznij od Stability na poziomie 40–50%
- Ustaw Similarity około 75%
- Dostosuj na podstawie wyniku
Może to zająć kilka prób, by uzyskać dokładnie taki głos i nagranie, jakiego chcesz, ale im więcej eksperymentujesz, tym lepiej rozumiesz proces generowania mowy.
W Studio jest podobnie. Przejdź do Studio w lewym pasku, następnie wybierz + New Blank Project. Potem wybierz typ projektu:
- Audio Project lub
- Video Project
Projekt audio to po prostu możliwość tworzenia dłuższych treści konwersacyjnych z wieloma głosami. Projekt wideo wymaga najpierw przesłania wideo, do którego dodasz lektora.
Nawigacja w projekcie audio w Studio
Projekt audio w Studio pozwala stworzyć plik audio z wieloma mówcami. Świetne do podcastów czy dialogów, a nawet audiobooków z różnymi głosami/postaciami.
Pulpit audio w Studio to czyste płótno. Skupimy się na kluczowym komponencie głosu, ale śmiało eksploruj resztę.

Po lewej zobaczysz sekcję głosu wybraną dla ciebie. Gdy piszesz w polu promptu, podświetla się kwestia postaci.

Po przejściu do kolejnej linijki możesz wybrać inny głos i inną postać. Każda linia to „paragraph”:

Limity w Studio są dość wysokie. Każdy projekt może mieć do 500 rozdziałów, każdy do 400 akapitów. Każdy akapit może mieć do 5000 znaków.
Liczba projektów zależy od planu:
- Darmowy: 5 projektów
- Starter: 20 projektów
- Creator: 1000 projektów
Nawigacja w projekcie wideo w Studio
Przejdź te same kroki, ale wybierz projekt wideo. Zobaczysz puste płótno i prośbę o przesłanie wideo:
Po przesłaniu klipu zobaczysz go po lewej i możesz odtworzyć podgląd. W razie potrzeby dodasz wiele wideo.
Następnie po lewej wybierz Speech.

Podobnie jak w projekcie audio, możesz wybrać wiele głosów i wpisywać kwestie. W trakcie pisania naciśnij Enter, by przejść do nowej linii. Dla każdej linii możesz wybrać inny głos i stworzyć dialog.

Na dole łatwo dopasujesz ramy czasowe poszczególnych linii, przeciągając je na osi czasu.

Jeśli nie masz zdjęć lub wideo, możesz je wygenerować w zakładce Video po lewej. Wpisujesz prompt, a narzędzie tworzy obraz lub wideo.
Pamiętaj, że najpierw musisz zaakceptować warunki beta dla obrazów i wideo. Darmowi użytkownicy mogą generować tylko obrazy; do generowania wideo potrzebny jest co najmniej plan Starter (5$ / mies.).

Dostęp do własnych głosów przez ElevenLabs Python SDK
Aby użyć Python SDK, musisz najpierw mieć zainstalowanego Pythona. Następnie utwórz środowisko Pythona, w którym zainstalujesz ElevenLabs SDK poleceniem: pip install "elevenlabs[pyaudio]"
Potem przejdź do panelu deweloperskiego ElevenLabs, klikając na dole lewego paska i wybierając API Keys -> Create Key.

Wybierz, do jakich narzędzi chcesz dać dostęp przez API i kliknij Create Key.

Pojawi się klucz API, który musisz skopiować, inaczej stracisz go na zawsze.

Następnie zapisz klucz API w pliku .env w bezpiecznym miejscu lub w folderze projektu.
Potem przejdź do pulpitu Voices i wybierz My Voices. Skopiuj Voice ID twojego głosu. Zapisz go w łatwo dostępnym miejscu.

Teraz możesz stworzyć skrypt uruchamiający twój głos ElevenLabs! Oto prosty przykład:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Podsumowanie
VoiceLab oferuje trzy ścieżki, zależnie od potrzeb. Voice Design jest idealny do eksperymentów, Instant Voice Cloning świetny do szybkich prototypów, a Professional Voice Cloning zapewnia jakość produkcyjną.
Jeśli dopiero zaczynasz, polecam najpierw Voice Design. Aktualizuj plan dopiero, gdy masz konkretny use case.
Jeśli chcesz wejść głębiej w budowanie aplikacji zasilanych AI, sprawdź naszą ścieżkę umiejętności Developing AI Applications, w której nauczysz się korzystać z najnowszych narzędzi dla deweloperów AI, w tym OpenAI API, Hugging Face i LangChain.
ElevenLabs VoiceLab — FAQ
Czy ElevenLabs jest darmowy?
Tak. Darmowy plan daje około 10 000 kredytów miesięcznie (mniej więcej 10 minut audio) plus Voice Design i bibliotekę gotowych głosów. Nie można go jednak używać komercyjnie i nie obejmuje klonowania głosu — do Instant Voice Cloning i licencji komercyjnej potrzebujesz co najmniej planu Starter.
Czy potrzebuję płatnego planu, by komercyjnie używać głosów ElevenLabs?
Tak. Darmowy plan wymaga atrybucji ElevenLabs i nie daje praw komercyjnych, więc nie możesz monetyzować takiego audio. Licencja komercyjna zaczyna się od planu Starter (około 6$ / mies., 5$ przy rozliczeniu rocznym), a Professional Voice Cloning dla głosów produkcyjnych wymaga planu Creator (22$ / mies.) lub wyższego.
Czy mogę sklonować czyjś głos w ElevenLabs?
Tylko za wyraźną zgodą i zasady różnią się w zależności od metody. Instant Voice Cloning pozwala klonować dowolny głos, do którego masz uprawnienia, natomiast Professional Voice Cloning jest ograniczone do twojego własnego głosu i wymaga nagrania weryfikacyjnego na żywo (nawet za zgodą). Używanie sklonowanego głosu do podszywania się lub oszustw jest nielegalne w większości jurysdykcji.
Jaka jest różnica między Instant a Professional Voice Cloning?
Instant Voice Cloning (IVC) tworzy użyteczny klon w kilka sekund z zaledwie 1–2 minut audio i nadaje się do prototypów, choć może gubić subtelne niuanse. Professional Voice Cloning (PVC) trenuje dedykowany model na 30 minutach do 3 godzin audio i zajmuje kilka godzin, dając znacznie dokładniejszy, gotowy do produkcji efekt. Używaj IVC do szybkich testów, a PVC, gdy liczy się jakość.
Czy mogę używać własnego głosu z ElevenLabs poza platformą?
Nie bezpośrednio. Klonów głosu nie da się wyeksportować i działają tylko w ElevenLabs. Nadal możesz używać ich wszędzie tam, gdzie platforma generuje audio, w tym w Text to Speech, Studio oraz programistycznie przez ElevenLabs API i Python SDK — to najczęstszy sposób na wpięcie własnego głosu do aplikacji lub pipeline’ów.