Program
Anda mungkin pernah menemukan suara text-to-speech yang bagus, tetapi lalu menyadari penggunaan penuh terkunci di balik paket yang lebih mahal, tidak bisa disesuaikan agar terdengar seperti merek Anda, dan jelas tidak bisa Anda klaim sebagai milik sendiri. Di situlah kebanyakan orang mentok dengan AI suara. ElevenLabs VoiceLab mengubah itu.
Dalam panduan ini, saya akan memandu Anda melalui ketiga alat di ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC), dan Professional Voice Cloning (PVC). Kita akan melangkah selangkah demi selangkah, dan saya akan tunjukkan apa yang perlu Anda harapkan di setiap tahap.
Sebelum mulai, berikut yang Anda butuhkan:
- Akun ElevenLabs gratis sudah cukup untuk Voice Design
- Paket Starter ($6/bulan) diperlukan untuk Instant Voice Cloning
- Paket Creator ($22/bulan) diperlukan untuk Professional Voice Cloning
Pada akhirnya, Anda akan memiliki setidaknya satu suara kustom tersimpan di pustaka Anda, siap digunakan di Speech Synthesis (Text to Speech), Studio, atau bahkan melalui API.
Apa itu ElevenLabs VoiceLab?
Secara garis besar, VoiceLab adalah rangkaian khusus ElevenLabs untuk membuat dan mengelola suara kustom. Ini adalah tempat Anda pergi ketika menginginkan sesuatu yang orisinal, bukan sekadar suara siap pakai.
Berikut perbandingan singkat ketiga alat VoiceLab:
|
Alat |
Fungsinya |
Kualitas |
Input Diperlukan |
Waktu Pembuatan |
Paket Diperlukan |
Penggunaan Terbaik |
|
Voice Design |
Menghasilkan suara sintetis |
Baik |
Tidak ada |
Seketika |
Gratis |
Eksperimen |
|
IVC |
Mengkloning suara dari audio pendek |
Baik |
~1–5 menit audio |
Seketika |
Starter+ |
Prototipe |
|
PVC |
Kloning suara fidelitas tinggi |
Sangat baik |
30 menit hingga 3+ jam |
1–2 hari |
Creator+ |
Produksi |
Jika Anda ingin mendalami penggunaan suara secara terprogram, saya merekomendasikan panduan kami tentang ElevenLabs API.
VoiceLab vs. Voice Library
Penting untuk tidak menyamakannya dengan Voice Library.
- Voice Library: Jelajahi dan gunakan suara siap pakai
- VoiceLab: Buat dan kelola suara Anda sendiri
Setelah Anda membuat suara di VoiceLab, Anda bisa memilih untuk memublikasikannya ke Voice Library agar dapat digunakan orang lain. Namun secara bawaan, suara tersebut tetap privat di akun Anda.
Menyiapkan Akun ElevenLabs Anda
Memulai cukup mudah.
- Buka elevenlabs.io
- Klik Sign Up
- Gunakan Google atau email
- Pilih platform awal Anda. Pilih Eleven Creative untuk fokus pada alat pembuatan suara.

- Verifikasi akun Anda
Setelah masuk, buka bagian VoiceLab:
- Klik Voices di bilah sisi kiri.
- Klik + Create Voice

Anda akan melihat empat opsi:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Perlu dicatat bahwa tidak semua fitur ini tersedia di semua tingkat paket. Lihat tabel di bawah untuk mengetahui apa saja yang tersedia di setiap tingkat:
|
Paket |
Voice Design |
IVC |
PVC |
Lisensi Komersial |
|
Gratis |
Ya |
Tidak |
Tidak |
Tidak |
|
Starter |
Ya |
Ya |
Tidak |
Ya |
|
Creator |
Ya |
Ya |
Ya |
Ya |
Membuat Suara Sintetis dengan Voice Design
Voice Design adalah tempat termudah untuk mulai. Anda tidak memerlukan rekaman apa pun. Alat ini menghasilkan suara dari nol. Ini juga satu-satunya opsi yang tersedia di paket gratis, sehingga sempurna bagi pemula.
Alur kerjanya sederhana:
- Tulis prompt dengan beberapa pengaturan kunci
- Generate
- Pratinjau
- Simpan
Satu kiat dari pengalaman: buat setidaknya 5 hingga 10 variasi sebelum memilih satu. Bahkan dengan pengaturan yang sama, hasilnya cukup bervariasi. Untuk mulai, klik tombol Voice Design di menu Create Voice. Ini akan membuka menu untuk menulis prompt suara Anda.

Anda dapat mengetuk Settings untuk menyesuaikan dua hal:
- Loudness: seberapa keras suara saat dihasilkan.
- Guidance level: mirip temperature pada model lain, menunjukkan seberapa ketat AI mengikuti prompt Anda. Guidance lebih tinggi berarti lebih patuh pada instruksi. Guidance lebih rendah berarti Anda memberi lebih banyak kebebasan.

Anda bisa membiarkan agen AI menggunakan teks pratinjau bawaannya, atau memberikan skrip Anda sendiri dengan mematikan pengaturan dan menaruh teks Anda di kotak preview text.

Memprompt parameter suara
Gunakan area prompt untuk menghasilkan konfigurasi Anda. Coba gunakan templat prompt berikut untuk menyoroti parameter tertentu yang Anda inginkan:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Setiap parameter memengaruhi keluaran:
- VoiceLabs bersifat multibahasa, sehingga bahasa menentukan tonalitas bahasa pada suara
- Aksen mengubah pola pengucapan
- Usia memengaruhi pitch dan warna suara
- Gender memengaruhi rentang vokal
- Tingkat kualitas menentukan seberapa bersih audio yang dihasilkan
Yang menarik adalah bagaimana semuanya berpadu. Terkadang kombinasi tak terduga menghasilkan hasil terbaik, jadi layak untuk bereksperimen.
Menghasilkan, meninjau, dan menyimpan
Klik Generate voice, dan ElevenLabs akan menghasilkan sampel pendek.

Anda bisa menghasilkan ulang sebanyak yang Anda mau. Setiap versi akan sedikit berbeda.
Setelah menemukan yang Anda suka:
-
Klik Save
-
Gunakan nama deskriptif seperti
narrator_us_male_30s
Setelah disimpan, suara akan muncul di My Voices dan di dropdown Speech Synthesis.
Mengkloning Suara dengan Instant Voice Cloning (IVC)
Instant Voice Cloning memungkinkan Anda mereplikasi suara hanya dengan sampel audio kecil. Cepat dan hasilnya cukup efektif, meski tidak sempurna. Ingat, Anda memerlukan paket Starter ($6/bulan) atau lebih tinggi untuk ini.
Catatan penting: hanya klon suara yang Anda punya izin untuk menggunakannya. Platform mengharuskan Anda mengonfirmasi hal ini, dan Anda harus menanggapinya dengan serius. Alur lengkapnya cukup sederhana:
- Siapkan audio Anda
- Unggah audio
- Beri nama dan simpan klon suara Anda
- Uji di Text to Speech
Menyiapkan sampel audio Anda
Pastikan audio Anda berdurasi tepat, formatnya benar, dan berkualitas layak. Panjang minimum sekitar satu menit, tetapi menurut saya 3 hingga 5 menit memberikan hasil jauh lebih baik.
Unggah file MP3 atau WAV di bawah 50MB; Anda juga bisa mengunggah beberapa file sekaligus.
Untuk pengalaman kloning terbaik dan kualitas audio yang baik, saya sarankan hal-hal berikut saat merekam:
- Ruang yang tenang
- Tidak ada suara latar
- Jarak mikrofon yang konsisten
Pastikan menghindari hal-hal berikut:
- Beberapa pembicara
- Rekaman ponsel
- Post-processing berlebihan
Mengunggah dan membuat klon
Kembali ke dasbor Voices Anda dan lakukan hal berikut:
- Klik + Create Voice
- Pilih Instant Voice Cloning
- Unggah audio Anda dan klik Next

- Beri nama suara Anda, opsional tambahkan label dan deskripsi
- Konfirmasi persetujuan
- Klik Save Voice
Label berikut dapat dipilih dari menu dropdown:
- Language
- Accent (membuka opsi sesuai bahasa)
- Gender
- Age (opsi: young, middle-aged, atau old)
Suara siap digunakan seketika, dan Anda bisa langsung mengujinya di generator text-to-speech. Coba beberapa kalimat berbeda dan perhatikan bagian yang terdengar natural serta bagian yang masih kesulitan.
Untuk melakukannya, klik Text to Speech di bilah sisi kiri. (Perhatikan bahwa beberapa versi menyebutnya Speech Synthesis.)

Ini membuka jendela dengan area prompt teks yang serupa.

Di sisi kanan, klik dropdown Voice dan pilih suara Anda dari jendela My Voices.

Tulis kalimat uji dan klik Generate speech.

Ini akan menghasilkan sampel audio dengan suara pilihan Anda. Silakan sesuaikan pengaturan di sisi kanan sesuai preferensi. Anda bisa menyesuaikan hal-hal seperti:
- Kecepatan
- Stability
- Similarity
- Style Exaggeration
Memilih model yang berbeda juga dapat memberikan opsi yang berbeda!

Untuk menyimpan file Anda, klik tombol unduh di kanan untuk menyimpan audio yang dihasilkan.

Membangun Klon Fidelitas Tinggi dengan Professional Voice Cloning (PVC)
Jika IVC memberi Anda pendekatan kasar, PVC memberi hasil yang jauh lebih mendekati aslinya. Di sinilah Anda menangkap nuansa seperti tempo, napas, dan emosi.
Fitur ini memerlukan paket Creator ($22/bulan). Menurut ElevenLabs, pemrosesan biasanya memakan waktu 2 hingga 6 jam, meski total waktu pelatihan bisa hingga 24 jam tergantung beban server.
Ini adalah opsi paling relevan jika kita ingin membangun aset suara siap produksi. Pikirkan narasi, buku audio, dan agen suara bermerek. Hal-hal yang mungkin digunakan secara komersial atau luas.
Merekam dan mengkurasi data pelatihan Anda
Karena kita berupaya membuat model sebaik mungkin, persyaratannya meningkat. Misalnya, waktu rekaman minimum adalah 30 menit audio bersih, tetapi untuk hasil terbaik, targetkan 3+ jam. Cara terbaik mengirimkan audio sebanyak ini adalah memecahnya menjadi sampel 30 menit.
Berikut beberapa kiat untuk memaksimalkan rekaman Anda:
- Gunakan lingkungan perekaman yang tenang
- Usahakan memakai mikrofon yang baik
- Sertakan konten yang beragam, jangan hanya membaca dari satu dokumen sumber
Misalnya, Anda bisa memvariasikan gaya narasi:
- Gunakan berbagai jenis dialog. Bacalah beberapa teks instruksional.
- Bacakan beberapa angka dan daftar. Ini memberi banyak variasi dalam hal pengucapan dan sintaks.
- Selain itu, coba rekam suara dengan tempo berbeda, emosi berbeda, dan seterusnya. Menambah gaya dan warna membantu membangun model yang lebih baik.
Seperti biasa, hindari kualitas audio buruk seperti berikut:
- Kebisingan latar
- Kompresi berlebihan
- Filler seperti “um” dan “uh”
Mengajukan dan menunggu pelatihan
Setelah selesai menyiapkan audio, langkah-langkahnya cukup mudah:
- Pilih Professional Voice Clone
- Klik tombol Create new clone

- Unggah semua rekaman, isi nama, bahasa, dan label lain

- Isi detail persetujuan
- Kirim
Sebelum ElevenLabs melatih klon Anda, mereka meminta Anda membuktikan bahwa suara itu benar-benar milik Anda.
Ini perbedaan besar dari IVC: kloning profesional hanya memungkinkan Anda mengkloning suara Anda sendiri, jadi Anda tidak bisa mengkloning suara orang lain, meskipun dengan persetujuan mereka. Jika rekan ingin meminjamkan suaranya, mereka harus membuat dan memverifikasi PVC di akun mereka sendiri, lalu membagikannya kepada Anda melalui tautan berbagi privat.
Verifikasi berupa rekaman langsung singkat. Anda akan membaca beberapa baris di layar ke mikrofon Anda. Dua hal yang menentukan lolos tidaknya:
- Gunakan peralatan yang sama atau sangat mirip dengan yang Anda gunakan merekam sampel, dan pertahankan nada serta penyampaian yang serupa. Ketidaksesuaian di sini adalah kegagalan paling umum.
- Bacalah setiap baris hanya sekali, lalu tekan Stop. Membacanya lebih dari sekali dapat menyebabkan verifikasi gagal.
Jika gagal, Anda dapat menunggu 24 jam dan mencoba lagi, atau menghubungi dukungan. Perlu diketahui: setelah Anda mencapai tahap verifikasi, klon akan terkunci. Anda tidak dapat menghapus PVC yang belum terverifikasi sendiri, jadi pastikan sampel Anda sudah tepat sebelum sampai di sini.
Anda akan mendapat pemberitahuan saat klon suara Anda siap! Setelah itu, trik yang berguna adalah membandingkan keluaran IVC dan PVC menggunakan kalimat yang sama. Perbedaannya biasanya sangat jelas.
Menggunakan Suara VoiceLab Anda dalam Proyek
Setelah suara Anda disimpan, suara tersebut tersedia di seluruh platform, di mana pun ElevenLabs menghasilkan audio.
Anda bisa menggunakannya di:
- Text to Speech (Speech Synthesis) untuk pembuatan cepat
- Studio untuk proyek jangka panjang
- Python API untuk penggunaan terprogram
Saya akan membahas cara menggunakan suara Anda untuk masing-masing alat ini. Beginner’s Guide to the ElevenLabs API adalah cara terbaik untuk memulai dengan Python API.
Menggunakan suara kustom di Text to Speech dan Studio
Di Text to Speech Anda cukup memilih suara Anda dari dropdown Voices -> My Voices seperti disebutkan di atas.
Beberapa kiat penyetelan untuk alat Text to Speech:
- Mulai dengan Stability di 40 hingga 50 persen
- Atur Similarity sekitar 75 persen
- Sesuaikan berdasarkan keluaran
Mungkin perlu beberapa kali percobaan untuk mendapatkan suara dan rekaman yang Anda inginkan, tetapi semakin sering Anda bereksperimen, semakin baik Anda memahami proses generasi ucapan.
Di Studio, caranya kurang lebih sama. Buka Studio di bilah sisi kiri, lalu pilih + New Blank Project. Selanjutnya, pilih jenis proyek:
- Audio Project atau
- Video Project
Proyek audio memungkinkan Anda membuat konten percakapan bentuk panjang dengan banyak suara. Proyek video mengharuskan Anda mengunggah video terlebih dahulu, lalu Anda bisa menambahkan voice-over.
Navigasi proyek audio di Studio
Proyek audio di Studio memungkinkan Anda membuat file audio multi-pembicara. Ini bagus untuk menghasilkan podcast atau konten percakapan. Termasuk buku audio ketika Anda menginginkan suara atau karakter berbeda.
Dasbor audio Studio adalah kanvas kosong untuk Anda kerjakan. Kita akan fokus pada komponen suara utama di sini, tetapi silakan jelajahi fitur lainnya.

Di sebelah kiri, Anda akan melihat bagian suara yang sudah dipilihkan. Saat Anda mengetik di area prompt, bagian ucapan karakter akan disorot.

Saat Anda pindah ke baris berikutnya, Anda dapat memilih suara berbeda dan memiliki karakter berbeda. Setiap baris adalah sebuah “paragraf”:

Batasnya cukup besar untuk Studio. Setiap proyek dapat memiliki hingga 500 bab, masing-masing dengan hingga 400 paragraf. Setiap paragraf dapat memiliki hingga 5000 karakter.
Jumlah proyek yang dapat Anda miliki bergantung pada tingkat paket Anda:
- Gratis: 5 proyek
- Starter: 20 proyek
- Creator: 1.000 proyek
Navigasi proyek video di Studio
Ikuti langkah yang sama, tetapi kali ini pilih proyek video. Anda akan dibawa ke kanvas kosong dan diminta mengunggah video:
Setelah mengunggah klip video, Anda dapat melihatnya di sebelah kiri dan menekan play untuk pratinjau. Anda dapat menambahkan beberapa video jika diperlukan.
Kemudian ke sebelah kiri dan pilih Speech.

Serupa dengan proyek audio, Anda dapat memilih banyak suara dan mengetikkan kalimat yang diinginkan. Saat mengetik, tekan Enter untuk beralih ke baris baru. Anda bisa memilih suara berbeda untuk setiap baris agar tercipta percakapan.

Di bagian bawah, Anda dapat dengan mudah menyesuaikan rentang waktu setiap baris dengan menyeret dan melepaskannya pada timeline.

Jika Anda tidak memiliki foto atau video, Anda dapat menghasilkannya menggunakan tab Video di sebelah kiri. Cukup tulis prompt, lalu gambar atau video pilihan akan dihasilkan.
Perlu diingat bahwa Anda harus terlebih dahulu menyetujui ketentuan beta Gambar dan Video. Selain itu, anggota gratis hanya dapat menghasilkan gambar; Anda harus memiliki minimal keanggotaan Starter ($5/bulan) untuk menghasilkan video.

Mengakses suara kustom melalui ElevenLabs Python SDK
Untuk menggunakan Python SDK, Anda harus telebih dahulu menginstal Python. Lalu buat lingkungan Python tempat Anda dapat memasang ElevenLabs SDK menggunakan perintah berikut: pip install "elevenlabs[pyaudio]"
Selanjutnya, buka dasbor pengembang ElevenLabs Anda dengan mengklik bagian bawah bilah sisi kiri dan memilih API Keys -> Create Key.

Anda kemudian akan memilih alat apa yang ingin diberi akses API dan klik Create Key.

Ini akan memunculkan Kunci API yang harus Anda salin atau Anda akan kehilangannya selamanya.

Berikutnya, simpan kunci API ke file .env di tempat aman atau folder proyek.
Setelah itu, buka dasbor Voices Anda dan pilih My Voices. Salin Voice ID dari suara Anda. Simpan di tempat yang mudah diakses nanti.

Sekarang Anda dapat membuat skrip untuk menjalankan suara ElevenLabs Anda! Berikut contoh sederhana:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Kesimpulan
VoiceLab menawarkan tiga jalur yang bisa dipilih, tergantung kebutuhan Anda. Voice Design cocok untuk eksperimen, Instant Voice Cloning bagus untuk prototipe cepat, dan Professional Voice Cloning adalah tujuan Anda untuk kualitas setingkat produksi.
Jika Anda baru mulai, saya sarankan tetap menggunakan Voice Design terlebih dahulu. Upgrade hanya ketika Anda memiliki use case yang jelas.
Jika Anda ingin mendalami pembuatan aplikasi bertenaga AI, lihat jalur keterampilan Developing AI Applications kami, yang mengajarkan penggunaan alat pengembang AI terbaru, termasuk OpenAI API, Hugging Face, dan LangChain.
FAQ ElevenLabs VoiceLab
Apakah ElevenLabs gratis digunakan?
Ya. Paket gratis memberi Anda sekitar 10.000 kredit per bulan (sekitar 10 menit audio) plus Voice Design dan pustaka suara stok. Namun tidak dapat digunakan secara komersial dan tidak termasuk kloning suara; Anda memerlukan minimal paket Starter untuk Instant Voice Cloning dan lisensi komersial.
Apakah saya perlu paket berbayar untuk menggunakan suara ElevenLabs secara komersial?
Ya. Paket gratis memerlukan atribusi ElevenLabs dan tidak memberikan hak komersial, jadi Anda tidak dapat memonetisasi audio tersebut. Lisensi komersial dimulai dari paket Starter (sekitar $6/bulan, atau $5 ditagih tahunan), sementara Professional Voice Cloning untuk suara setingkat produksi memerlukan paket Creator ($22/bulan) atau lebih tinggi.
Bisakah saya mengkloning suara orang lain dengan ElevenLabs?
Hanya dengan izin tegas, dan aturannya berbeda menurut metodenya. Instant Voice Cloning memungkinkan Anda mengkloning suara apa pun yang Anda berwenang untuk menggunakannya, tetapi Professional Voice Cloning dibatasi untuk suara Anda sendiri dan memerlukan rekaman verifikasi langsung (bahkan dengan persetujuan). Menggunakan suara hasil kloning untuk peniruan atau penipuan adalah ilegal di sebagian besar yurisdiksi.
Apa perbedaan Instant dan Professional Voice Cloning?
Instant Voice Cloning (IVC) menghasilkan klon yang dapat digunakan dalam hitungan detik hanya dari 1–2 menit audio dan ideal untuk prototipe, meski bisa melewatkan nuansa halus. Professional Voice Cloning (PVC) melatih model khusus pada 30 menit hingga 3 jam audio dan membutuhkan beberapa jam pemrosesan, menghasilkan hasil yang jauh lebih akurat dan siap produksi. Gunakan IVC untuk uji cepat dan PVC saat kualitas menjadi prioritas.
Bisakah saya menggunakan suara kustom ElevenLabs saya di luar platform?
Tidak secara langsung. Klon suara tidak dapat diekspor dan hanya berfungsi di dalam ElevenLabs. Anda tetap dapat menggunakannya di mana pun platform menghasilkan audio, termasuk Text to Speech, Studio, dan secara terprogram melalui ElevenLabs API dan Python SDK, yang merupakan cara kebanyakan orang menghubungkan suara kustom ke aplikasi atau pipeline mereka.
Saya seorang data scientist dengan pengalaman dalam analisis spasial, machine learning, dan pipeline data. Saya pernah bekerja dengan GCP, Hadoop, Hive, Snowflake, Airflow, dan proses data science/engineering lainnya.

