Tracks
Có lẽ bạn đã từng tìm được một giọng đọc chuyển văn bản thành giọng nói rất hay, rồi nhận ra phải nâng cấp lên gói đắt hơn mới dùng được đầy đủ, không thể làm cho phù hợp với thương hiệu của bạn, và chắc chắn không thể gọi đó là giọng của riêng mình. Đa phần mọi người đều vướng ở đây với AI giọng nói. ElevenLabs VoiceLab là nơi điều đó thay đổi.
Trong hướng dẫn này, tôi sẽ đưa bạn đi qua cả ba công cụ trong ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) và Professional Voice Cloning (PVC). Chúng ta sẽ đi từng bước, và tôi sẽ cho bạn thấy chính xác điều gì sẽ diễn ra ở mỗi giai đoạn.
Trước khi bắt đầu, bạn cần chuẩn bị:
- Một tài khoản ElevenLabs miễn phí là đủ để dùng Voice Design
- Gói Starter ($6/tháng) để dùng Instant Voice Cloning
- Gói Creator ($22/tháng) để dùng Professional Voice Cloning
Kết thúc, bạn sẽ có ít nhất một giọng tuỳ chỉnh được lưu trong thư viện, sẵn sàng dùng trong Speech Synthesis (Text to Speech), Studio, hoặc thậm chí qua API.
ElevenLabs VoiceLab là gì?
Ở mức cao, VoiceLab là bộ công cụ chuyên dụng của ElevenLabs để tạo và quản lý giọng nói tuỳ chỉnh. Đây là nơi bạn đến khi muốn thứ gì đó nguyên bản, không chỉ là giọng dựng sẵn.
Dưới đây là so sánh nhanh giữa ba công cụ của VoiceLab:
|
Công cụ |
Chức năng |
Chất lượng |
Đầu vào cần thiết |
Thời gian tạo |
Gói yêu cầu |
Tình huống sử dụng tốt nhất |
|
Voice Design |
Tạo giọng nói tổng hợp |
Tốt |
Không |
Tức thì |
Miễn phí |
Thử nghiệm |
|
IVC |
Nhân bản giọng từ đoạn âm thanh ngắn |
Tốt |
~1–5 phút âm thanh |
Tức thì |
Starter+ |
Nguyên mẫu |
|
PVC |
Nhân bản giọng độ trung thực cao |
Xuất sắc |
30 phút đến 3+ giờ |
1–2 ngày |
Creator+ |
Sản xuất |
Nếu bạn muốn đi sâu hơn vào việc dùng giọng nói theo lập trình, tôi khuyên bạn xem hướng dẫn về ElevenLabs API.
VoiceLab so với Thư viện Giọng nói (Voice Library)
Điều quan trọng là không nhầm lẫn với Thư viện Giọng nói.
- Voice Library: Duyệt và sử dụng các giọng làm sẵn
- VoiceLab: Tạo và quản lý giọng nói của riêng bạn
Sau khi tạo giọng trong VoiceLab, bạn có thể tuỳ chọn xuất bản lên Voice Library để người khác dùng. Nhưng mặc định, nó ở chế độ riêng tư trong tài khoản của bạn.
Thiết lập tài khoản ElevenLabs của bạn
Bắt đầu rất đơn giản.
- Truy cập elevenlabs.io
- Nhấp Sign Up
- Dùng Google hoặc email
- Chọn nền tảng ban đầu. Hãy chọn Eleven Creative để tập trung vào công cụ tạo giọng.

- Xác minh tài khoản
Khi vào được, hãy điều hướng đến khu vực VoiceLab:
- Nhấp Voices ở thanh bên trái.
- Nhấp + Create Voice

Bạn sẽ thấy bốn tuỳ chọn:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Lưu ý rằng không phải tất cả tính năng đều có cho mọi gói. Hãy xem bảng dưới để biết gói nào có gì:
|
Gói |
Voice Design |
IVC |
PVC |
Giấy phép thương mại |
|
Free |
Có |
Không |
Không |
Không |
|
Starter |
Có |
Có |
Không |
Có |
|
Creator |
Có |
Có |
Có |
Có |
Tạo giọng tổng hợp với Voice Design
Voice Design là nơi dễ bắt đầu nhất. Bạn không cần bản ghi nào. Nó tạo giọng từ đầu. Đây cũng là lựa chọn duy nhất có trong gói miễn phí, rất phù hợp cho người mới.
Quy trình rất đơn giản:
- Viết một prompt với một số thiết lập chính
- Tạo
- Xem trước
- Lưu
Mẹo từ kinh nghiệm: hãy tạo ít nhất 5 đến 10 biến thể trước khi chọn một giọng. Dù cùng thiết lập, kết quả có thể khác đáng kể. Để bắt đầu, hãy nhấp vào nút Voice Design trong menu Create Voice. Một cửa sổ sẽ mở để bạn nhập prompt cho giọng nói.

Bạn có thể nhấn Settings để điều chỉnh hai chi tiết:
- Loudness: độ to nhỏ của giọng khi tạo.
- Guidance level: tương tự nhiệt độ ở các mô hình khác, cho biết AI nên bám sát prompt của bạn đến đâu. Guidance cao nghĩa là bám sát hơn. Guidance thấp nghĩa là cho AI nhiều tự do hơn.

Bạn có thể để tác tử AI tự có văn bản xem trước, hoặc tắt cài đặt đó và cung cấp kịch bản của riêng bạn bằng cách nhập vào ô preview text.

Gợi ý các tham số giọng nói
Bạn sẽ muốn dùng khu vực prompt để tạo cấu hình. Hãy thử mẫu prompt sau để chốt một số tham số cụ thể bạn muốn:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Mỗi tham số ảnh hưởng đến đầu ra:
- VoiceLabs hỗ trợ đa ngôn ngữ, nên ngôn ngữ quyết định âm sắc ngôn ngữ của giọng
- Accent thay đổi kiểu phát âm
- Tuổi tác ảnh hưởng cao độ và âm sắc
- Giới tính ảnh hưởng quãng giọng
- Cấp độ chất lượng quyết định độ sạch của âm thanh
Điều thú vị là cách chúng kết hợp. Đôi khi những tổ hợp bất ngờ lại cho kết quả tốt nhất, nên rất đáng để thử nghiệm.
Tạo, xem trước và lưu
Nhấp Generate voice, và ElevenLabs sẽ tạo một mẫu ngắn.

Bạn có thể tạo lại bao nhiêu lần tuỳ thích. Mỗi phiên bản sẽ hơi khác nhau.
Khi tìm được giọng ưng ý:
-
Nhấp Lưu
-
Dùng tên mô tả như
narrator_us_male_30s
Sau khi lưu, giọng sẽ xuất hiện dưới mục My Voices và trong danh sách thả xuống của Speech Synthesis.
Nhân bản giọng với Instant Voice Cloning (IVC)
Instant Voice Cloning cho phép bạn tái tạo một giọng chỉ với một mẫu âm thanh nhỏ. Nhanh và bất ngờ là hiệu quả, dù không hoàn hảo. Lưu ý, bạn sẽ cần gói Starter ($6/tháng) hoặc cao hơn để dùng.
Lưu ý quan trọng: chỉ nhân bản giọng mà bạn có quyền sử dụng. Nền tảng yêu cầu bạn xác nhận điều này, và bạn nên nghiêm túc tuân thủ. Quy trình tổng thể khá thẳng:
- Chuẩn bị âm thanh
- Tải âm thanh lên
- Đặt tên và lưu bản nhân bản giọng
- Thử trong Text to Speech
Chuẩn bị mẫu âm thanh
Bạn cần âm thanh có độ dài phù hợp, đúng định dạng và chất lượng khá. Độ dài tối thiểu khoảng một phút, nhưng tôi thấy 3 đến 5 phút cho kết quả tốt hơn nhiều.
Bạn nên tải tệp MP3 hoặc WAV dưới 50MB, và luôn có thể tải nhiều tệp cùng lúc.
Để có trải nghiệm nhân bản tốt nhất và âm thanh chất lượng, tôi khuyến nghị khi ghi âm nên:
- Phòng yên tĩnh
- Không có tạp âm nền
- Giữ khoảng cách micro ổn định
Nhớ tránh các điều sau:
- Nhiều người nói
- Ghi âm bằng điện thoại
- Hậu kỳ nặng
Tải lên và tạo bản nhân bản
Quay lại bảng điều khiển Voices của bạn và thực hiện:
- Nhấp + Create Voice
- Chọn Instant Voice Cloning
- Tải âm thanh lên và nhấp Next

- Đặt tên cho giọng, tuỳ chọn thêm nhãn và mô tả
- Xác nhận đồng ý
- Nhấp Save Voice
Các nhãn sau có thể chọn từ danh sách thả xuống:
- Language
- Accent (mở các tuỳ chọn tuỳ theo ngôn ngữ)
- Gender
- Age (tuỳ chọn: trẻ, trung niên, hoặc già)
Giọng sẵn sàng ngay lập tức, và bạn có thể thử ngay trong trình tạo text-to-speech. Hãy thử vài câu khác nhau và chú ý chỗ nào nghe tự nhiên, chỗ nào còn vấp.
Để làm điều này, nhấp Text to Speech ở thanh bên trái. (Lưu ý một số phiên bản gọi đây là Speech Synthesis.)

Cửa sổ tương tự một ô nhập văn bản sẽ mở ra.

Ở bên phải, nhấp vào danh sách thả xuống Voice và chọn giọng của bạn từ cửa sổ My Voices.

Viết một câu thử và nhấp Generate speech.

Hệ thống sẽ tạo một mẫu âm thanh với giọng bạn chọn. Cứ thoải mái điều chỉnh các thiết lập bên phải theo ý bạn. Bạn có thể chỉnh các mục như:
- Tốc độ
- Stability
- Similarity
- Style Exaggeration
Chọn các mô hình khác nhau cũng có thể cung cấp các tuỳ chọn khác!

Để lưu tệp, nhấp nút tải xuống ở bên phải để lưu âm thanh đã tạo.

Xây dựng bản nhân bản độ trung thực cao với Professional Voice Cloning (PVC)
Nếu IVC cho bạn một bản gần đúng, thì PVC cho bạn thứ gì đó sát với bản gốc hơn nhiều. Đây là nơi bạn nắm bắt các sắc thái như nhịp điệu, hơi thở và cảm xúc.
Yêu cầu gói Creator ($22/tháng). Theo ElevenLabs, xử lý thường mất 2 đến 6 giờ, dù tổng thời gian huấn luyện có thể lên đến 24 giờ tuỳ tải máy chủ.
Đây là lựa chọn phù hợp nhất nếu chúng ta muốn xây dựng tài sản giọng nói cấp độ sản xuất. Ví dụ như thuyết minh, sách nói, và trợ lý giọng nói mang thương hiệu. Các nội dung có thể dùng thương mại hoặc phổ biến rộng rãi.
Ghi âm và biên tập dữ liệu huấn luyện
Vì mục tiêu là tạo mô hình tốt nhất có thể, yêu cầu sẽ cao hơn. Ví dụ, thời lượng ghi tối thiểu là 30 phút âm thanh sạch, nhưng để có kết quả tốt nhất, hãy hướng tới 3+ giờ. Cách nộp lượng âm thanh lớn tốt nhất là chia thành các mẫu 30 phút.
Một số mẹo để tối ưu bản ghi:
- Dùng môi trường ghi yên tĩnh
- Cố gắng dùng micro tốt
- Đa dạng nội dung, đừng chỉ đọc từ một tài liệu nguồn
Ví dụ, bạn có thể thay đổi phong cách thuyết minh:
- Dùng các dạng hội thoại khác nhau. Đọc vài đoạn văn bản hướng dẫn.
- Đọc qua một số con số và danh sách. Việc này tạo nhiều đa dạng về phát âm và cú pháp.
- Thêm vào đó, thử ghi giọng ở các nhịp độ khác nhau, với các cảm xúc khác nhau. Thêm màu sắc và phong cách giúp xây dựng mô hình tốt hơn.
Như thường lệ, tránh âm thanh kém chất lượng như sau:
- Tạp âm nền
- Nén mạnh
- Từ đệm như “ờ”, “ừ”
Gửi và chờ huấn luyện
Khi đã chuẩn bị xong âm thanh, các bước rất đơn giản:
- Chọn Professional Voice Clone
- Nhấp nút Create new clone

- Tải tất cả bản ghi, điền tên, ngôn ngữ và các nhãn khác

- Điền thông tin đồng ý
- Gửi
Trước khi ElevenLabs huấn luyện bản nhân bản, họ yêu cầu bạn chứng minh giọng thực sự là của bạn.
Đây là khác biệt lớn so với IVC: nhân bản chuyên nghiệp chỉ cho phép bạn nhân bản chính giọng của mình, nên bạn không thể nhân bản giọng người khác, kể cả khi có sự đồng ý. Nếu đồng nghiệp muốn cho mượn giọng, họ phải tự tạo và xác minh PVC trên tài khoản của họ, rồi chia sẻ cho bạn qua liên kết chia sẻ riêng tư.
Xác minh là một bản ghi trực tiếp ngắn. Bạn sẽ đọc vài dòng hiển thị trên màn hình vào micro. Hai yếu tố then chốt:
- Dùng cùng hoặc thiết bị rất giống với thiết bị dùng để ghi mẫu, và giữ tông giọng, cách thể hiện tương tự. Lệch ở đây là nguyên nhân thất bại phổ biến nhất.
- Chỉ đọc mỗi dòng một lần, rồi nhấn Dừng. Đọc nhiều hơn một lần có thể khiến xác minh thất bại.
Nếu thất bại, bạn có thể chờ 24 giờ và thử lại, hoặc liên hệ hỗ trợ. Lưu ý: khi đã đến bước xác minh, bản nhân bản sẽ bị khoá. Bạn không thể tự xoá một PVC chưa xác minh, nên hãy chắc chắn mẫu của bạn ổn trước khi đến bước này.
Bạn sẽ được thông báo khi bản nhân bản giọng sẵn sàng! Khi đó, một mẹo hữu ích là so sánh đầu ra IVC và PVC bằng cùng một câu. Khác biệt thường rất rõ.
Sử dụng các giọng VoiceLab của bạn trong dự án
Khi giọng đã được lưu, nó sẽ khả dụng trên toàn nền tảng ở mọi nơi ElevenLabs tạo âm thanh.
Bạn có thể dùng trong:
- Text to Speech (Speech Synthesis) để tạo nhanh
- Studio cho các dự án dài hạn
- Python API để sử dụng theo lập trình
Tôi sẽ trình bày cách dùng giọng của bạn trong từng công cụ. Hướng dẫn dành cho người mới về ElevenLabs API là cách tốt nhất để bắt đầu với Python API.
Dùng giọng tuỳ chỉnh trong Text to Speech và Studio
Trong Text to Speech bạn chỉ cần chọn giọng của mình từ danh sách thả xuống Voices -> My Voices như đã đề cập ở trên.
Một số mẹo tinh chỉnh cho công cụ Text to Speech:
- Bắt đầu với Stability ở mức 40 đến 50 phần trăm
- Đặt Similarity khoảng 75 phần trăm
- Điều chỉnh dựa trên đầu ra
Có thể mất vài lần thử để có đúng giọng và bản ghi bạn muốn, nhưng càng thử nghiệm, bạn sẽ càng hiểu quá trình tạo giọng nói.
Trong Studio, khá tương tự. Bạn bắt đầu bằng cách vào Studio ở thanh bên trái, rồi chọn + New Blank Project. Tiếp theo, bạn chọn loại dự án:
- Audio Project hoặc
- Video Project
Audio project đúng như tên gọi; cho phép bạn tạo nội dung hội thoại dạng dài với nhiều giọng. Video project yêu cầu bạn tải video lên trước, sau đó bạn có thể thêm giọng để lồng tiếng cho video.
Điều hướng dự án âm thanh trong Studio
Dự án âm thanh trong Studio cho phép bạn tạo tệp âm thanh nhiều người nói. Rất phù hợp để tạo podcast hoặc nội dung hội thoại. Cả nội dung sách nói khi bạn muốn các giọng khác nhau hoặc nhân vật khác nhau.
Bảng điều khiển âm thanh của Studio là một khung trống để bạn làm việc. Chúng ta sẽ tập trung vào thành phần giọng chính, nhưng bạn cứ thoải mái khám phá.

Bên trái, bạn sẽ thấy một mục giọng đã được chọn sẵn. Khi bạn gõ vào vùng prompt, nó sẽ làm nổi bật lời thoại của nhân vật.

Sang dòng tiếp theo, bạn có thể chọn một giọng khác để có nhân vật khác. Mỗi dòng như vậy là một “đoạn” (paragraph):

Giới hạn của Studio khá cao. Mỗi dự án có thể có tối đa 500 chương, mỗi chương tối đa 400 đoạn. Mỗi đoạn tối đa 5000 ký tự.
Số lượng dự án bạn có thể có phụ thuộc vào gói:
- Free: 5 dự án
- Starter: 20 dự án
- Creator: 1.000 dự án
Điều hướng dự án video trong Studio
Làm theo các bước tương tự, nhưng lần này chọn dự án video. Bạn được đưa tới một khung trống và được yêu cầu tải video lên:
Sau khi tải một đoạn video, bạn có thể xem ở bên trái và nhấn phát để xem trước. Bạn có thể thêm nhiều video nếu cần.
Sau đó vào bên trái và chọn Speech.

Tương tự dự án âm thanh, bạn có thể chọn nhiều giọng và gõ các câu mong muốn. Khi gõ, bạn có thể nhấn Enter để sang dòng mới. Có thể chọn giọng khác cho mỗi dòng để tạo cuộc hội thoại.

Bên dưới, bạn có thể dễ dàng điều chỉnh khung thời gian cho mỗi dòng bằng cách kéo thả trên timeline.

Nếu bạn không có ảnh hoặc video, bạn có thể tạo bằng tab Video ở bên trái. Bạn chỉ cần viết một prompt, hệ thống sẽ tạo ảnh hoặc video theo lựa chọn.
Lưu ý bạn phải chấp nhận điều khoản beta cho Hình ảnh và Video trước. Ngoài ra, thành viên miễn phí chỉ được tạo ảnh; bạn cần ít nhất gói Starter ($5/tháng) để tạo video.

Truy cập giọng tuỳ chỉnh qua ElevenLabs Python SDK
Để dùng Python SDK, trước hết bạn phải cài đặt Python. Sau đó bạn tạo một môi trường Python rồi cài ElevenLabs SDK bằng lệnh sau: pip install "elevenlabs[pyaudio]"
Tiếp theo, vào bảng điều khiển dành cho nhà phát triển của ElevenLabs bằng cách nhấp ở cuối thanh bên trái và chọn API Keys -> Create Key.

Bạn sẽ chọn công cụ muốn cấp quyền truy cập API rồi nhấp Create Key.

Một khoá API sẽ bật lên và bạn phải sao chép ngay nếu không sẽ mất vĩnh viễn.

Tiếp theo, lưu khoá API vào tệp .env ở nơi an toàn hoặc trong thư mục dự án.
Sau đó, vào bảng điều khiển Voices và chọn My Voices. Bạn sẽ muốn sao chép Voice ID của giọng. Hãy lưu ở nơi dễ truy cập sau này.

Giờ bạn có thể tạo script để chạy giọng ElevenLabs của mình! Ví dụ đơn giản:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Kết luận
VoiceLab cung cấp ba con đường tuỳ nhu cầu của bạn. Voice Design hoàn hảo để thử nghiệm, Instant Voice Cloning phù hợp tạo nguyên mẫu nhanh, còn Professional Voice Cloning là nơi bạn tìm đến cho chất lượng cấp độ sản xuất.
Nếu bạn mới bắt đầu, tôi khuyên nên dùng Voice Design trước. Chỉ nâng cấp khi bạn có tình huống sử dụng rõ ràng.
Nếu bạn muốn đi sâu vào xây dựng ứng dụng dùng AI, hãy xem lộ trình kỹ năng Developing AI Applications, nơi bạn sẽ học cách dùng các công cụ AI mới nhất, bao gồm OpenAI API, Hugging Face và LangChain.
Câu hỏi thường gặp về ElevenLabs VoiceLab
ElevenLabs có miễn phí để sử dụng không?
Có. Gói miễn phí cho bạn khoảng 10.000 tín dụng mỗi tháng (tương đương khoảng 10 phút âm thanh) cùng Voice Design và thư viện giọng mặc định. Nhưng không thể dùng cho mục đích thương mại và không bao gồm nhân bản giọng; bạn sẽ cần ít nhất gói Starter để dùng Instant Voice Cloning và giấy phép thương mại.
Tôi có cần gói trả phí để dùng giọng ElevenLabs cho mục đích thương mại không?
Có. Gói miễn phí yêu cầu ghi nguồn ElevenLabs và không cấp quyền thương mại, nên bạn không thể kiếm tiền từ âm thanh đó. Giấy phép thương mại bắt đầu từ gói Starter (khoảng $6/tháng, hoặc $5 khi trả hàng năm), còn Professional Voice Cloning cho giọng cấp sản xuất yêu cầu gói Creator ($22/tháng) hoặc cao hơn.
Tôi có thể nhân bản giọng của người khác bằng ElevenLabs không?
Chỉ khi có sự cho phép rõ ràng, và quy định khác nhau theo phương pháp. Instant Voice Cloning cho phép bạn nhân bản bất kỳ giọng nào mà bạn được uỷ quyền sử dụng, nhưng Professional Voice Cloning bị giới hạn cho chính giọng của bạn và yêu cầu một bản ghi xác minh trực tiếp (kể cả khi có sự đồng ý). Dùng giọng nhân bản để mạo danh hoặc gian lận là bất hợp pháp ở hầu hết các khu vực pháp lý.
Sự khác nhau giữa Instant và Professional Voice Cloning là gì?
Instant Voice Cloning (IVC) tạo một bản nhân trong vài giây chỉ từ 1–2 phút âm thanh và lý tưởng để tạo nguyên mẫu, dù có thể bỏ lỡ các sắc thái tinh tế. Professional Voice Cloning (PVC) huấn luyện một mô hình riêng trên 30 phút đến 3 giờ âm thanh và mất vài giờ để xử lý, cho kết quả chính xác hơn nhiều, sẵn sàng cho sản xuất. Dùng IVC để thử nhanh và PVC khi chất lượng là yếu tố then chốt.
Tôi có thể dùng giọng ElevenLabs tuỳ chỉnh bên ngoài nền tảng không?
Không trực tiếp. Các bản nhân giọng không thể xuất khẩu và chỉ hoạt động trong ElevenLabs. Bạn vẫn có thể dùng chúng ở bất kỳ nơi nào nền tảng tạo âm thanh, bao gồm Text to Speech, Studio và thông qua ElevenLabs API và Python SDK, đây là cách hầu hết mọi người tích hợp giọng tuỳ chỉnh vào ứng dụng hoặc pipeline của riêng họ.
Tôi là một nhà khoa học dữ liệu có kinh nghiệm về phân tích không gian, học máy và đường ống dữ liệu. Tôi đã làm việc với GCP, Hadoop, Hive, Snowflake, Airflow và các quy trình khoa học/kỹ thuật dữ liệu khác.
