Tracks
您可能曾找到过一个很棒的文本转语音声音,但很快发现完整使用被更昂贵的套餐锁定,无法让它听起来像您的品牌,更不可能称其为您自己的。这通常是大多数人在语音 AI 上遇到的瓶颈。ElevenLabs 的 VoiceLab 正是改变这一切的地方。
在本指南中,我将带您逐一了解 ElevenLabs VoiceLab 内的三款工具:Voice Design、Instant Voice Cloning(IVC,即时语音克隆)和 Professional Voice Cloning(PVC,专业语音克隆)。我们会一步一步来,每个阶段我都会说明您可以期待什么。
在开始之前,您需要准备:
- 免费 ElevenLabs 账户即可使用 Voice Design
- Instant Voice Cloning 需要 Starter 套餐($6/月)
- Professional Voice Cloning 需要 Creator 套餐($22/月)
到最后,您至少会在库中保存一个自定义声音,可用于语音合成(文本转语音)、Studio,甚至通过 API 使用。
什么是 ElevenLabs VoiceLab?
从宏观上看,VoiceLab 是 ElevenLabs 用于创建和管理自定义声音的专用套件。当您想要原创的、而非预制的声音时,就来这里。
以下是三款 VoiceLab 工具的快速对比:
|
工具 |
功能 |
质量 |
所需输入 |
创建时间 |
所需套餐 |
最佳用例 |
|
Voice Design |
生成合成声音 |
良好 |
无 |
即时 |
免费 |
试验探索 |
|
IVC |
从短音频克隆声音 |
良好 |
约 1–5 分钟音频 |
即时 |
Starter+ |
原型制作 |
|
PVC |
高保真语音克隆 |
卓越 |
30 分钟至 3+ 小时 |
1–2 天 |
Creator+ |
生产级应用 |
如果您想更深入地以编程方式使用声音,推荐阅读我们的 ElevenLabs API 指南。
VoiceLab 与 Voice Library 的区别
不要将其与 Voice Library 混淆。
- Voice Library:浏览并使用预制声音
- VoiceLab:创建并管理您自己的声音
在 VoiceLab 中创建声音后,您可以选择将其发布到 Voice Library 供他人使用。但默认情况下,它会在您的账户中保持私有。
设置您的 ElevenLabs 账户
上手非常简单。
- 访问 elevenlabs.io
- 点击 Sign Up
- 使用 Google 或邮箱注册
- 选择初始平台。若专注语音创建工具,请选择 Eleven Creative。

- 验证您的账户
进入后,前往 VoiceLab 区域:
- 点击左侧边栏的 Voices。
- 点击 + Create Voice

您会看到四个选项:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

请注意,并非所有功能在所有套餐中都可用。请查看下表以了解各套餐可用的功能:
|
套餐 |
Voice Design |
IVC |
PVC |
商业许可 |
|
Free |
可用 |
不可用 |
不可用 |
不可用 |
|
Starter |
可用 |
可用 |
不可用 |
可用 |
|
Creator |
可用 |
可用 |
可用 |
可用 |
使用 Voice Design 创建合成声音
Voice Design 是最容易上手的方式。您无需任何录音,它会从零生成一个声音。这也是免费套餐唯一可用的选项,非常适合初学者。
工作流程很简单:
- 编写包含关键设置的提示词
- 生成
- 预览
- 保存
一个经验小贴士:在做选择前至少生成 5 到 10 个变体。即便设置相同,结果也会有较大差异。开始吧,点击 Voice Design 按钮(位于 Create Voice 菜单中)。这会打开一个用于为您的声音编写提示词的菜单。

您可以点击 Settings 调整两个细节:
- Loudness:生成时的音量大小。
- Guidance level:类似于其他模型中的温度,表示 AI 遵循提示词的程度。引导越高,越严格遵循;越低,自由度越高。

您可以选择让 AI 代理使用其自带的预览文本,或者关闭该设置并在预览文本框中提供您自己的脚本。

提示词中的语音参数
您可以在提示词区域配置生成参数。尝试使用以下提示词模板以锁定您想要的具体参数:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
每个参数都会影响输出:
- VoiceLabs 支持多语言,因此语言决定了声音的语言音色
- 口音会改变发音模式
- 年龄影响音高与音色
- 性别影响音域
- 质量等级决定音频的干净程度
更有趣的是它们的组合。有时意想不到的搭配会产生最佳效果,因此值得多做尝试。
生成、预览与保存
点击 Generate voice,ElevenLabs 会生成一段简短样例。

您可以不限次数地重新生成。每个版本都会略有不同。
当您找到满意的版本:
-
点击 Save
-
使用描述性名称,例如
narrator_us_male_30s
保存后,声音会显示在 My Voices 下,也会出现在语音合成的下拉菜单中。
使用 Instant Voice Cloning(IVC)克隆声音
Instant Voice Cloning 允许您仅用一小段音频就复制声音。它快速且效果出乎意料地好,虽然并不完美。请注意,这需要 Starter($6/月)或更高套餐。
重要提示:只克隆您有权使用的声音。平台会要求您确认此点,且务必严肃对待。完整流程相当直接:
- 准备音频
- 上传音频
- 为语音克隆命名并保存
- 在文本转语音中测试
准备音频样本
您的音频需要长度合适、格式正确且质量过关。最短约 1 分钟,但我发现 3 到 5 分钟效果更佳。
您应上传 50MB 以下的 MP3 或 WAV 文件,且可以一次上传多个文件。
为确保最佳克隆效果与良好音质,录制时建议:
- 安静的房间
- 无背景噪音
- 与麦克风保持一致的距离
请尽量避免以下情况:
- 多人说话
- 手机录音
- 重度后期处理
上传并创建克隆
回到 Voices 仪表盘,按以下步骤操作:
- 点击 + Create Voice
- 选择 Instant Voice Cloning
- 上传音频并点击 Next

- 为声音命名,可选添加标签与描述
- 确认授权
- 点击 Save Voice
可从下拉菜单选择以下标签:
- Language
- Accent(根据语言显示相应选项)
- Gender
- Age(选项:young、middle-aged 或 old)
声音会立刻就绪,您可以立即在文本转语音生成器中测试。尝试几句不同的句子,留意自然与不自然之处。
为此,点击左侧边栏的 Text to Speech。(某些版本称其为 Speech Synthesis。)

这会打开一个类似的文本提示窗口。

在右侧,点击 Voice 下拉菜单,并在 My Voices 窗口中选择您的声音。

输入一条测试句子并点击 Generate speech。

这会使用您选择的声音生成一段音频样本。可根据偏好自由调整右侧设置。可调整的设置包括:
- Speed
- Stability
- Similarity
- Style Exaggeration
选择不同的模型也会提供不同的选项!

要保存文件,点击右侧的下载按钮以保存生成的音频。

使用 Professional Voice Cloning(PVC)构建高保真克隆
如果说 IVC 能给您大致的近似,PVC 则能更接近真实本音。在这里,您可以捕捉到如语速、呼吸与情感等细节。
这需要 Creator 套餐($22/月)。根据 ElevenLabs 的说法,处理通常需要 2 到 6 小时,但总训练时间可能根据服务器负载长达 24 小时。
如果我们要打造生产级语音资产,这是最相关的选择。例如旁白、有声书和品牌语音代理等可能用于商业或广泛传播的内容。
录制与整理训练数据
由于我们希望创建尽可能优秀的模型,要求也随之提高。例如,最短录音时长为 30 分钟的干净音频,但为获得最佳效果,目标应为 3 小时以上。提交如此多的音频,最佳方式是分割为每段 30 分钟的样本。
以下是一些录音建议:
- 使用安静的录音环境
- 尽量使用一支好的麦克风
- 内容要多样化,不要只读单一素材
例如,您可以丰富旁白风格:
- 使用不同类型的对话。读几段说明性文本。
- 读一些数字与清单。这会在发音与句法上提供大量变化。
- 此外,尝试以不同语速、不同情绪录音。更多的表现力与风格有助于训练更好的模型。
同往常一样,避免以下低质量音频:
- 背景噪音
- 重度压缩
- 诸如“um”“uh”等语气词
提交并等待训练完成
准备好音频后,步骤相当简单:
- 选择 Professional Voice Clone
- 点击 Create new clone 按钮

- 上传所有录音,填写名称、语言及其他标签

- 填写授权信息
- 提交
在 ElevenLabs 训练您的克隆之前,他们会要求您证明这确实是您的声音。
这与 IVC 的重大不同在于:专业克隆仅允许克隆您自己的声音,即便获得他人同意,您也不能克隆他人的声音。若同事愿意提供他们的声音,他们需在自己的账户中创建并完成 PVC 验证,然后通过私密分享链接与您共享。
验证是一次简短的实时录音。您需要对着麦克风朗读几行屏幕上的文字。两点至关重要:
- 使用与提交样本时相同或非常相似的设备,并保持相似的语气与表达。设备或表现不匹配是最常见的失败原因。
- 每行只读一次,然后点击停止。多次朗读可能导致验证失败。
若失败,您可以等待 24 小时后重试,或联系支持。需要注意的是:一旦进入验证阶段,克隆即被锁定。您无法自行删除未验证的 PVC,因此务必在此之前确保样本无误。
当您的语音克隆准备就绪时,您会收到通知!到那时,一个实用技巧是使用相同的句子对比 IVC 与 PVC 的输出,差异通常非常明显。
在项目中使用您的 VoiceLab 声音
声音一旦保存,便可在平台上所有生成音频的地方使用。
您可以在以下功能中使用:
- Text to Speech(语音合成),快速生成
- Studio,用于长期项目
- Python API,用于编程调用
我将分别介绍如何在这些工具中使用您的声音。ElevenLabs API 新手指南是开始使用 Python API 的最佳方式。
在 Text to Speech 与 Studio 中使用自定义声音
在 Text to Speech 中,只需在 Voices -> My Voices 下拉菜单中选择您的声音,如上所述。
一些 Text to Speech 调参建议:
- 将 Stability 先设为 40%–50%
- 将 Similarity 设为约 75%
- 根据输出再行微调
可能需要多试几次才能得到理想的声音与录音,但尝试越多,您对语音生成过程的理解就越深。
在 Studio 中也类似。先在左侧边栏进入 Studio,然后选择 + New Blank Project。接着选择项目类型:
- Audio Project 或
- Video Project
音频项目即为多声部长音频创作,支持多个声音。视频项目需要先上传视频,然后为视频添加配音。
Studio 中的音频项目导航
Studio 音频项目可创建多说话人的音频文件,非常适合生成播客或对话式内容,乃至需要不同声音或角色的有声书内容。
Studio 的音频仪表盘是一块空白画布,方便您开展创作。我们这里聚焦关键的语音组件,其他功能欢迎您自行探索。

左侧会为您选中一个语音分区。您在提示区域输入时,会高亮显示该角色的台词。

当您进入下一行时,可以选择不同的声音,作为不同角色。每一行都是一个“段落”:

Studio 的限制相当宽松。每个项目最多 500 个章节,每章最多 400 个段落,每段落最多 5000 个字符。
您可创建的项目数量取决于套餐:
- Free:5 个项目
- Starter:20 个项目
- Creator:1,000 个项目
Studio 中的视频项目导航
按同样步骤操作,但这次选择视频项目。系统会带您进入空白画布,并要求上传视频:
上传视频剪辑后,您可以在左侧看到它并点击播放预览。必要时可添加多个视频。
然后在左侧选择 Speech。

与音频项目类似,您可以选择多个声音并输入需要的句子。输入时按下 Enter 可换到新行。可以为每一行选择不同的声音,从而形成对话。

底部时间轴上,您可以通过拖拽轻松调整每一行的时间范围。

如果您没有照片或视频,可以使用左侧的 Video 选项卡生成。只需编写提示词,即可生成所需图像或视频。
请注意,您必须先接受图像与视频的测试版服务条款。此外,免费会员仅可生成图像;生成视频至少需要 Starter 会员($5/月)。

通过 ElevenLabs Python SDK 访问自定义声音
要使用 Python SDK,您必须首先 安装 Python。然后创建一个Python 环境,接着安装 ElevenLabs SDK,命令为 pip install "elevenlabs[pyaudio]"
随后,在左侧边栏底部进入 ElevenLabs 开发者面板,选择 API Keys -> Create Key。

接下来选择要赋予 API 的工具访问权限并点击 Create Key。

此时会弹出 API Key,您必须复制,否则将无法再次获取。

接着,将 API 密钥保存到安全位置或项目文件夹中的 .env 文件中。
之后,前往 Voices 仪表盘并选择 My Voices。复制您的 Voice ID,并将其保存在便于后续访问的位置。

现在,您可以创建脚本来运行您的 ElevenLabs 声音了!示例如下:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
结语
VoiceLab 提供三条路径可选,取决于您的需求。Voice Design 适合试验,Instant Voice Cloning 适合快速原型,Professional Voice Cloning 则面向生产级质量。
若您刚刚起步,我建议先使用 Voice Design。只有在用例明确后再升级。
如果您想更深入地构建 AI 驱动应用,请查看我们的 Developing AI Applications 技能路径,学习使用最新的 AI 开发工具,包括 OpenAI API、Hugging Face 和 LangChain。
ElevenLabs VoiceLab 常见问题
ElevenLabs 可以免费使用吗?
可以。免费套餐每月提供约 10,000 积分(约合 10 分钟音频),并可使用 Voice Design 和库存语音库。但不可用于商业用途,也不包含语音克隆;如需使用 Instant Voice Cloning 并获得商业许可,至少需要 Starter 套餐。
我需要付费套餐才能商业使用 ElevenLabs 的声音吗?
可以。免费套餐要求标注 ElevenLabs 来源且不授予商业权利,因此无法将该音频商业化。商业许可从 Starter 套餐开始(约 $6/月,按年计费为 $5/月),而用于生产级语音的 Professional Voice Cloning 则需要 Creator 套餐($22/月)或更高。
我可以用 ElevenLabs 克隆他人的声音吗?
仅在获得明确授权的情况下,而且不同方法规则不同。Instant Voice Cloning 允许克隆任何您被授权使用的声音,而 Professional Voice Cloning 仅限克隆您本人的声音,并需要一次实时验证录音(即便获得他人同意)。将克隆声音用于冒充或欺诈在多数司法辖区是违法的。
Instant 与 Professional 语音克隆有何区别?
Instant Voice Cloning(IVC)可用 1–2 分钟音频在数秒内生成可用的克隆,适合原型,但可能错过微妙细节。Professional Voice Cloning(PVC)会用 30 分钟至 3 小时的音频训练专用模型,处理需数小时,能得到更准确、可用于生产的结果。先用 IVC 快速测试,质量要求高时再用 PVC。
我能在平台外使用自定义的 ElevenLabs 声音吗?
不能直接导出。语音克隆无法导出,只能在 ElevenLabs 内部使用。不过,您仍可在平台生成音频的任何地方使用,包括 Text to Speech、Studio,以及通过 ElevenLabs API 与 Python SDK 以编程方式调用——这也是多数人将自定义声音接入自有应用或流程的方式。