跳至内容

ElevenLabs 语音克隆:VoiceLab 实操指南

学习如何在 ElevenLabs 中使用即时与专业语音克隆来复制您的声音,从录制干净音频到通过 Python SDK 生成语音。
更新 2026年8月3日  · 13分钟

用 AI 探索

在 ChatGPT 中打开在 Claude 中打开在 Perplexity 中打开

您可能曾找到过一个很棒的文本转语音声音,但很快发现完整使用被更昂贵的套餐锁定,无法让它听起来像您的品牌,更不可能称其为您自己的。这通常是大多数人在语音 AI 上遇到的瓶颈。ElevenLabs 的 VoiceLab 正是改变这一切的地方。

在本指南中,我将带您逐一了解 ElevenLabs VoiceLab 内的三款工具:Voice Design、Instant Voice Cloning(IVC,即时语音克隆)和 Professional Voice Cloning(PVC,专业语音克隆)。我们会一步一步来,每个阶段我都会说明您可以期待什么。

在开始之前,您需要准备:

  • 免费 ElevenLabs 账户即可使用 Voice Design
  • Instant Voice Cloning 需要 Starter 套餐($6/月)
  • Professional Voice Cloning 需要 Creator 套餐($22/月)

到最后,您至少会在库中保存一个自定义声音,可用于语音合成(文本转语音)、Studio,甚至通过 API 使用。

什么是 ElevenLabs VoiceLab?

从宏观上看,VoiceLab 是 ElevenLabs 用于创建和管理自定义声音的专用套件。当您想要原创的、而非预制的声音时,就来这里。

以下是三款 VoiceLab 工具的快速对比:

工具

功能

质量

所需输入

创建时间

所需套餐

最佳用例

Voice Design

生成合成声音

良好

即时

免费

试验探索

IVC

从短音频克隆声音

良好

约 1–5 分钟音频

即时

Starter+

原型制作

PVC

高保真语音克隆

卓越

30 分钟至 3+ 小时

1–2 天

Creator+

生产级应用

如果您想更深入地以编程方式使用声音,推荐阅读我们的 ElevenLabs API 指南。

VoiceLab 与 Voice Library 的区别

不要将其与 Voice Library 混淆。

  • Voice Library:浏览并使用预制声音
  • VoiceLab:创建并管理您自己的声音

在 VoiceLab 中创建声音后,您可以选择将其发布到 Voice Library 供他人使用。但默认情况下,它会在您的账户中保持私有。

设置您的 ElevenLabs 账户

上手非常简单。

  1. 访问 elevenlabs.io
  2. 点击 Sign Up
  3. 使用 Google 或邮箱注册
  4. 选择初始平台。若专注语音创建工具,请选择 Eleven Creative

在 ElevenCreative 与 ElevenAgents 之间进行选择

  1. 验证您的账户

进入后,前往 VoiceLab 区域:

  • 点击左侧边栏的 Voices
  • 点击 + Create Voice

ElevenLabs VoiceLab Voices

您会看到四个选项:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

创建声音的选项

请注意,并非所有功能在所有套餐中都可用。请查看下表以了解各套餐可用的功能:

套餐

Voice Design

IVC

PVC

商业许可

Free

可用

不可用

不可用

不可用

Starter

可用

可用

不可用

可用

Creator

可用

可用

可用

可用

使用 Voice Design 创建合成声音

Voice Design 是最容易上手的方式。您无需任何录音,它会从零生成一个声音。这也是免费套餐唯一可用的选项,非常适合初学者。

工作流程很简单:

  1. 编写包含关键设置的提示词
  2. 生成
  3. 预览
  4. 保存

一个经验小贴士:在做选择前至少生成 5 到 10 个变体。即便设置相同,结果也会有较大差异。开始吧,点击 Voice Design 按钮(位于 Create Voice 菜单中)。这会打开一个用于为您的声音编写提示词的菜单。

Voice Design 提示词

您可以点击 Settings 调整两个细节:

  • Loudness:生成时的音量大小。
  • Guidance level:类似于其他模型中的温度,表示 AI 遵循提示词的程度。引导越高,越严格遵循;越低,自由度越高。

调整音量与引导强度

您可以选择让 AI 代理使用其自带的预览文本,或者关闭该设置并在预览文本框中提供您自己的脚本。

预览文本

提示词中的语音参数

您可以在提示词区域配置生成参数。尝试使用以下提示词模板以锁定您想要的具体参数:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

每个参数都会影响输出:

  • VoiceLabs 支持多语言,因此语言决定了声音的语言音色
  • 口音会改变发音模式
  • 年龄影响音高与音色
  • 性别影响音域
  • 质量等级决定音频的干净程度

更有趣的是它们的组合。有时意想不到的搭配会产生最佳效果,因此值得多做尝试。

生成、预览与保存

点击 Generate voice,ElevenLabs 会生成一段简短样例。

已生成的样例声音

您可以不限次数地重新生成。每个版本都会略有不同。

当您找到满意的版本:

  • 点击 Save

  • 使用描述性名称,例如 narrator_us_male_30s

保存后,声音会显示在 My Voices 下,也会出现在语音合成的下拉菜单中。

使用 Instant Voice Cloning(IVC)克隆声音

Instant Voice Cloning 允许您仅用一小段音频就复制声音。它快速且效果出乎意料地好,虽然并不完美。请注意,这需要 Starter($6/月)或更高套餐。

重要提示:只克隆您有权使用的声音。平台会要求您确认此点,且务必严肃对待。完整流程相当直接:

  • 准备音频
  • 上传音频
  • 为语音克隆命名并保存
  • 在文本转语音中测试

准备音频样本

您的音频需要长度合适、格式正确且质量过关。最短约 1 分钟,但我发现 3 到 5 分钟效果更佳。

您应上传 50MB 以下的 MP3 或 WAV 文件,且可以一次上传多个文件。

为确保最佳克隆效果与良好音质,录制时建议:

  • 安静的房间
  • 无背景噪音
  • 与麦克风保持一致的距离

请尽量避免以下情况:

  • 多人说话
  • 手机录音
  • 重度后期处理

上传并创建克隆

回到 Voices 仪表盘,按以下步骤操作:

  1. 点击 + Create Voice
  2. 选择 Instant Voice Cloning
  3. 上传音频并点击 Next

Instant Voice Clone

  1. 为声音命名,可选添加标签与描述
  2. 确认授权
  3. 点击 Save Voice

可从下拉菜单选择以下标签:

  • Language
  • Accent(根据语言显示相应选项)
  • Gender
  • Age(选项:young、middle-aged 或 old)

声音会立刻就绪,您可以立即在文本转语音生成器中测试。尝试几句不同的句子,留意自然与不自然之处。

为此,点击左侧边栏的 Text to Speech。(某些版本称其为 Speech Synthesis。)

Text to Speec

这会打开一个类似的文本提示窗口。

文本转语音窗口

在右侧,点击 Voice 下拉菜单,并在 My Voices 窗口中选择您的声音。

选择声音

输入一条测试句子并点击 Generate speech

生成语音

这会使用您选择的声音生成一段音频样本。可根据偏好自由调整右侧设置。可调整的设置包括:

  • Speed
  • Stability
  • Similarity
  • Style Exaggeration

选择不同的模型也会提供不同的选项!

调整生成语音

要保存文件,点击右侧的下载按钮以保存生成的音频。

保存生成语音

使用 Professional Voice Cloning(PVC)构建高保真克隆

如果说 IVC 能给您大致的近似,PVC 则能更接近真实本音。在这里,您可以捕捉到如语速、呼吸与情感等细节。

这需要 Creator 套餐($22/月)。根据 ElevenLabs 的说法,处理通常需要 2 到 6 小时,但总训练时间可能根据服务器负载长达 24 小时。

如果我们要打造生产级语音资产,这是最相关的选择。例如旁白、有声书和品牌语音代理等可能用于商业或广泛传播的内容。

录制与整理训练数据

由于我们希望创建尽可能优秀的模型,要求也随之提高。例如,最短录音时长为 30 分钟的干净音频,但为获得最佳效果,目标应为 3 小时以上。提交如此多的音频,最佳方式是分割为每段 30 分钟的样本。

以下是一些录音建议:

  • 使用安静的录音环境
  • 尽量使用一支好的麦克风
  • 内容要多样化,不要只读单一素材

例如,您可以丰富旁白风格:

  • 使用不同类型的对话。读几段说明性文本。
  • 读一些数字与清单。这会在发音与句法上提供大量变化。
  • 此外,尝试以不同语速、不同情绪录音。更多的表现力与风格有助于训练更好的模型。

同往常一样,避免以下低质量音频:

  • 背景噪音
  • 重度压缩
  • 诸如“um”“uh”等语气词

提交并等待训练完成

准备好音频后,步骤相当简单:

  1. 选择 Professional Voice Clone
  2. 点击 Create new clone 按钮

创建专业语音克隆

  1. 上传所有录音,填写名称、语言及其他标签

PVC 详情

  1. 填写授权信息
  2. 提交

在 ElevenLabs 训练您的克隆之前,他们会要求您证明这确实是您的声音

这与 IVC 的重大不同在于:专业克隆仅允许克隆您自己的声音,即便获得他人同意,您也不能克隆他人的声音。若同事愿意提供他们的声音,他们需在自己的账户中创建并完成 PVC 验证,然后通过私密分享链接与您共享。

验证是一次简短的实时录音。您需要对着麦克风朗读几行屏幕上的文字。两点至关重要:

  • 使用与提交样本时相同或非常相似的设备,并保持相似的语气与表达。设备或表现不匹配是最常见的失败原因。
  • 每行只读一次,然后点击停止。多次朗读可能导致验证失败。

若失败,您可以等待 24 小时后重试,或联系支持。需要注意的是:一旦进入验证阶段,克隆即被锁定。您无法自行删除未验证的 PVC,因此务必在此之前确保样本无误。

当您的语音克隆准备就绪时,您会收到通知!到那时,一个实用技巧是使用相同的句子对比 IVC 与 PVC 的输出,差异通常非常明显。

在项目中使用您的 VoiceLab 声音

声音一旦保存,便可在平台上所有生成音频的地方使用。

您可以在以下功能中使用:

  • Text to Speech(语音合成),快速生成
  • Studio,用于长期项目
  • Python API,用于编程调用

我将分别介绍如何在这些工具中使用您的声音。ElevenLabs API 新手指南是开始使用 Python API 的最佳方式。

在 Text to Speech 与 Studio 中使用自定义声音

Text to Speech 中,只需在 Voices -> My Voices 下拉菜单中选择您的声音,如上所述。

一些 Text to Speech 调参建议:

  • 将 Stability 先设为 40%–50%
  • 将 Similarity 设为约 75%
  • 根据输出再行微调

可能需要多试几次才能得到理想的声音与录音,但尝试越多,您对语音生成过程的理解就越深。

Studio 中也类似。先在左侧边栏进入 Studio,然后选择 + New Blank Project。接着选择项目类型:

  • Audio Project
  • Video Project

音频项目即为多声部长音频创作,支持多个声音。视频项目需要先上传视频,然后为视频添加配音。

Studio 中的音频项目导航

Studio 音频项目可创建多说话人的音频文件,非常适合生成播客或对话式内容,乃至需要不同声音或角色的有声书内容。

Studio 的音频仪表盘是一块空白画布,方便您开展创作。我们这里聚焦关键的语音组件,其他功能欢迎您自行探索。

Studio 中的音频项目

左侧会为您选中一个语音分区。您在提示区域输入时,会高亮显示该角色的台词。

创建新段落

当您进入下一行时,可以选择不同的声音,作为不同角色。每一行都是一个“段落”:

为段落选择声音

Studio 的限制相当宽松。每个项目最多 500 个章节,每章最多 400 个段落,每段落最多 5000 个字符。

您可创建的项目数量取决于套餐:

  • Free:5 个项目
  • Starter:20 个项目
  • Creator:1,000 个项目

Studio 中的视频项目导航

按同样步骤操作,但这次选择视频项目。系统会带您进入空白画布,并要求上传视频:Studio 中的视频项目

上传视频剪辑后,您可以在左侧看到它并点击播放预览。必要时可添加多个视频。

然后在左侧选择 Speech

视频项目文件

与音频项目类似,您可以选择多个声音并输入需要的句子。输入时按下 Enter 可换到新行。可以为每一行选择不同的声音,从而形成对话。

为视频添加配音

底部时间轴上,您可以通过拖拽轻松调整每一行的时间范围。

编辑带生成语音的视频

如果您没有照片或视频,可以使用左侧的 Video 选项卡生成。只需编写提示词,即可生成所需图像或视频。

请注意,您必须先接受图像与视频的测试版服务条款。此外,免费会员仅可生成图像;生成视频至少需要 Starter 会员($5/月)。

生成视频

通过 ElevenLabs Python SDK 访问自定义声音

要使用 Python SDK,您必须首安装 Python。然后创建一个Python 环境,接着安装 ElevenLabs SDK,命令为 pip install "elevenlabs[pyaudio]"

随后,在左侧边栏底部进入 ElevenLabs 开发者面板,选择 API Keys -> Create Key

ElevenLabs 开发者控制台

接下来选择要赋予 API 的工具访问权限并点击 Create Key

创建 API 密钥

此时会弹出 API Key,您必须复制,否则将无法再次获取

已创建的 API 密钥

接着,将 API 密钥保存到安全位置或项目文件夹中的 .env 文件中。

之后,前往 Voices 仪表盘并选择 My Voices。复制您的 Voice ID,并将其保存在便于后续访问的位置。

复制 Voice ID

现在,您可以创建脚本来运行您的 ElevenLabs 声音了!示例如下:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

结语

VoiceLab 提供三条路径可选,取决于您的需求。Voice Design 适合试验,Instant Voice Cloning 适合快速原型,Professional Voice Cloning 则面向生产级质量。

若您刚刚起步,我建议先使用 Voice Design。只有在用例明确后再升级。

果您想更深入地构建 AI 驱动应用,请查看我们的 Developing AI Applications 技能路径,学习使用最新的 AI 开发工具,包括 OpenAI API、Hugging Face 和 LangChain。

ElevenLabs VoiceLab 常见问题

ElevenLabs 可以免费使用吗?

可以。免费套餐每月提供约 10,000 积分(约合 10 分钟音频),并可使用 Voice Design 和库存语音库。但不可用于商业用途,也不包含语音克隆;如需使用 Instant Voice Cloning 并获得商业许可,至少需要 Starter 套餐。

我需要付费套餐才能商业使用 ElevenLabs 的声音吗?

可以。免费套餐要求标注 ElevenLabs 来源且不授予商业权利,因此无法将该音频商业化。商业许可从 Starter 套餐开始(约 $6/月,按年计费为 $5/月),而用于生产级语音的 Professional Voice Cloning 则需要 Creator 套餐($22/月)或更高。

我可以用 ElevenLabs 克隆他人的声音吗?

仅在获得明确授权的情况下,而且不同方法规则不同。Instant Voice Cloning 允许克隆任何您被授权使用的声音,而 Professional Voice Cloning 仅限克隆您本人的声音,并需要一次实时验证录音(即便获得他人同意)。将克隆声音用于冒充或欺诈在多数司法辖区是违法的。

Instant 与 Professional 语音克隆有何区别?

Instant Voice Cloning(IVC)可用 1–2 分钟音频在数秒内生成可用的克隆,适合原型,但可能错过微妙细节。Professional Voice Cloning(PVC)会用 30 分钟至 3 小时的音频训练专用模型,处理需数小时,能得到更准确、可用于生产的结果。先用 IVC 快速测试,质量要求高时再用 PVC。

我能在平台外使用自定义的 ElevenLabs 声音吗?

不能直接导出。语音克隆无法导出,只能在 ElevenLabs 内部使用。不过,您仍可在平台生成音频的任何地方使用,包括 Text to Speech、Studio,以及通过 ElevenLabs API 与 Python SDK 以编程方式调用——这也是多数人将自定义声音接入自有应用或流程的方式。

主题

在 DataCamp 学习 AI!

Tracks

开发 AI 应用程序

21小时
学习使用最新的 AI 开发工具创建 AI 驱动的应用程序,包括 OpenAI API、Hugging Face 和 LangChain。
查看详情Right Arrow
开始课程
查看更多Right Arrow