Перейти к основному контенту

Клонирование голоса в ElevenLabs: практическое руководство по VoiceLab

Узнайте, как клонировать свой голос с помощью Instant и Professional Voice Cloning в ElevenLabs — от записи чистого аудио до генерации речи через Python SDK.
Обновлено 3 авг. 2026 г.  · 13 мин читать

Изучить с помощью AI

Открыть в ChatGPTОткрыть в ClaudeОткрыть в Perplexity

Наверняка вы уже находили отличный голос для синтеза речи, но выяснялось, что полный доступ доступен лишь на более дорогом тарифе, голос нельзя сделать «в стиле вашего бренда», а тем более назвать своим. На этом месте многие и останавливаются в работе с голосовым ИИ. ElevenLabs VoiceLab меняет правила игры.

В этом руководстве я проведу вас по всем трём инструментам ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) и Professional Voice Cloning (PVC). Пойдём шаг за шагом, и я покажу, чего ожидать на каждом этапе.

Прежде чем начать, вот что понадобится:

  • Бесплатного аккаунта ElevenLabs достаточно для Voice Design
  • Тариф Starter ($6/мес.) требуется для Instant Voice Cloning
  • Тариф Creator ($22/мес.) требуется для Professional Voice Cloning

К концу вы сохраните как минимум один пользовательский голос в своей библиотеке — готовый к использованию в Speech Synthesis (Text to Speech), Studio или даже через API.

Что такое ElevenLabs VoiceLab?

В общих чертах VoiceLab — это специализированный набор инструментов ElevenLabs для создания и управления пользовательскими голосами. Это то место, куда вы идёте, когда хотите не готовый пресет, а оригинальный голос.

Краткое сравнение трёх инструментов VoiceLab:

Инструмент

Что делает

Качество

Требуемый ввод

Время создания

Требуемый тариф

Лучший сценарий

Voice Design

Генерирует синтетические голоса

Хорошее

Нет

Мгновенно

Бесплатно

Эксперименты

IVC

Клонирует голос из короткого аудио

Хорошее

~1–5 мин аудио

Мгновенно

Starter+

Прототипы

PVC

Клонирование голоса с высокой точностью

Отличное

30 мин — 3+ часа

1–2 дня

Creator+

Продакшн

Если хотите глубже разобраться в программном использовании голосов, рекомендую наше руководство по API ElevenLabs.

VoiceLab и библиотека голосов

Важно не путать это с библиотекой голосов.

  • Библиотека голосов: просмотр и использование готовых голосов
  • VoiceLab: создание и управление собственными голосами

Создав голос в VoiceLab, вы можете при желании опубликовать его в библиотеке голосов для общего доступа. Но по умолчанию он остаётся приватным в вашем аккаунте.

Настройка аккаунта ElevenLabs

Начать очень просто. 

  1. Перейдите на elevenlabs.io
  2. Нажмите Sign Up
  3. Войдите через Google или по email
  4. Выберите стартовую платформу. Чтобы сосредоточиться на инструментах создания голоса, выберите Eleven Creative.

Выбор между ElevenCreative и ElevenAgents

  1. Подтвердите аккаунт

После входа перейдите в раздел VoiceLab:

  • Нажмите Voices в левой боковой панели.
  • Нажмите + Create Voice

ElevenLabs VoiceLab Voices

Вы увидите четыре варианта:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

Параметры создания голоса

Обратите внимание, не все эти функции доступны на всех тарифах. Сверьтесь с таблицей ниже, чтобы понять, что доступно на каждом уровне:

Тариф

Voice Design

IVC

PVC

Коммерческая лицензия

Free

Да

Нет

Нет

Нет

Starter

Да

Да

Нет

Да

Creator

Да

Да

Да

Да

Создание синтетического голоса с помощью Voice Design

Voice Design — самый простой способ начать. Никаких записей не требуется. Голос генерируется с нуля. Это также единственный вариант на бесплатном тарифе — идеально для новичков.

Процесс простой:

  1. Напишите промпт с ключевыми настройками
  2. Сгенерируйте
  3. Прослушайте
  4. Сохраните

Совет из практики: сгенерируйте не менее 5–10 вариантов перед выбором. Даже при одинаковых настройках результаты заметно различаются. Нажмите кнопку Voice Design в меню Create Voice. Откроется окно для ввода промпта вашего голоса.

Промпт Voice Design

Вы можете нажать Settings, чтобы настроить два параметра:

  • Loudness: насколько громким будет голос при генерации. 
  • Guidance level: аналог темпратуры в других моделях — указывает, насколько строго ИИ должен следовать вашему промпту. Более высокое значение — более строгое следование, более низкое — больше свободы.

Настройка громкости и уровня направляющих

Вы можете разрешить ИИ использовать свой текст для предпрослушивания или отключить настройку и ввести собственный скрипт в поле предпрослушивания.

Текст предпрослушивания

Параметры промпта для голоса

Используйте поле промпта для генерации конфигураций. Попробуйте такой шаблон промпта, чтобы задать нужные параметры:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Каждый параметр влияет на результат:

  • VoiceLabs поддерживает несколько языков, поэтому язык определяет языковую тональность голоса
  • Акцент меняет паттерны произношения
  • Возраст влияет на высоту и тембр
  • Гендер влияет на диапазон
  • Уровень качества определяет чистоту звука

Интересно наблюдать комбинации параметров. Порой неожиданные сочетания дают лучшие результаты, так что экспериментируйте.

Генерация, предпрослушивание и сохранение

Нажмите Generate voice, и ElevenLabs создаст короткий образец.

Сгенерированные образцы голосов

Вы можете регенерировать сколько угодно. Каждый вариант будет немного отличаться.

Когда найдёте удачный вариант:

  • Нажмите Save

  • Используйте понятное имя, например narrator_us_male_30s

После сохранения голос появится в разделе My Voices и в выпадающем списке Speech Synthesis.

Клонирование голоса с помощью Instant Voice Cloning (IVC)

Instant Voice Cloning позволяет воспроизвести голос по небольшому аудиообразцу. Это быстро и на удивление эффективно, хотя и не идеально. Помните, что для этого нужен тариф Starter ($6/мес.) или выше.

Важное замечание: клонируйте только те голоса, на использование которых у вас есть разрешение. Платформа потребует подтвердить это, и к этому следует относиться серьёзно. Весь процесс довольно прост:

  • Подготовьте аудио
  • Загрузите аудио
  • Назовите и сохраните клон голоса
  • Протестируйте в Text to Speech

Подготовка аудиообразца

Ваше аудио должно быть достаточной длины, в правильном формате и приличного качества. Минимум — около минуты, но по моему опыту 3–5 минут дают гораздо лучшие результаты.

Загружайте файлы MP3 или WAV до 50 МБ; можно загрузить сразу несколько файлов. 

Чтобы добиться лучшего клонирования и хорошего качества звука, при записи рекомендую следующее:

  • Тихое помещение
  • Отсутствие фонового шума
  • Постоянная дистанция до микрофона

Старайтесь избегать следующего:

  • Несколько дикторов
  • Записи с телефона
  • Сильная постобработка

Загрузка и создание клона

Вернитесь на панель Voices и выполните следующее:

  1. Нажмите + Create Voice
  2. Выберите Instant Voice Cloning
  3. Загрузите аудио и нажмите Next

Instant Voice Clone

  1. Назовите голос, при желании добавьте метки и описание
  2. Подтвердите согласие
  3. Нажмите Save Voice

Следующие метки можно выбрать из выпадающего списка:

  • Language
  • Accent (варианты зависят от языка)
  • Gender
  • Age (варианты: young, middle-aged или old)

Голос готов сразу, и вы можете тут же протестировать его в генераторе Text to Speech. Попробуйте несколько разных предложений и обратите внимание, где звучит естественно, а где возникают сложности.

Для этого нажмите Text to Speech в левой панели. (В некоторых версиях это называлось Speech Synthesis.)

Text to Speec

Откроется окно с похожим полем для текста. 

Окно Text to Speech

Справа нажмите на выпадающий список Voice и выберите свой голос в окне My Voices.

Выбор голоса

Напишите тестовое предложение и нажмите Generate speech.

Generate speech

Будет сгенерирован аудиообразец выбранным голосом. Настраивайте параметры справа по своему вкусу. Можно регулировать, например:

  • Скорость
  • Stability
  • Similarity
  • Style Exaggeration 

Выбор разных моделей также открывает другие настройки!

Настройка сгенерированной речи

Чтобы сохранить файл, нажмите кнопку скачивания справа и сохраните сгенерированное аудио.

Сохранение сгенерированной речи

Создание высокоточного клона с Professional Voice Cloning (PVC)

Если IVC даёт приблизительное сходство, то PVC — максимально близкий к оригиналу результат. Здесь передаются нюансы — темп, дыхание, эмоции.

Требуется тариф Creator ($22/мес.). По данным ElevenLabs, обработка обычно занимает 2–6 часов, хотя полное обучение может длиться до 24 часов в зависимости от нагрузки серверов. 

Это наиболее уместный вариант, если вы создаёте голосовые активы уровня продакшн — озвучка, аудиокниги, брендированные голосовые агенты и т. п., то есть материалы для коммерческого или широкого использования.

Запись и подготовка обучающих данных

Поскольку мы стремимся к лучшей модели, требования выше. Минимальная длительность — 30 минут чистого аудио, но для оптимальных результатов целитесь в 3+ часа. Удобнее всего отправлять такие объёмы кусками по 30 минут.

Несколько советов для наилучшей записи:

  • Тихое помещение для записи
  • Хороший микрофон
  • Разнообразный контент — не читайте один и тот же текст

Например, можно варьировать стиль озвучки:

  • Разные типы диалогов. Прочитайте несколько инструктивных текстов. 
  • Произнесите числа и списки. Это добавляет разнообразие в произношении и синтаксисе. 
  • К тому же попробуйте разный темп, оттенки эмоций и т. д. Больше выразительности помогает обучить лучшую модель.

Как всегда, избегайте плохого качества звука, например:

  • Фоновый шум
  • Сильная компрессия
  • Паразитные «э-э», «м-м»

Отправка и ожидание обучения

После подготовки аудио шаги простые:

  1. Выберите Professional Voice Clone
  2. Нажмите кнопку Create new clone

Создание Professional Voice Clone

  1. Загрузите все записи, укажите имя, язык и другие метки

Детали PVC

  1. Заполните сведения о согласии
  2. Отправьте

Прежде чем ElevenLabs обучит ваш клон, они попросят подтвердить, что голос действительно ваш.

В этом ключевое отличие от IVC: профессиональное клонирование позволяет клонировать только ваш собственный голос, так что вы не сможете клонировать чужой голос даже с согласия. Если коллега хочет предоставить свой, он должен создать и верифицировать PVC в своём аккаунте, а затем поделиться им с вами по приватной ссылке.

Верификация — короткая «живая» запись. Вы читаете несколько строк с экрана в микрофон. Два фактора решающие:

  • Используйте то же или очень похожее оборудование, что и при записи образцов, и сохраняйте схожий тон и подачу. Несоответствие — самая частая причина отказа.
  • Читайте каждую строку только один раз, затем жмите Stop. Повтор может привести к отказу верификации.

Если верификация не пройдена, можно подождать 24 часа и повторить или обратиться в поддержку. Важный момент: как только вы дошли до этапа верификации, клон фиксируется. Неверифицированный PVC нельзя удалить самостоятельно, поэтому убедитесь, что образцы верны, прежде чем идти дальше.

Вы получите уведомление, когда клон будет готов! Полезный приём — сравнить результаты IVC и PVC на одном и том же предложении. Разница обычно очевидна.

Использование голосов VoiceLab в проектах

После сохранения ваш голос становится доступен по всей платформе — везде, где ElevenLabs генерирует аудио.

Вы можете использовать его в:

  • Text to Speech (Speech Synthesis) для быстрого создания
  • Studio для долгосрочных проектов
  • Python API для программного использования

Я расскажу, как использовать ваш голос в каждом из этих инструментов. Руководство для начинающих по ElevenLabs API — лучший способ начать работу с Python API.

Использование пользовательских голосов в Text to Speech и Studio

В Text to Speech просто выберите свой голос в выпадающем списке Voices -> My Voices, как мы упоминали выше.

Несколько советов по настройке Text to Speech:

  • Начните со Stability на уровне 40–50%
  • Установите Similarity около 75%
  • Дальше подстраивайте по результату

Может потребоваться несколько попыток, чтобы получить точное звучание и запись, которые вам нужны, но чем больше вы экспериментируете, тем лучше понимаете процесс генерации речи.

В Studio всё похоже. Перейдите в Studio в левой панели, затем выберите + New Blank Project. Далее выберите тип проекта:

  • Audio Project или
  • Video Project

Аудиопроект — это создание длинного разговорного контента с несколькими голосами. Видеопроект требует загрузить видео, к которому затем можно добавить озвучку.

Навигация по аудиопроекту в Studio

Аудиопроект в Studio позволяет создать многоголосый аудиофайл. Это подходит для подкастов, диалогового контента, а также аудиокниг с разными голосами или персонажами. 

Панель аудиопроекта Studio — это пустое полотно. Мы сосредоточимся на работе с голосами, но смело исследуйте остальное.

Аудиопроект в Studio

Слева вы увидите выбранную для вас голосовую дорожку. По мере ввода текста будет подсвечиваться речь персонажа.

Создание нового абзаца

Переходя на новую строку, можно выбрать другой голос — получится новый персонаж. Каждая строка — это «абзац»:

Выбор голоса для абзаца

Лимиты в Studio довольно высокие. В одном проекте — до 500 глав, в каждой до 400 абзацев. В каждом абзаце — до 5000 символов.

Число проектов зависит от тарифа:

  • Free: 5 проектов
  • Starter: 20 проектов
  • Creator: 1 000 проектов

Навигация по видеопроекту в Studio

Повторим шаги, но теперь выберем видеопроект. Вы попадёте на пустое полотно и увидите предложение загрузить видео:Видеопроект в Studio

После загрузки клипа вы увидите его слева и сможете просмотреть. При необходимости добавляйте несколько видео.

Затем слева выберите Speech.

Файлы видеопроекта

Как и в аудиопроекте, можно выбрать несколько голосов и ввести нужные реплики. Нажимайте Enter для новой строки. Можно выбирать разные голоса для каждой строки — получится диалог.

Добавление голоса к видео

Внизу можно легко подстроить тайминги для каждой строки, перетаскивая их на таймлайне.

Монтаж видео со сгенерированной речью

Если у вас нет фото или видео, их можно сгенерировать во вкладке Video слева. Просто опишите желаемое — будет создано изображение или видео. 

Обратите внимание: сначала нужно принять условия бета-версии Image and Video. Кроме того, бесплатным участникам доступна только генерация изображений; для генерации видео нужен минимум тариф Starter ($5/мес.).

Генерация видео

Доступ к пользовательским голосам через ElevenLabs Python SDK

Чтобы использовать Python SDK, сначала установите Python. Затем создайте среду Python и установите ElevenLabs SDK следующей командой: pip install "elevenlabs[pyaudio]"

Затем перейдите в консоль разработчика ElevenLabs, щёлкнув внизу левой панели, и выберите API Keys -> Create Key.

Консоль разработчика ElevenLabs

Затем выберите, к каким инструментам предоставить доступ через API, и нажмите Create Key.

Создание ключа API

Появится ключ API, который нужно скопировать, иначе вы потеряете его навсегда.

Созданный ключ API

Сохраните ключ API в файл .env в надёжном месте или папке проекта.

После этого перейдите на панель Voices и откройте My Voices. Скопируйте Voice ID вашего голоса. Сохраните его так, чтобы легко найти позже.

Копирование ID голоса

Теперь можно написать скрипт для запуска вашего голоса ElevenLabs! Вот простой пример:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

Итоги

VoiceLab предлагает три пути в зависимости от ваших задач. Voice Design — для экспериментов, Instant Voice Cloning — для быстрых прототипов, а Professional Voice Cloning — для качества уровня продакшн.

Если вы только начинаете, рекомендую сперва поработать с Voice Design. Обновляйтесь только при наличии чёткого сценария использования.

Если вы хотите глубже погрузиться в создание приложений на базе ИИ, изучите наш трек навыков Developing AI Applications, где вы научитесь использовать новейшие инструменты для разработчиков ИИ, включая OpenAI API, Hugging Face и LangChain.

Частые вопросы по ElevenLabs VoiceLab

Является ли ElevenLabs бесплатным?

Да. Бесплатный тариф предоставляет около 10 000 кредитов в месяц (примерно 10 минут аудио), а также Voice Design и стандартную библиотеку голосов. Но его нельзя использовать в коммерческих целях и он не включает клонирование голоса; для Instant Voice Cloning и коммерческой лицензии нужен как минимум тариф Starter.

Нужен ли платный тариф для коммерческого использования голосов ElevenLabs?

Да. Бесплатный тариф требует указания ElevenLabs и не даёт коммерческих прав, поэтому монетизировать такое аудио нельзя. Коммерческая лицензия доступна начиная с тарифа Starter (около $6/мес., или $5 при оплате за год), а Professional Voice Cloning для голосов уровня продакшн требует тариф Creator ($22/мес.) или выше.

Могу ли я клонировать чужой голос в ElevenLabs?

Только при явном разрешении, и правила зависят от метода. Instant Voice Cloning позволяет клонировать любой голос, на использование которого у вас есть права, тогда как Professional Voice Cloning ограничен вашим собственным голосом и требует «живой» верификации (даже при согласии другого лица). Использование клонированного голоса для выдачи себя за другое лицо или мошенничества незаконно в большинстве юрисдикций.

В чём разница между Instant и Professional Voice Cloning?

Instant Voice Cloning (IVC) создаёт рабочий клон за секунды из 1–2 минут аудио и подходит для прототипов, хотя может упускать тонкие нюансы. Professional Voice Cloning (PVC) обучает выделенную модель на 30 мин — 3 часах аудио и обрабатывается несколько часов, давая гораздо более точный, готовый к продакшн результат. Используйте IVC для быстрого теста, а PVC — когда важна максимальная точность.

Могу ли я использовать свой пользовательский голос ElevenLabs вне платформы?

Напрямую — нет. Клоны голосов нельзя экспортировать, они работают только внутри ElevenLabs. Зато вы можете использовать их везде, где платформа генерирует аудио: в Text to Speech, Studio и программно через ElevenLabs API и Python SDK — так большинство интегрирует пользовательский голос в свои приложения или пайплайны.

Темы

Учитесь ИИ с DataCamp!

Track

Разработка приложений ИИ

21 ч
Научитесь создавать приложения на базе ИИ с помощью новейших инструментов для разработчиков ИИ, включая OpenAI API, Hugging Face и LangChain.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow