Track
Наверняка вы уже находили отличный голос для синтеза речи, но выяснялось, что полный доступ доступен лишь на более дорогом тарифе, голос нельзя сделать «в стиле вашего бренда», а тем более назвать своим. На этом месте многие и останавливаются в работе с голосовым ИИ. ElevenLabs VoiceLab меняет правила игры.
В этом руководстве я проведу вас по всем трём инструментам ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) и Professional Voice Cloning (PVC). Пойдём шаг за шагом, и я покажу, чего ожидать на каждом этапе.
Прежде чем начать, вот что понадобится:
- Бесплатного аккаунта ElevenLabs достаточно для Voice Design
- Тариф Starter ($6/мес.) требуется для Instant Voice Cloning
- Тариф Creator ($22/мес.) требуется для Professional Voice Cloning
К концу вы сохраните как минимум один пользовательский голос в своей библиотеке — готовый к использованию в Speech Synthesis (Text to Speech), Studio или даже через API.
Что такое ElevenLabs VoiceLab?
В общих чертах VoiceLab — это специализированный набор инструментов ElevenLabs для создания и управления пользовательскими голосами. Это то место, куда вы идёте, когда хотите не готовый пресет, а оригинальный голос.
Краткое сравнение трёх инструментов VoiceLab:
|
Инструмент |
Что делает |
Качество |
Требуемый ввод |
Время создания |
Требуемый тариф |
Лучший сценарий |
|
Voice Design |
Генерирует синтетические голоса |
Хорошее |
Нет |
Мгновенно |
Бесплатно |
Эксперименты |
|
IVC |
Клонирует голос из короткого аудио |
Хорошее |
~1–5 мин аудио |
Мгновенно |
Starter+ |
Прототипы |
|
PVC |
Клонирование голоса с высокой точностью |
Отличное |
30 мин — 3+ часа |
1–2 дня |
Creator+ |
Продакшн |
Если хотите глубже разобраться в программном использовании голосов, рекомендую наше руководство по API ElevenLabs.
VoiceLab и библиотека голосов
Важно не путать это с библиотекой голосов.
- Библиотека голосов: просмотр и использование готовых голосов
- VoiceLab: создание и управление собственными голосами
Создав голос в VoiceLab, вы можете при желании опубликовать его в библиотеке голосов для общего доступа. Но по умолчанию он остаётся приватным в вашем аккаунте.
Настройка аккаунта ElevenLabs
Начать очень просто.
- Перейдите на elevenlabs.io
- Нажмите Sign Up
- Войдите через Google или по email
- Выберите стартовую платформу. Чтобы сосредоточиться на инструментах создания голоса, выберите Eleven Creative.

- Подтвердите аккаунт
После входа перейдите в раздел VoiceLab:
- Нажмите Voices в левой боковой панели.
- Нажмите + Create Voice

Вы увидите четыре варианта:
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

Обратите внимание, не все эти функции доступны на всех тарифах. Сверьтесь с таблицей ниже, чтобы понять, что доступно на каждом уровне:
|
Тариф |
Voice Design |
IVC |
PVC |
Коммерческая лицензия |
|
Free |
Да |
Нет |
Нет |
Нет |
|
Starter |
Да |
Да |
Нет |
Да |
|
Creator |
Да |
Да |
Да |
Да |
Создание синтетического голоса с помощью Voice Design
Voice Design — самый простой способ начать. Никаких записей не требуется. Голос генерируется с нуля. Это также единственный вариант на бесплатном тарифе — идеально для новичков.
Процесс простой:
- Напишите промпт с ключевыми настройками
- Сгенерируйте
- Прослушайте
- Сохраните
Совет из практики: сгенерируйте не менее 5–10 вариантов перед выбором. Даже при одинаковых настройках результаты заметно различаются. Нажмите кнопку Voice Design в меню Create Voice. Откроется окно для ввода промпта вашего голоса.

Вы можете нажать Settings, чтобы настроить два параметра:
- Loudness: насколько громким будет голос при генерации.
- Guidance level: аналог темпратуры в других моделях — указывает, насколько строго ИИ должен следовать вашему промпту. Более высокое значение — более строгое следование, более низкое — больше свободы.

Вы можете разрешить ИИ использовать свой текст для предпрослушивания или отключить настройку и ввести собственный скрипт в поле предпрослушивания.

Параметры промпта для голоса
Используйте поле промпта для генерации конфигураций. Попробуйте такой шаблон промпта, чтобы задать нужные параметры:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
Каждый параметр влияет на результат:
- VoiceLabs поддерживает несколько языков, поэтому язык определяет языковую тональность голоса
- Акцент меняет паттерны произношения
- Возраст влияет на высоту и тембр
- Гендер влияет на диапазон
- Уровень качества определяет чистоту звука
Интересно наблюдать комбинации параметров. Порой неожиданные сочетания дают лучшие результаты, так что экспериментируйте.
Генерация, предпрослушивание и сохранение
Нажмите Generate voice, и ElevenLabs создаст короткий образец.

Вы можете регенерировать сколько угодно. Каждый вариант будет немного отличаться.
Когда найдёте удачный вариант:
-
Нажмите Save
-
Используйте понятное имя, например
narrator_us_male_30s
После сохранения голос появится в разделе My Voices и в выпадающем списке Speech Synthesis.
Клонирование голоса с помощью Instant Voice Cloning (IVC)
Instant Voice Cloning позволяет воспроизвести голос по небольшому аудиообразцу. Это быстро и на удивление эффективно, хотя и не идеально. Помните, что для этого нужен тариф Starter ($6/мес.) или выше.
Важное замечание: клонируйте только те голоса, на использование которых у вас есть разрешение. Платформа потребует подтвердить это, и к этому следует относиться серьёзно. Весь процесс довольно прост:
- Подготовьте аудио
- Загрузите аудио
- Назовите и сохраните клон голоса
- Протестируйте в Text to Speech
Подготовка аудиообразца
Ваше аудио должно быть достаточной длины, в правильном формате и приличного качества. Минимум — около минуты, но по моему опыту 3–5 минут дают гораздо лучшие результаты.
Загружайте файлы MP3 или WAV до 50 МБ; можно загрузить сразу несколько файлов.
Чтобы добиться лучшего клонирования и хорошего качества звука, при записи рекомендую следующее:
- Тихое помещение
- Отсутствие фонового шума
- Постоянная дистанция до микрофона
Старайтесь избегать следующего:
- Несколько дикторов
- Записи с телефона
- Сильная постобработка
Загрузка и создание клона
Вернитесь на панель Voices и выполните следующее:
- Нажмите + Create Voice
- Выберите Instant Voice Cloning
- Загрузите аудио и нажмите Next

- Назовите голос, при желании добавьте метки и описание
- Подтвердите согласие
- Нажмите Save Voice
Следующие метки можно выбрать из выпадающего списка:
- Language
- Accent (варианты зависят от языка)
- Gender
- Age (варианты: young, middle-aged или old)
Голос готов сразу, и вы можете тут же протестировать его в генераторе Text to Speech. Попробуйте несколько разных предложений и обратите внимание, где звучит естественно, а где возникают сложности.
Для этого нажмите Text to Speech в левой панели. (В некоторых версиях это называлось Speech Synthesis.)

Откроется окно с похожим полем для текста.

Справа нажмите на выпадающий список Voice и выберите свой голос в окне My Voices.

Напишите тестовое предложение и нажмите Generate speech.

Будет сгенерирован аудиообразец выбранным голосом. Настраивайте параметры справа по своему вкусу. Можно регулировать, например:
- Скорость
- Stability
- Similarity
- Style Exaggeration
Выбор разных моделей также открывает другие настройки!

Чтобы сохранить файл, нажмите кнопку скачивания справа и сохраните сгенерированное аудио.

Создание высокоточного клона с Professional Voice Cloning (PVC)
Если IVC даёт приблизительное сходство, то PVC — максимально близкий к оригиналу результат. Здесь передаются нюансы — темп, дыхание, эмоции.
Требуется тариф Creator ($22/мес.). По данным ElevenLabs, обработка обычно занимает 2–6 часов, хотя полное обучение может длиться до 24 часов в зависимости от нагрузки серверов.
Это наиболее уместный вариант, если вы создаёте голосовые активы уровня продакшн — озвучка, аудиокниги, брендированные голосовые агенты и т. п., то есть материалы для коммерческого или широкого использования.
Запись и подготовка обучающих данных
Поскольку мы стремимся к лучшей модели, требования выше. Минимальная длительность — 30 минут чистого аудио, но для оптимальных результатов целитесь в 3+ часа. Удобнее всего отправлять такие объёмы кусками по 30 минут.
Несколько советов для наилучшей записи:
- Тихое помещение для записи
- Хороший микрофон
- Разнообразный контент — не читайте один и тот же текст
Например, можно варьировать стиль озвучки:
- Разные типы диалогов. Прочитайте несколько инструктивных текстов.
- Произнесите числа и списки. Это добавляет разнообразие в произношении и синтаксисе.
- К тому же попробуйте разный темп, оттенки эмоций и т. д. Больше выразительности помогает обучить лучшую модель.
Как всегда, избегайте плохого качества звука, например:
- Фоновый шум
- Сильная компрессия
- Паразитные «э-э», «м-м»
Отправка и ожидание обучения
После подготовки аудио шаги простые:
- Выберите Professional Voice Clone
- Нажмите кнопку Create new clone

- Загрузите все записи, укажите имя, язык и другие метки

- Заполните сведения о согласии
- Отправьте
Прежде чем ElevenLabs обучит ваш клон, они попросят подтвердить, что голос действительно ваш.
В этом ключевое отличие от IVC: профессиональное клонирование позволяет клонировать только ваш собственный голос, так что вы не сможете клонировать чужой голос даже с согласия. Если коллега хочет предоставить свой, он должен создать и верифицировать PVC в своём аккаунте, а затем поделиться им с вами по приватной ссылке.
Верификация — короткая «живая» запись. Вы читаете несколько строк с экрана в микрофон. Два фактора решающие:
- Используйте то же или очень похожее оборудование, что и при записи образцов, и сохраняйте схожий тон и подачу. Несоответствие — самая частая причина отказа.
- Читайте каждую строку только один раз, затем жмите Stop. Повтор может привести к отказу верификации.
Если верификация не пройдена, можно подождать 24 часа и повторить или обратиться в поддержку. Важный момент: как только вы дошли до этапа верификации, клон фиксируется. Неверифицированный PVC нельзя удалить самостоятельно, поэтому убедитесь, что образцы верны, прежде чем идти дальше.
Вы получите уведомление, когда клон будет готов! Полезный приём — сравнить результаты IVC и PVC на одном и том же предложении. Разница обычно очевидна.
Использование голосов VoiceLab в проектах
После сохранения ваш голос становится доступен по всей платформе — везде, где ElevenLabs генерирует аудио.
Вы можете использовать его в:
- Text to Speech (Speech Synthesis) для быстрого создания
- Studio для долгосрочных проектов
- Python API для программного использования
Я расскажу, как использовать ваш голос в каждом из этих инструментов. Руководство для начинающих по ElevenLabs API — лучший способ начать работу с Python API.
Использование пользовательских голосов в Text to Speech и Studio
В Text to Speech просто выберите свой голос в выпадающем списке Voices -> My Voices, как мы упоминали выше.
Несколько советов по настройке Text to Speech:
- Начните со Stability на уровне 40–50%
- Установите Similarity около 75%
- Дальше подстраивайте по результату
Может потребоваться несколько попыток, чтобы получить точное звучание и запись, которые вам нужны, но чем больше вы экспериментируете, тем лучше понимаете процесс генерации речи.
В Studio всё похоже. Перейдите в Studio в левой панели, затем выберите + New Blank Project. Далее выберите тип проекта:
- Audio Project или
- Video Project
Аудиопроект — это создание длинного разговорного контента с несколькими голосами. Видеопроект требует загрузить видео, к которому затем можно добавить озвучку.
Навигация по аудиопроекту в Studio
Аудиопроект в Studio позволяет создать многоголосый аудиофайл. Это подходит для подкастов, диалогового контента, а также аудиокниг с разными голосами или персонажами.
Панель аудиопроекта Studio — это пустое полотно. Мы сосредоточимся на работе с голосами, но смело исследуйте остальное.

Слева вы увидите выбранную для вас голосовую дорожку. По мере ввода текста будет подсвечиваться речь персонажа.

Переходя на новую строку, можно выбрать другой голос — получится новый персонаж. Каждая строка — это «абзац»:

Лимиты в Studio довольно высокие. В одном проекте — до 500 глав, в каждой до 400 абзацев. В каждом абзаце — до 5000 символов.
Число проектов зависит от тарифа:
- Free: 5 проектов
- Starter: 20 проектов
- Creator: 1 000 проектов
Навигация по видеопроекту в Studio
Повторим шаги, но теперь выберем видеопроект. Вы попадёте на пустое полотно и увидите предложение загрузить видео:
После загрузки клипа вы увидите его слева и сможете просмотреть. При необходимости добавляйте несколько видео.
Затем слева выберите Speech.

Как и в аудиопроекте, можно выбрать несколько голосов и ввести нужные реплики. Нажимайте Enter для новой строки. Можно выбирать разные голоса для каждой строки — получится диалог.

Внизу можно легко подстроить тайминги для каждой строки, перетаскивая их на таймлайне.

Если у вас нет фото или видео, их можно сгенерировать во вкладке Video слева. Просто опишите желаемое — будет создано изображение или видео.
Обратите внимание: сначала нужно принять условия бета-версии Image and Video. Кроме того, бесплатным участникам доступна только генерация изображений; для генерации видео нужен минимум тариф Starter ($5/мес.).

Доступ к пользовательским голосам через ElevenLabs Python SDK
Чтобы использовать Python SDK, сначала установите Python. Затем создайте среду Python и установите ElevenLabs SDK следующей командой: pip install "elevenlabs[pyaudio]"
Затем перейдите в консоль разработчика ElevenLabs, щёлкнув внизу левой панели, и выберите API Keys -> Create Key.

Затем выберите, к каким инструментам предоставить доступ через API, и нажмите Create Key.

Появится ключ API, который нужно скопировать, иначе вы потеряете его навсегда.

Сохраните ключ API в файл .env в надёжном месте или папке проекта.
После этого перейдите на панель Voices и откройте My Voices. Скопируйте Voice ID вашего голоса. Сохраните его так, чтобы легко найти позже.

Теперь можно написать скрипт для запуска вашего голоса ElevenLabs! Вот простой пример:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
Итоги
VoiceLab предлагает три пути в зависимости от ваших задач. Voice Design — для экспериментов, Instant Voice Cloning — для быстрых прототипов, а Professional Voice Cloning — для качества уровня продакшн.
Если вы только начинаете, рекомендую сперва поработать с Voice Design. Обновляйтесь только при наличии чёткого сценария использования.
Если вы хотите глубже погрузиться в создание приложений на базе ИИ, изучите наш трек навыков Developing AI Applications, где вы научитесь использовать новейшие инструменты для разработчиков ИИ, включая OpenAI API, Hugging Face и LangChain.
Частые вопросы по ElevenLabs VoiceLab
Является ли ElevenLabs бесплатным?
Да. Бесплатный тариф предоставляет около 10 000 кредитов в месяц (примерно 10 минут аудио), а также Voice Design и стандартную библиотеку голосов. Но его нельзя использовать в коммерческих целях и он не включает клонирование голоса; для Instant Voice Cloning и коммерческой лицензии нужен как минимум тариф Starter.
Нужен ли платный тариф для коммерческого использования голосов ElevenLabs?
Да. Бесплатный тариф требует указания ElevenLabs и не даёт коммерческих прав, поэтому монетизировать такое аудио нельзя. Коммерческая лицензия доступна начиная с тарифа Starter (около $6/мес., или $5 при оплате за год), а Professional Voice Cloning для голосов уровня продакшн требует тариф Creator ($22/мес.) или выше.
Могу ли я клонировать чужой голос в ElevenLabs?
Только при явном разрешении, и правила зависят от метода. Instant Voice Cloning позволяет клонировать любой голос, на использование которого у вас есть права, тогда как Professional Voice Cloning ограничен вашим собственным голосом и требует «живой» верификации (даже при согласии другого лица). Использование клонированного голоса для выдачи себя за другое лицо или мошенничества незаконно в большинстве юрисдикций.
В чём разница между Instant и Professional Voice Cloning?
Instant Voice Cloning (IVC) создаёт рабочий клон за секунды из 1–2 минут аудио и подходит для прототипов, хотя может упускать тонкие нюансы. Professional Voice Cloning (PVC) обучает выделенную модель на 30 мин — 3 часах аудио и обрабатывается несколько часов, давая гораздо более точный, готовый к продакшн результат. Используйте IVC для быстрого теста, а PVC — когда важна максимальная точность.
Могу ли я использовать свой пользовательский голос ElevenLabs вне платформы?
Напрямую — нет. Клоны голосов нельзя экспортировать, они работают только внутри ElevenLabs. Зато вы можете использовать их везде, где платформа генерирует аудио: в Text to Speech, Studio и программно через ElevenLabs API и Python SDK — так большинство интегрирует пользовательский голос в свои приложения или пайплайны.