tracks
훌륭한 텍스트 음성 변환( TTS) 보이스를 찾았는데, 정작 제대로 쓰려면 비싼 요금제가 필요하고, 브랜드 톤에 맞게 바꾸기도 어렵고, 내 목소리라고 부를 수도 없었던 적이 있으실 겁니다. 많은 분들이 여기서 음성 AI의 한계에 부딪힙니다. ElevenLabs VoiceLab은 이 지점을 바꿔 줍니다.
이 가이드에서는 ElevenLabs VoiceLab의 세 가지 도구—Voice Design, Instant Voice Cloning(IVC), Professional Voice Cloning(PVC)—을 모두 살펴보겠습니다. 단계별로 진행하며 각 단계에서 무엇을 기대할 수 있는지 정확히 보여 드립니다.
시작하기 전에 필요한 사항은 다음과 같습니다.
- Voice Design은 무료 ElevenLabs 계정만 있으면 충분
- Instant Voice Cloning에는 Starter 플랜(월 $6) 필요
- Professional Voice Cloning에는 Creator 플랜(월 $22) 필요
마지막에는 최소 한 개의 커스텀 보이스를 라이브러리에 저장해, Speech Synthesis(텍스트 음성 변환), Studio, 또는 API로 바로 사용할 수 있게 됩니다.
ElevenLabs VoiceLab이란?
VoiceLab은 커스텀 보이스를 만들고 관리하기 위한 ElevenLabs의 전용 제품군입니다. 미리 만들어진 보이스가 아닌, 나만의 고유한 보이스가 필요할 때 사용하는 공간입니다.
세 가지 VoiceLab 도구를 간단히 비교하면 다음과 같습니다.
|
Tool |
What It Does |
Quality |
Input Required |
Time to Create |
Plan Required |
Best Use Case |
|
Voice Design |
합성 보이스 생성 |
양호 |
없음 |
즉시 |
무료 |
실험 |
|
IVC |
짧은 오디오로 보이스 복제 |
양호 |
~1–5분 오디오 |
즉시 |
Starter+ |
프로토타입 |
|
PVC |
고품질 보이스 복제 |
우수 |
30분 ~ 3시간+ |
1–2일 |
Creator+ |
프로덕션 |
보이스를 프로그래밍 방식으로 더 깊게 활용하고 싶다면 ElevenLabs API 가이드를 권장합니다.
VoiceLab vs. Voice Library
Voice Library와 혼동하지 않는 것이 중요합니다.
- Voice Library: 미리 만들어진 보이스를 탐색하고 사용
- VoiceLab: 내 보이스를 직접 생성하고 관리
VoiceLab에서 보이스를 만들면 선택적으로 Voice Library에 공개해 다른 사람들이 사용하도록 할 수 있습니다. 기본적으로는 내 계정에 비공개로 유지됩니다.
ElevenLabs 계정 설정하기
시작은 간단합니다.
- elevenlabs.io로 이동
- Sign Up 클릭
- Google 또는 이메일 사용
- 초기 플랫폼 선택. 보이스 제작 도구에 집중하려면 Eleven Creative를 선택하세요.

- 계정 인증
로그인 후 VoiceLab 영역으로 이동합니다:
- 왼쪽 사이드바에서 Voices 클릭
- + Create Voice 클릭

다음 네 가지 옵션이 보입니다.
- Voice Design
- Instant Voice Cloning
- Professional Voice Cloning
- Voice Remixing

모든 요금제에서 모든 기능을 사용할 수 있는 것은 아닙니다. 각 티어에서 가능한 기능은 아래 표를 확인하세요:
|
Plan |
Voice Design |
IVC |
PVC |
Commercial License |
|
Free |
Yes |
No |
No |
No |
|
Starter |
Yes |
Yes |
No |
Yes |
|
Creator |
Yes |
Yes |
Yes |
Yes |
Voice Design으로 합성 보이스 만들기
Voice Design은 가장 쉽게 시작할 수 있는 곳입니다. 녹음이 전혀 필요 없습니다. 보이스를 처음부터 생성합니다. 무료 플랜에서 유일하게 제공되는 옵션이기도 하므로 초보자에게 적합합니다.
워크플로는 단순합니다:
- 핵심 설정을 담은 프롬프트 작성
- 생성
- 미리 듣기
- 저장
경험상 팁 하나: 선택하기 전에 최소 5~10개 변형을 생성해 보세요. 같은 설정이라도 결과가 꽤 달라집니다. 시작하려면 Voice Design 버튼을 Create Voice 메뉴에서 클릭하세요. 그러면 보이스용 프롬프트를 작성할 수 있는 메뉴가 열립니다.

두 가지 세부 설정(Settings)을 조정할 수 있습니다:
- Loudness: 생성 시 보이스의 음량
- Guidance level: 다른 모델의 temperature와 유사하며, AI가 프롬프트를 얼마나 엄격히 따를지 나타냅니다. 높을수록 지시에 더 충실하고, 낮을수록 자유도가 커집니다.

AI 에이전트가 자체 미리보기 문장을 쓰도록 두거나, 설정을 끄고 직접 스크립트를 입력해 미리보기 문장을 지정할 수 있습니다.

보이스 파라미터 프롬프트 작성
프롬프트 영역을 활용해 설정을 만들어 보세요. 원하는 특정 파라미터에 맞추기 위해 다음 프롬프트 템플릿을 사용해 보시기 바랍니다:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
각 파라미터는 결과에 영향을 줍니다:
- VoiceLabs는 다국어를 지원하므로, language는 보이스의 언어적 톤을 결정합니다.
- Accent는 발음 패턴을 바꿉니다.
- Age는 피치와 톤에 영향을 줍니다.
- Gender는 음역대에 영향을 줍니다.
- Quality 수준은 오디오의 선명도를 좌우합니다.
이 요소들이 결합되는 방식이 흥미롭습니다. 때로는 예상치 못한 조합이 최고의 결과를 내므로, 실험해 볼 가치가 있습니다.
생성, 미리보기, 저장
Generate voice를 클릭하면 ElevenLabs가 짧은 샘플을 생성합니다.

원하는 만큼 다시 생성할 수 있습니다. 버전마다 조금씩 다릅니다.
마음에 드는 보이스를 찾으면:
-
Save 클릭
-
narrator_us_male_30s처럼 설명적인 이름 사용
저장 후 보이스는 My Voices와 Speech Synthesis 드롭다운에 표시됩니다.
Instant Voice Cloning(IVC)으로 보이스 복제
Instant Voice Cloning은 짧은 오디오 샘플만으로 보이스를 복제할 수 있게 해 줍니다. 빠르고 놀라울 만큼 효과적이지만 완벽하진 않습니다. 이 기능을 사용하려면 Starter(월 $6) 이상 플랜이 필요합니다.
중요: 사용할 권한이 있는 보이스만 복제하세요. 플랫폼에서 이를 확인하도록 요구하며, 반드시 준수해야 합니다. 전체 파이프라인은 매우 간단합니다:
- 오디오 준비
- 오디오 업로드
- 보이스 클론 이름 지정 및 저장
- 텍스트 음성 변환에서 테스트
오디오 샘플 준비
오디오 길이, 형식, 품질이 적절해야 합니다. 최소 길이는 약 1분이지만, 3~5분 정도가 결과가 훨씬 좋았습니다.
MP3 또는 WAV 파일(50MB 이하)을 업로드하세요. 여러 파일을 한 번에 올려도 됩니다.
최적의 복제 경험과 오디오 품질을 위해 녹음 시 다음을 권장합니다:
- 조용한 공간
- 배경 소음 없음
- 마이크와의 거리 일정 유지
다음은 피하세요:
- 복수 화자
- 휴대폰 녹음
- 과도한 후처리
업로드 및 클론 생성
Voices 대시보드로 돌아가 다음을 수행합니다:
- + Create Voice 클릭
- Instant Voice Cloning 선택
- 오디오 업로드 후 Next 클릭

- 보이스 이름 지정, 필요 시 라벨과 설명 추가
- 동의 확인
- Save Voice 클릭
다음 라벨을 드롭다운에서 선택할 수 있습니다:
- Language
- Accent(언어에 따라 옵션 제공)
- Gender
- Age(옵션: young, middle-aged, old)
보이스는 즉시 준비되며, 텍스트 음성 변환 생성기에서 바로 테스트할 수 있습니다. 여러 문장을 시도해 보며 자연스러운 부분과 어려워하는 부분을 살펴보세요.
이를 위해 왼쪽 사이드바에서 Text to Speech를 클릭하세요. (일부 버전에서는 Speech Synthesis로 표기되어 있습니다.)

비슷한 형태의 텍스트 프롬프트 창이 열립니다.

오른쪽의 Voice 드롭다운에서 My Voices의 내 보이스를 선택합니다.

테스트 문장을 작성하고 Generate speech를 클릭합니다.

선택한 보이스로 오디오 샘플이 생성됩니다. 오른쪽의 설정을 취향에 맞게 조정해 보세요. 다음과 같은 설정을 조절할 수 있습니다:
- Speed
- Stability
- Similarity
- Style Exaggeration
모델을 바꾸면 다른 옵션이 제공되기도 합니다!

파일을 저장하려면 오른쪽 다운로드 버튼을 클릭해 생성된 오디오를 저장하세요.

Professional Voice Cloning(PVC)으로 고충실도 클론 만들기
IVC가 대략적인 근사치를 제공한다면, PVC는 훨씬 실제와 가까운 결과를 줍니다. 페이싱, 호흡, 감정 같은 뉘앙스를 포착하는 단계입니다.
Creator 플랜(월 $22)이 필요합니다. ElevenLabs에 따르면 처리에는 일반적으로 2~6시간이 소요되며, 서버 부하에 따라 전체 학습 시간은 최대 24시간까지 걸릴 수 있습니다.
내레이션, 오디오북, 브랜드 보이스 에이전트 등 프로덕션급 보이스 자산을 구축하려는 경우에 가장 적합합니다. 상업적 또는 광범위한 사용을 염두에 둔 작업입니다.
학습 데이터 녹음 및 큐레이션
최상의 모델을 만들려면 요구사항이 높아집니다. 예를 들어, 최소 녹음 시간은 잡음 없는 깨끗한 오디오 30분이지만, 최상의 결과를 위해서는 3시간 이상을 권장합니다. 이만큼의 오디오는 30분 단위 샘플로 나누어 제출하는 것이 가장 좋습니다.
녹음을 최대한 활용하기 위한 팁은 다음과 같습니다:
- 조용한 녹음 환경 사용
- 가능하면 좋은 마이크 사용
- 단일 문서만 읽지 말고 다양한 내용 포함
예를 들어 내레이션 스타일을 섞어 보세요:
- 다양한 유형의 대화를 사용하고, 안내형 텍스트도 일부 읽습니다.
- 숫자와 목록을 읽어 봅니다. 발음과 문장 구조 측면에서 다양한 데이터를 제공합니다.
- 여기에 더해, 속도나 감정을 달리해 녹음해 보세요. 표현과 스타일을 풍부하게 할수록 더 나은 모델이 만들어집니다.
다음과 같은 저품질 오디오는 늘 피하세요:
- 배경 소음
- 과도한 압축
- “음”, “어” 같은 군더더기
제출 및 학습 대기
오디오 준비가 끝나면 절차는 간단합니다:
- Professional Voice Clone 선택
- Create new clone 버튼 클릭

- 모든 녹음 업로드, 이름/언어/라벨 입력

- 동의 정보 입력
- 제출
ElevenLabs가 클론을 학습하기 전에, 해당 보이스가 실제로 본인 것임을 증명해야 합니다.
이 점이 IVC와의 큰 차이입니다. 프로페셔널 복제는 본인 보이스만 복제할 수 있으며, 타인의 동의가 있더라도 그들의 보이스를 복제할 수 없습니다. 동료의 보이스가 필요하면 동료가 자신의 계정에서 PVC를 생성·검증한 뒤, 비공개 공유 링크로 공유해야 합니다.
검증은 짧은 라이브 녹음입니다. 화면에 표시된 문장을 마이크에 대고 읽습니다. 다음 두 가지가 성패를 좌우합니다:
- 샘플을 녹음할 때 사용했던 장비와 동일하거나 매우 유사한 장비를 사용하고, 비슷한 톤과 딜리버리를 유지하세요. 이 부분 불일치가 가장 흔한 실패 원인입니다.
- 각 문장은 한 번만 읽고 Stop을 누르세요. 여러 번 읽으면 검증이 실패할 수 있습니다.
실패할 경우 24시간 후 재시도하거나 지원팀에 문의할 수 있습니다. 유의할 점: 검증 단계에 도달하면 클론이 잠깁니다. 검증되지 않은 PVC는 사용자가 직접 삭제할 수 없으므로, 이 단계에 오기 전에 샘플이 정확한지 확인하세요.
보이스 클론이 준비되면 알림을 받습니다! 준비가 되면 같은 문장으로 IVC와 PVC 출력을 비교해 보세요. 차이가 분명하게 드러납니다.
프로젝트에서 VoiceLab 보이스 사용하기
보이스를 저장하면, ElevenLabs가 오디오를 생성하는 모든 곳에서 사용할 수 있게 됩니다.
사용 가능한 곳:
- Text to Speech(Speech Synthesis): 빠른 생성
- Studio: 장기 프로젝트
- Python API : 프로그래밍 방식 사용
각 도구에서 보이스를 활용하는 방법을 살펴보겠습니다. Beginner’s Guide to the ElevenLabs API는 Python API를 시작하기에 가장 좋은 자료입니다.
Text to Speech와 Studio에서 커스텀 보이스 사용
Text to Speech에서는 위에서 설명한 대로 Voices -> My Voices 드롭다운에서 보이스를 선택하면 됩니다.
Text to Speech 도구 튜닝 팁:
- Stability는 40~50%에서 시작
- Similarity는 약 75%로 설정
- 출력에 따라 조정
원하는 정확한 보이스와 녹음을 얻기까지 몇 번의 시도가 필요할 수 있습니다. 많이 실험할수록 음성 생성 과정을 더 잘 이해하게 됩니다.
Studio에서도 비슷합니다. 왼쪽 사이드바에서 Studio로 이동해 + New Blank Project를 선택합니다. 그다음 프로젝트 유형을 고를 수 있습니다:
- Audio Project 또는
- Video Project
오디오 프로젝트는 다중 보이스로 장문의 대화형 콘텐츠를 만드는 용도입니다. 비디오 프로젝트는 먼저 비디오를 업로드한 뒤, 보이스를 추가해 보이스오버를 입히는 방식입니다.
Studio에서 오디오 프로젝트 탐색
Studio 오디오 프로젝트는 다중 화자 오디오 파일을 만들 수 있습니다. 팟캐스트나 대화형 콘텐츠 생성에 유용하며, 다양한 보이스나 캐릭터가 필요한 오디오북에도 적합합니다.
Studio의 오디오 대시보드는 자유롭게 작업할 수 있는 빈 캔버스입니다. 여기서는 핵심인 보이스 구성 요소에 집중하되, 자유롭게 탐색해 보세요.

왼쪽에 보이스 섹션이 선택되어 있습니다. 프롬프트 영역에 입력하면 해당 캐릭터의 음성이 강조 표시됩니다.

다음 줄로 이동하면 다른 보이스를 선택해 다른 캐릭터를 만들 수 있습니다. 각 줄은 “문단(paragraph)”입니다:

Studio의 제한은 꽤 넉넉합니다. 프로젝트당 최대 500개의 챕터, 챕터당 최대 400개의 문단, 문단당 최대 5000자까지 가능합니다.
프로젝트 개수 한도는 요금제에 따라 다릅니다:
- Free: 5개 프로젝트
- Starter: 20개 프로젝트
- Creator: 1,000개 프로젝트
Studio에서 비디오 프로젝트 탐색
같은 절차를 따르되 이번에는 비디오 프로젝트를 선택합니다. 빈 캔버스로 이동하며 비디오 업로드를 요청받습니다:
비디오 클립을 업로드하면 왼쪽에 표시되며, 재생을 눌러 미리 볼 수 있습니다. 필요하면 여러 비디오를 추가할 수 있습니다.
그다음 왼쪽에서 Speech를 선택합니다.

오디오 프로젝트와 유사하게, 여러 보이스를 선택하고 원하는 문장을 입력할 수 있습니다. 입력하면서 Enter를 눌러 새 줄로 이동합니다. 줄마다 다른 보이스를 선택해 대화를 구성할 수 있습니다.

하단 타임라인에서 각 줄의 재생 구간을 드래그 앤 드롭으로 쉽게 조정할 수 있습니다.

사진이나 비디오가 없다면 왼쪽의 Video 탭에서 생성할 수 있습니다. 프롬프트만 작성하면 원하는 이미지나 비디오를 생성합니다.
먼저 이미지 및 비디오 베타 약관에 동의해야 합니다. 또한 무료 회원은 이미지 생성만 가능하며, 비디오 생성은 최소 Starter 멤버십(월 $5) 이상이 필요합니다.

ElevenLabs Python SDK로 커스텀 보이스 사용
Python SDK를 사용하려면 먼저 Python을 설치해야 합니다. 그런 다음 Python 환경을 만들고, 다음 명령으로 ElevenLabs SDK를 설치합니다: pip install "elevenlabs[pyaudio]"
다음으로 왼쪽 사이드바 하단을 클릭해 개발자 대시보드로 이동한 뒤 API Keys -> Create Key를 선택합니다.

API에서 접근을 허용할 도구를 선택하고 Create Key를 클릭합니다.

API 키가 팝업으로 표시되며, 반드시 복사해 두세요. 그렇지 않으면 다시 볼 수 없습니다.

다음으로 API 키를 안전한 위치 또는 프로젝트 폴더의 .env 파일에 저장합니다.
그 후 Voices 대시보드에서 My Voices를 선택합니다. 내 보이스의 Voice ID를 복사해 두세요. 나중에 쉽게 접근할 수 있는 곳에 저장하는 것을 권장합니다.

이제 ElevenLabs 보이스를 실행하는 스크립트를 만들 수 있습니다! 간단한 예시는 다음과 같습니다:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
맺음말
VoiceLab은 필요에 따라 세 가지 경로를 제공합니다. Voice Design은 실험에 적합하고, Instant Voice Cloning은 빠른 프로토타입에 유용하며, Professional Voice Cloning은 프로덕션 수준의 품질을 제공합니다.
처음이라면 먼저 Voice Design으로 시작하길 권장합니다. 명확한 활용 사례가 생기면 업그레이드하세요.
더 깊이 있게 AI 기반 애플리케이션을 만들고 싶다면 Developing AI Applications 스킬 트랙을 확인하세요. 최신 AI 개발 도구인 OpenAI API, Hugging Face, LangChain 사용법을 배울 수 있습니다.
ElevenLabs VoiceLab 자주 묻는 질문(FAQs)
ElevenLabs를 무료로 사용할 수 있나요?
예. 무료 플랜은 월 약 10,000 크레딧(오디오 약 10분 분량)과 Voice Design, 스톡 보이스 라이브러리를 제공합니다. 다만 상업적 사용은 불가하며 보이스 복제는 포함되지 않습니다. Instant Voice Cloning과 상업적 라이선스를 사용하려면 최소 Starter 플랜이 필요합니다.
ElevenLabs 보이스를 상업적으로 사용하려면 유료 플랜이 필요한가요?
예. 무료 플랜은 ElevenLabs 출처 표기를 요구하며 상업적 권리를 부여하지 않으므로 해당 오디오를 수익화할 수 없습니다. 상업적 라이선스는 Starter 플랜(월 약 $6, 연간 청구 시 월 $5)부터 제공되며, 프로덕션급 보이스를 위한 Professional Voice Cloning은 Creator 플랜(월 $22) 이상이 필요합니다.
다른 사람의 목소리를 ElevenLabs로 복제할 수 있나요?
명시적 허가가 있을 때만 가능하며, 방법에 따라 규칙이 다릅니다. Instant Voice Cloning은 사용 권한이 있는 보이스라면 복제가 가능하지만, Professional Voice Cloning은 본인 보이스로 제한되며 라이브 검증 녹음이 필요합니다(동의가 있어도 예외 없음). 복제 보이스로 사칭이나 사기를 저지르는 것은 대부분의 관할 구역에서 불법입니다.
Instant와 Professional Voice Cloning의 차이는 무엇인가요?
Instant Voice Cloning(IVC)은 1–2분 분량의 오디오만으로 수 초 내에 사용할 수 있는 클론을 만들며 프로토타입에 적합하지만, 미세한 뉘앙스는 놓칠 수 있습니다. Professional Voice Cloning(PVC)은 30분~3시간의 오디오로 전용 모델을 학습하고 처리에 몇 시간이 걸리며, 훨씬 정확하고 프로덕션에 적합한 결과를 제공합니다. 빠른 테스트는 IVC, 품질이 중요한 경우는 PVC를 권장합니다.
플랫폼 밖에서 커스텀 ElevenLabs 보이스를 사용할 수 있나요?
직접적으로는 불가합니다. 보이스 클론은 내보낼 수 없으며 ElevenLabs 내에서만 작동합니다. 대신 플랫폼의 모든 오디오 생성 지점—Text to Speech, Studio, 그리고 ElevenLabs API 및 Python SDK—에서 사용할 수 있으며, 대부분은 이 방법으로 커스텀 보이스를 앱이나 파이프라인에 연결합니다.