ข้ามไปยังเนื้อหาหลัก

การโคลนเสียงด้วย ElevenLabs: คู่มือใช้งาน VoiceLab แบบลงมือทำ

เรียนรู้การโคลนเสียงด้วย Instant และ Professional Voice Cloning ใน ElevenLabs ตั้งแต่การบันทึกเสียงที่คมชัดไปจนถึงการสร้างเสียงพูดผ่าน Python SDK
อัปเดตแล้ว 3 ส.ค. 2569  · 13 นาที อ่าน

สำรวจด้วย AI

เปิดใน ChatGPTเปิดใน Claudeเปิดใน Perplexity

อาจเคยเจอเสียงแปลงข้อความเป็นคำพูดที่ถูกใจ แต่ใช้เต็มประสิทธิภาพได้เฉพาะในแพ็กเกจที่แพงกว่า ปรับให้เป็นเสียงในแบบแบรนด์ไม่ได้ และยิ่งเรียกว่าเสียงของตัวเองไม่ได้เลย ตรงนี้แหละที่หลายคนติดขัดกับ AI ด้านเสียง VoiceLab ของ ElevenLabs จะเปลี่ยนภาพนั้น

ในคู่มือนี้ ฉันจะพาไปรู้จักทั้งสามเครื่องมือใน ElevenLabs VoiceLab: Voice Design, Instant Voice Cloning (IVC) และ Professional Voice Cloning (PVC) เราจะไล่ไปทีละขั้นตอน พร้อมบอกว่าควรคาดหวังอะไรในแต่ละช่วง

ก่อนเริ่ม นี่คือสิ่งที่ต้องมี:

  • บัญชี ElevenLabs แบบฟรีก็เพียงพอสำหรับ Voice Design
  • แพ็กเกจ Starter ($6/เดือน) จำเป็นสำหรับ Instant Voice Cloning
  • แพ็กเกจ Creator ($22/เดือน) จำเป็นสำหรับ Professional Voice Cloning

เมื่อจบ คุณจะมีเสียงแบบกำหนดเองอย่างน้อยหนึ่งเสียงบันทึกไว้ในไลบรารี พร้อมใช้งานกับ Speech Synthesis (Text to Speech), Studio หรือผ่าน API ก็ได้

ElevenLabs VoiceLab คืออะไร?

ภาพรวม VoiceLab คือชุดเครื่องมือเฉพาะของ ElevenLabs สำหรับสร้างและจัดการเสียงแบบกำหนดเอง เป็นที่ที่ใช้เมื่ออยากได้เสียงต้นฉบับ ไม่ใช่เพียงเสียงสำเร็จรูป

นี่คือการเปรียบเทียบแบบย่อของสามเครื่องมือใน VoiceLab :

เครื่องมือ

สิ่งที่ทำได้

คุณภาพ

อินพุตที่ต้องใช้

เวลาสร้าง

แพ็กเกจที่ต้องมี

กรณีใช้งานที่เหมาะ

Voice Design

สร้างเสียงสังเคราะห์

ดี

ไม่มี

ทันที

ฟรี

ทดลองเล่น

IVC

โคลนเสียงจากเสียงสั้น ๆ

ดี

เสียงยาว ~1–5 นาที

ทันที

Starter+

ต้นแบบ

PVC

โคลนเสียงความเที่ยงตรงสูง

ดีเยี่ยม

30 นาที ถึง 3+ ชั่วโมง

1–2 วัน

Creator+

งานโปรดักชัน

หากอยากเจาะลึกการใช้เสียงแบบโปรแกรมมิ่ง แนะนำคู่มือ ElevenLabs API ของเรา

VoiceLab vs. Voice Library

อย่าสับสนกับ Voice Library

  • Voice Library: เรียกดูและใช้เสียงสำเร็จรูป
  • VoiceLab: สร้างและจัดการเสียงของตนเอง

เมื่อสร้างเสียงใน VoiceLab แล้ว จะเผยแพร่ไปยัง Voice Library ให้ผู้อื่นใช้ก็ได้ แต่โดยค่าเริ่มต้นจะเก็บเป็นส่วนตัวในบัญชีของคุณ

การตั้งค่าบัญชี ElevenLabs

เริ่มต้นได้ไม่ยาก 

  1. ไปที่ elevenlabs.io
  2. คลิก Sign Up
  3. ใช้ Google หรืออีเมล
  4. เลือกแพลตฟอร์มเริ่มต้น เลือก Eleven Creative เพื่อโฟกัสที่เครื่องมือสร้างเสียง

เลือก ElevenCreative หรือ ElevenAgents

  1. ยืนยันบัญชี

เมื่อล็อกอินแล้ว ไปที่ส่วน VoiceLab:

  • คลิก Voices ที่แถบด้านซ้าย
  • คลิก + Create Voice

ElevenLabs VoiceLab Voices

คุณจะเห็นสี่ตัวเลือก:

  • Voice Design
  • Instant Voice Cloning
  • Professional Voice Cloning
  • Voice Remixing

ตัวเลือกการสร้างเสียง

โปรดทราบว่าไม่ใช่ทุกฟีเจอร์จะมีให้ในทุกแพ็กเกจ ตรวจสอบตารางด้านล่างเพื่อดูว่าแต่ละแพ็กเกจได้อะไรบ้าง:

แพ็กเกจ

Voice Design

IVC

PVC

ใบอนุญาตเชิงพาณิชย์

Free

มี

ไม่มี

ไม่มี

ไม่มี

Starter

มี

มี

ไม่มี

มี

Creator

มี

มี

มี

มี

การสร้างเสียงสังเคราะห์ด้วย Voice Design

Voice Design เป็นจุดเริ่มที่ง่ายที่สุด ไม่ต้องมีไฟล์เสียง ระบบจะสร้างเสียงจากศูนย์ และยังเป็นตัวเลือกเดียวที่มีในแพ็กเกจฟรี เหมาะมากสำหรับผู้เริ่มต้น

เวิร์กโฟลว์เรียบง่าย:

  1. เขียนพรอมป์พร้อมตั้งค่าหลัก
  2. กดสร้าง
  3. พรีวิว
  4. บันทึก

ทิปจากประสบการณ์: สร้างอย่างน้อย 5 ถึง 10 แบบก่อนเลือก แม้ใช้ตั้งค่าเดียวกัน ผลลัพธ์อาจต่างกันมาก เริ่มได้เลยโดยคลิกปุ่ม Voice Design ในเมนู Create Voice จะเปิดหน้าต่างให้เขียนพรอมป์สำหรับเสียงของคุณ

พรอมป์ Voice Design

แตะ Settings เพื่อปรับสองอย่าง:

  • Loudness: ความดังของเสียงที่สร้าง 
  • Guidance level: คล้ายอุณหภูมิในโมเดลอื่น บอกว่าระบบควรทำตามพรอมป์มากน้อยแค่ไหน Guidance สูงจะยึดตามที่ระบุแน่นขึ้น ต่ำจะเปิดให้ระบบลองเล่นมากขึ้น

ปรับความดังและระดับคำแนะนำ

จะให้ AI สร้างข้อความพรีวิวเองก็ได้ หรือจะปิดการตั้งค่านั้นแล้วใส่สคริปต์ของคุณเองในช่องพรีวิว

ข้อความพรีวิว

การพรอมป์พารามิเตอร์ของเสียง

ควรใช้พื้นที่พรอมป์เพื่อกำหนดคอนฟิก ลองใช้เทมเพลตพรอมป์ต่อไปนี้เพื่อโฟกัสพารามิเตอร์ที่ต้องการ:

Native <Language>.  <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

แต่ละพารามิเตอร์มีผลต่อผลลัพธ์ดังนี้:

  • VoiceLabs รองรับหลายภาษา ภาษาจะกำหนดโทนเสียงตามภาษา
  • สำเนียงเปลี่ยนรูปแบบการออกเสียง
  • ช่วงวัยมีผลต่อระดับเสียงและโทน
  • เพศมีผลต่อช่วงเสียง
  • ระดับคุณภาพกำหนดความใสสะอาดของเสียง

ความน่าสนใจคือการผสมกันของพารามิเตอร์ บางครั้งส่วนผสมที่ไม่คาดคิดกลับให้ผลดีที่สุด คุ้มค่าที่จะลอง

การสร้าง พรีวิว และบันทึก

คลิก Generate voice แล้ว ElevenLabs จะสร้างตัวอย่างสั้น ๆ

ตัวอย่างเสียงที่สร้าง

กดสร้างใหม่ได้ไม่จำกัด แต่ละเวอร์ชันจะต่างกันเล็กน้อย

เมื่อเจอเสียงที่ชอบ:

  • คลิก Save

  • ตั้งชื่ออธิบายชัดเจน เช่น narrator_us_male_30s

หลังบันทึก เสียงจะปรากฏใต้ My Voices และในเมนูดรอปดาวน์ของ Speech Synthesis

การโคลนเสียงด้วย Instant Voice Cloning (IVC)

Instant Voice Cloning ให้โคลนเสียงได้จากตัวอย่างเสียงสั้น ๆ รวดเร็วและได้ผลดีเกินคาด แม้ไม่สมบูรณ์แบบ ต้องมีแพ็กเกจ Starter ($6/เดือน) ขึ้นไป

สำคัญ: โคลนเฉพาะเสียงที่ได้รับอนุญาต แพลตฟอร์มจะขอให้ยืนยัน และควรปฏิบัติอย่างจริงจัง เวิร์กโฟลว์ทั้งหมดค่อนข้างตรงไปตรงมา:

  • เตรียมไฟล์เสียง
  • อัปโหลดไฟล์เสียง
  • ตั้งชื่อและบันทึกเสียงที่โคลน
  • ทดสอบใน Text to Speech

การเตรียมตัวอย่างเสียง

ไฟล์เสียงควรมีความยาวเหมาะสม รูปแบบถูกต้อง และคุณภาพดี ความยาวขั้นต่ำประมาณหนึ่งนาที แต่จากที่ลอง ความยาว 3 ถึง 5 นาทีให้ผลลัพธ์ดีกว่า

อัปโหลดไฟล์ MP3 หรือ WAV ขนาดไม่เกิน 50MB ได้ และอัปโหลดหลายไฟล์พร้อมกันได้เสมอ 

เพื่อให้โคลนได้ดีที่สุดและคุณภาพเสียงดี แนะนำดังนี้ขณะบันทึก:

  • ห้องเงียบ
  • ไม่มีเสียงรบกวนพื้นหลัง
  • ระยะไมโครโฟนคงที่

ควรหลีกเลี่ยง:

  • มีผู้พูดหลายคน
  • บันทึกด้วยโทรศัพท์
  • การปรับแต่งเสียงหนัก ๆ ภายหลัง

การอัปโหลดและสร้างโคลน

กลับไปที่แดชบอร์ด Voices แล้วทำตามนี้:

  1. คลิก + Create Voice
  2. เลือก Instant Voice Cloning
  3. อัปโหลดไฟล์เสียงแล้วคลิก Next

Instant Voice Clone

  1. ตั้งชื่อเสียง เพิ่มป้ายกำกับและคำอธิบายได้ตามต้องการ
  2. ยืนยันความยินยอม
  3. คลิก Save Voice

ป้ายกำกับที่เลือกได้จากเมนูดรอปดาวน์มีดังนี้:

  • Language
  • Accent (จะแสดงตัวเลือกตามภาษา)
  • Gender
  • Age (ตัวเลือก: young, middle-aged, old)

เสียงพร้อมใช้งานทันที และทดสอบได้เลยในตัวสร้าง text-to-speech ลองหลาย ๆ ประโยค สังเกตจุดที่ฟังเป็นธรรมชาติและจุดที่ยังติดขัด

ให้ทำโดยคลิกที่ Text to Speech บนแถบซ้าย (บางเวอร์ชันเรียกว่า Speech Synthesis)

Text to Speec

จะเปิดหน้าต่างที่คล้ายกับหน้าต่างพรอมป์ข้อความ 

หน้าต่าง Text to Speech

ด้านขวา คลิกดรอปดาวน์ Voice แล้วเลือกเสียงจากหน้าต่าง My Voices ของคุณ

การเลือกเสียง

พิมพ์ประโยคทดสอบแล้วคลิก Generate speech.

Generate speech

ระบบจะสร้างตัวอย่างเสียงด้วยเสียงที่เลือก ปรับการตั้งค่าด้านขวาให้ตรงใจได้ เช่น

  • ความเร็ว
  • Stability
  • Similarity
  • Style Exaggeration 

การเลือกโมเดลที่ต่างกันก็ให้ตัวเลือกที่ต่างกันได้เช่นกัน!

ปรับเสียงที่สร้าง

หากต้องการบันทึกไฟล์ ให้คลิกปุ่มดาวน์โหลดด้านขวาเพื่อบันทึกเสียงที่สร้าง

บันทึกเสียงที่สร้าง

การสร้างโคลนความเที่ยงตรงสูงด้วย Professional Voice Cloning (PVC)

ถ้า IVC ให้ภาพรวมคร่าว ๆ PVC จะให้ผลลัพธ์ที่ใกล้เคียงของจริงมากกว่า ตรงนี้จะเก็บรายละเอียดอย่างจังหวะ ลมหายใจ และอารมณ์

ต้องมีแพ็กเกจ Creator ($22/เดือน) ตามข้อมูล ElevenLabs การประมวลผลใช้เวลา 2 ถึง 6 ชั่วโมง แต่รวมเวลาเทรนทั้งหมดอาจนานถึง 24 ชั่วโมง ขึ้นกับโหลดเซิร์ฟเวอร์ 

นี่เหมาะที่สุดหากต้องการสร้างทรัพย์สินเสียงระดับโปรดักชัน เช่น การบรรยายหนังสือเสียง และเอเจนต์เสียงประจำแบรนด์ สิ่งที่อาจใช้งานเชิงพาณิชย์หรือวงกว้าง

การบันทึกและคัดสรรข้อมูลเทรน

เพราะเราต้องการโมเดลที่ดีที่สุด ข้อกำหนดจึงสูงขึ้น เช่น เวลาบันทึกขั้นต่ำ 30 นาทีของเสียงใสสะอาด แต่เพื่อผลลัพธ์ที่ดีที่สุด เล็งไว้ที่ 3 ชั่วโมงขึ้นไป วิธีส่งจำนวนเสียงมาก ๆ ที่ดีคือแบ่งเป็นไฟล์ละ 30 นาที

เคล็ดลับเพื่อให้การบันทึกคุ้มค่าสุด:

  • ใช้สภาพแวดล้อมบันทึกที่เงียบ
  • พยายามใช้ไมโครโฟนที่ดี
  • เนื้อหาหลากหลาย ไม่อ่านจากเอกสารเดียว

ตัวอย่างเช่น อาจสลับสไตล์การบรรยายของคุณ:

  • ใช้บทสนทนาหลายแบบ อ่านข้อความเชิงสอนสักหน่อย 
  • อ่านตัวเลขและรายการบางส่วน จะเพิ่มความหลากหลายเรื่องการออกเสียงและไวยากรณ์ 
  • เพิ่มเติม ลองบันทึกด้วยจังหวะต่างกัน อารมณ์ต่างกัน เป็นต้น ใส่สไตล์และอารมณ์จะช่วยให้โมเดลดียิ่งขึ้น

เช่นเคย หลีกเลี่ยงเสียงคุณภาพแย่ เช่น:

  • เสียงรบกวนพื้นหลัง
  • การบีบอัดหนัก
  • คำเติมอย่าง “เอ่อ” “อืม”

การส่งและรอการเทรน

เมื่อตระเตรียมไฟล์เสียงเสร็จ ขั้นตอนต่อไปค่อนข้างง่าย:

  1. เลือก Professional Voice Clone
  2. คลิกปุ่ม Create new clone

สร้าง Professional Voice Clone

  1. อัปโหลดไฟล์บันทึกทั้งหมด กรอกชื่อ ภาษา และป้ายกำกับอื่น ๆ

รายละเอียด PVC

  1. กรอกรายละเอียดความยินยอม
  2. ส่ง

ก่อน ElevenLabs จะเทรนโคลนของคุณ เขาจะให้พิสูจน์ว่าเสียงเป็นของคุณจริง

นี่คือความต่างจาก IVC: การโคลนแบบมืออาชีพให้โคลนได้เฉพาะเสียงของคุณเอง จึงโคลนเสียงคนอื่นไม่ได้ แม้มีความยินยอม หากเพื่อนร่วมงานอยากให้ใช้เสียง เขาต้องสร้างและยืนยัน PVC ในบัญชีของตนเอง แล้วแชร์ให้คุณผ่านลิงก์ส่วนตัว

การยืนยันคือการบันทึกสดสั้น ๆ อ่านบรรทัดบนหน้าจอเข้ามิครอฟโฟน มีสองอย่างที่ชี้เป็นชี้ตาย:

  • ใช้ อุปกรณ์ชนิดเดียวกันหรือใกล้เคียงกับที่ใช้บันทึกตัวอย่าง และรักษาโทน/การพูดให้คล้ายกัน ความไม่สอดคล้องตรงนี้คือสาเหตุหลักที่ทำให้ไม่ผ่าน
  • อ่านแต่ละบรรทัดเพียงครั้งเดียว แล้วกด Stop การอ่านซ้ำอาจทำให้ไม่ผ่านการยืนยัน

หากไม่ผ่าน ให้รอ 24 ชั่วโมงแล้วลองใหม่ หรือ ติดต่อซัพพอร์ต หมายเหตุ: เมื่อเข้าสู่ขั้นตอนยืนยันแล้ว โคลนจะถูกล็อก ไม่สามารถลบ PVC ที่ยังไม่ยืนยันได้เอง จึงควรตรวจสอบตัวอย่างให้พร้อมก่อนถึงขั้นนี้

เมื่อโคลนเสียงของคุณพร้อม จะได้รับการแจ้งเตือน! จากนั้นเทคนิคหนึ่งที่มีประโยชน์คือเปรียบเทียบผล IVC และ PVC โดยใช้ประโยคเดียวกัน ความต่างจะเห็นได้ชัดเจน

การใช้เสียงจาก VoiceLab ในโปรเจกต์

เมื่อบันทึกเสียงแล้ว จะพร้อมใช้งานทั่วทั้งแพลตฟอร์มในทุกที่ที่ ElevenLabs สร้างเสียง

ใช้งานได้ใน:

  • Text to Speech (Speech Synthesis) สำหรับการสร้างอย่างรวดเร็ว
  • Studio สำหรับโปรเจกต์ระยะยาว
  • Python API สำหรับการใช้งานเชิงโปรแกรม

ฉันจะอธิบายการใช้เสียงของคุณกับแต่ละเครื่องมือ Beginner’s Guide to the ElevenLabs API คือวิธีเริ่มที่ดีที่สุดสำหรับ Python API

การใช้เสียงแบบกำหนดเองใน Text to Speech และ Studio

ใน Text to Speech เพียงเลือกเสียงของคุณจากดรอปดาวน์ Voices -> My Voices ตามที่กล่าวไปข้างต้น

ทิปสำหรับการปรับในเครื่องมือ Text to Speech:

  • เริ่มตั้งค่า Stability ที่ 40–50 เปอร์เซ็นต์
  • ตั้ง Similarity ราว 75 เปอร์เซ็นต์
  • ปรับตามผลลัพธ์

อาจต้องลองหลายครั้งกว่าจะได้เสียงและไฟล์ที่ต้องการ แต่ยิ่งลองมาก ยิ่งเข้าใจกระบวนการสร้างเสียงมากขึ้น

ใน Studio ก็คล้ายกัน ไปที่ Studio ทางแถบซ้าย แล้วเลือก + New Blank Project จากนั้นเลือกประเภทโปรเจกต์:

  • Audio Project หรือ
  • Video Project

โปรเจกต์เสียงคือการสร้างคอนเทนต์บทสนทนายาว ๆ ด้วยหลายเสียง ส่วนโปรเจกต์วิดีโอต้องอัปโหลดวิดีโอก่อน แล้วค่อยใส่เสียงพากย์ทับวิดีโอ

การนำทางโปรเจกต์เสียงใน Studio

โปรเจกต์เสียงใน Studio ช่วยให้สร้างไฟล์เสียงหลายผู้พูด เหมาะสำหรับพอดแคสต์หรือบทสนทนา รวมถึงหนังสือเสียงที่ต้องการเสียงต่างตัวละคร 

แดชบอร์ดเสียงของ Studio เป็นผืนผ้าใบเปล่าสำหรับทำงาน เราจะโฟกัสที่ส่วนเสียงเป็นหลัก แต่ลองเล่นส่วนอื่นได้ตามสะดวก

โปรเจกต์เสียงใน Studio

ด้านซ้ายจะเห็นส่วนเสียงที่เลือกไว้ให้ เมื่อพิมพ์ในพื้นที่พรอมป์ ระบบจะไฮไลต์คำพูดของตัวละครให้

สร้างย่อหน้าใหม่

เมื่อขึ้นบรรทัดใหม่ จะเลือกเสียงอื่นให้เป็นตัวละครอื่นได้ แต่ละบรรทัดคือ “ย่อหน้า”:

เลือกเสียงสำหรับย่อหน้า

ขีดจำกัดของ Studio ค่อนข้างสูง โปรเจกต์หนึ่งมีได้สูงสุด 500 บท แต่ละบทมีได้สูงสุด 400 ย่อหน้า และแต่ละย่อหน้ามีได้สูงสุด 5,000 อักขระ

จำนวนโปรเจกต์ขึ้นกับแพ็กเกจของคุณ:

  • Free: 5 โปรเจกต์
  • Starter: 20 โปรเจกต์
  • Creator: 1,000 โปรเจกต์

การนำทางโปรเจกต์วิดีโอใน Studio

ทำตามขั้นตอนเดิม แต่ครั้งนี้เลือกโปรเจกต์วิดีโอ จะเข้าสู่ผ้าใบเปล่าและให้คุณอัปโหลดวิดีโอ:โปรเจกต์วิดีโอใน Studio

เมื่ออัปโหลดคลิปวิดีโอแล้ว จะเห็นทางซ้ายและกดเล่นเพื่อพรีวิวได้ เพิ่มวิดีโอหลายคลิปได้หากจำเป็น

จากนั้นไปที่ซ้าย เลือก Speech.

ไฟล์โปรเจกต์วิดีโอ

คล้ายโปรเจกต์เสียง เลือกหลายเสียงและพิมพ์ประโยคที่ต้องการได้ ระหว่างพิมพ์กด Enter เพื่อขึ้นบรรทัดใหม่ เลือกเสียงต่างกันในแต่ละบรรทัดเพื่อให้เกิดบทสนทนาได้

เพิ่มเสียงให้วิดีโอ

ด้านล่าง ปรับช่วงเวลาแต่ละบรรทัดได้ง่าย ๆ ด้วยการลากและวางบนไทม์ไลน์

ตัดต่อวิดีโอพร้อมเสียงที่สร้าง

หากไม่มีรูปหรือวิดีโอ สามารถสร้างได้จากแท็บ Video ทางซ้าย เพียงเขียนพรอมป์ ระบบจะสร้างรูปหรือวิดีโอตามต้องการ 

โปรดทราบว่าต้องยอมรับเงื่อนไขการใช้งานเบตาสำหรับ Image และ Video ก่อน และสมาชิกฟรีสร้างได้เฉพาะรูปภาพ ต้องมีอย่างน้อยแพ็กเกจ Starter ($5/เดือน) จึงจะสร้างวิดีโอได้

สร้างวิดีโอ

การเข้าถึงเสียงแบบกำหนดเองผ่าน ElevenLabs Python SDK

ในการใช้ Python SDK ต้องติดตั้ง Python ก่อน จากนั้นสร้าง สภาพแวดล้อม Python แล้วติดตั้ง ElevenLabs SDK โดยใช้คำสั่งต่อไปนี้: pip install "elevenlabs[pyaudio]"

ถัดไป ไปที่แดชบอร์ดสำหรับนักพัฒนา ElevenLabs โดยคลิกที่ด้านล่างของแถบซ้ายแล้วเลือก API Keys -> Create Key.

คอนโซลนักพัฒนา ElevenLabs

จากนั้นเลือกเครื่องมือที่ต้องการให้สิทธิ์เข้าถึง API แล้วคลิก Create Key.

สร้าง API key

จะปรากฏ API Key ซึ่งคุณต้องคัดลอก มิฉะนั้นจะหายถาวร.

สร้าง API key แล้ว

จากนั้นบันทึก API key ลงไฟล์ .env ในที่ปลอดภัยหรือโฟลเดอร์โปรเจกต์

ถัดมา ไปที่แดชบอร์ด Voices แล้วเลือก My Voices คัดลอก Voice ID ของเสียงคุณ แนะนำให้บันทึกไว้ในที่เข้าถึงง่าย

คัดลอก Voice ID

ตอนนี้สามารถเขียนสคริปต์เพื่อรันเสียง ElevenLabs ของคุณได้แล้ว! นี่คือตัวอย่างง่าย ๆ :

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs

# Loads the .env file from the folder
load_dotenv()

# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"

# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
    voice_id=custom_narrator_voice_id,
    text="Thanks for getting through this DataCamp article!.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)

# Saves the audio bytes to a file 
with open("output.mp3", "wb") as f:
    f.write(audio_bytes)

สรุป

VoiceLab มีสามเส้นทางให้เลือกตามความต้องการ Voice Design เหมาะสำหรับการทดลอง IVC เหมาะสำหรับต้นแบบรวดเร็ว และ PVC คือทางเลือกเพื่อคุณภาพระดับโปรดักชัน

หากเพิ่งเริ่มต้น แนะนำให้ใช้ Voice Design ก่อน อัปเกรดเมื่อมีกรณีใช้งานชัดเจน

หากต้องการเจาะลึกการสร้างแอปพลิเคชันที่ขับเคลื่อนด้วย AI ดู Developing AI Applications skill track ของเรา ซึ่งสอนการใช้เครื่องมือสำหรับนักพัฒนา AI ล่าสุด รวมถึง OpenAI API, Hugging Face และ LangChain

คำถามที่พบบ่อยเกี่ยวกับ ElevenLabs VoiceLab

ElevenLabs ใช้ได้ฟรีหรือไม่?

มีให้ใช้แบบฟรี แพ็กเกจฟรีให้เครดิตราว 10,000 ต่อเดือน (ประมาณเสียงยาว 10 นาที) พร้อม Voice Design และคลังเสียงสต็อก แต่ใช้เชิงพาณิชย์ไม่ได้ และไม่มีการโคลนเสียง หากต้องการ Instant Voice Cloning และสิทธิ์เชิงพาณิชย์ ต้องมีอย่างน้อยแพ็กเกจ Starter

ต้องมีแพ็กเกจแบบจ่ายเงินหรือไม่ หากต้องการใช้เสียง ElevenLabs เชิงพาณิชย์?

ได้ แต่ต้องมีแพ็กเกจที่เสียเงิน แพ็กเกจฟรีต้องแสดงเครดิต ElevenLabs และไม่มีสิทธิ์เชิงพาณิชย์ จึงไม่สามารถทำรายได้จากเสียงนั้น ใบอนุญาตเชิงพาณิชย์เริ่มที่แพ็กเกจ Starter (ประมาณ $6/เดือน หรือ $5 เมื่อบิลรายปี) ส่วน Professional Voice Cloning สำหรับเสียงระดับโปรดักชันต้องใช้แพ็กเกจ Creator ($22/เดือน) ขึ้นไป

สามารถโคลนเสียงของผู้อื่นด้วย ElevenLabs ได้ไหม?

ทำได้เฉพาะเมื่อได้รับอนุญาตชัดเจน และกฎจะแตกต่างตามวิธี IVC ให้โคลนเสียงใดก็ได้ที่คุณได้รับอนุญาตให้ใช้ แต่ PVC จำกัดให้โคลนได้เฉพาะเสียงของคุณเอง และต้องยืนยันด้วยการบันทึกสด (แม้จะได้รับความยินยอมแล้วก็ตาม) การใช้เสียงที่โคลนเพื่อสวมรอยหรือฉ้อโกงเป็นสิ่งผิดกฎหมายในหลายพื้นที่อำนาจศาล

ความต่างระหว่าง Instant และ Professional Voice Cloning คืออะไร?

Instant Voice Cloning (IVC) ให้เสียงโคลนที่ใช้งานได้ภายในไม่กี่วินาทีจากเสียงเพียง 1–2 นาที เหมาะกับต้นแบบ แม้ยังเก็บรายละเอียดได้ไม่หมด ขณะที่ Professional Voice Cloning (PVC) เทรนโมเดลเฉพาะจากเสียง 30 นาทีถึง 3 ชั่วโมง ใช้เวลาประมวลผลไม่กี่ชั่วโมง ให้ผลลัพธ์แม่นยำและพร้อมโปรดักชัน ใช้ IVC เมื่อต้องการทดสอบเร็ว ใช้ PVC เมื่อต้องการคุณภาพ

ใช้เสียง ElevenLabs แบบกำหนดเองนอกแพลตฟอร์มได้ไหม?

ไม่สามารถเอาออกไปใช้งานตรง ๆ ได้ เสียงที่โคลนจะใช้งานได้เฉพาะภายใน ElevenLabs เท่านั้น แต่ยังใช้ได้ทุกที่ที่แพลตฟอร์มสร้างเสียง เช่น Text to Speech, Studio และผ่าน ElevenLabs API และ Python SDK ซึ่งเป็นวิธีที่คนนิยมเชื่อมเสียงของตนเข้ากับแอปหรือไปป์ไลน์ของตนเอง

หัวข้อ

เรียนรู้ AI กับ DataCamp!

Tracks

การพัฒนาแอปพลิเคชัน AI

21 ชม.
เรียนรู้การสร้างแอปพลิเคชันที่ขับเคลื่อนด้วย AI ด้วยเครื่องมือสำหรับนักพัฒนา AI ล่าสุด รวมถึง OpenAI API, Hugging Face และ LangChain
ดูรายละเอียดRight Arrow
เริ่มหลักสูตร
ดูเพิ่มเติมRight Arrow