Track
अक्सर आपने कोई बढ़िया टेक्स्ट-टू-स्पीच आवाज़ ढूंढी होगी, लेकिन पता चला होगा कि पूरा उपयोग महंगे टियर के पीछे लॉक है, आप उसे अपने ब्रांड जैसा नहीं बना सकते, और तो और उसे अपनी आवाज़ नहीं कह सकते। अधिकतर लोग यहीं आकर वॉइस AI के साथ अटक जाते हैं। ElevenLabs VoiceLab यहीं तस्वीर बदलता है।
इस गाइड में, मैं आपको ElevenLabs VoiceLab के तीनों टूल्स—वॉइस डिज़ाइन, इंस्टेंट वॉइस क्लोनिंग (IVC), और प्रोफेशनल वॉइस क्लोनिंग (PVC)—के बारे में चरण-दर-चरण बताऊंगा और हर स्टेज पर क्या उम्मीद रखनी है, दिखाऊंगा।
शुरू करने से पहले, आपको ये चाहिए:
- वॉइस डिज़ाइन के लिए एक फ्री ElevenLabs अकाउंट पर्याप्त है
- इंस्टेंट वॉइस क्लोनिंग के लिए स्टार्टर प्लान ($6/माह) आवश्यक है
- प्रोफेशनल वॉइस क्लोनिंग के लिए क्रिएटर प्लान ($22/माह) आवश्यक है
अंत तक पहुंचते-पहुंचते, आपकी लाइब्रेरी में कम-से-कम एक कस्टम आवाज़ सेव होगी, जिसे आप स्पीच सिंथेसिस (टेक्स्ट टू स्पीच), स्टूडियो, या API के जरिए भी इस्तेमाल कर सकते हैं।
ElevenLabs VoiceLab क्या है?
ऊपरी स्तर पर, VoiceLab कस्टम आवाज़ें बनाने और मैनेज करने के लिए ElevenLabs का समर्पित सूट है। जब आपको कुछ मौलिक चाहिए—सिर्फ पहले से बनी हुई चीज़ें नहीं—तो आप यहीं आते हैं।
यहां VoiceLab के तीनों टूल्स का एक त्वरित तुलना-सार:
|
टूल |
यह क्या करता है |
गुणवत्ता |
आवश्यक इनपुट |
बनाने में समय |
आवश्यक प्लान |
सर्वोत्तम उपयोग |
|
वॉइस डिज़ाइन |
कृत्रिम आवाज़ें जेनरेट करता है |
अच्छा |
कुछ नहीं |
तुरंत |
फ्री |
प्रयोग/एक्सपेरिमेंटेशन |
|
IVC |
छोटे ऑडियो से आवाज़ क्लोन करता है |
अच्छा |
~1–5 मिनट ऑडियो |
तुरंत |
स्टार्टर+ |
प्रोटोटाइप |
|
PVC |
हाई-फिडेलिटी वॉइस क्लोनिंग |
उत्कृष्ट |
30 मिनट से 3+ घंटे |
1–2 दिन |
क्रिएटर+ |
प्रोडक्शन |
यदि आप वॉइस को प्रोग्रामेटिक तरीके से उपयोग करना और गहराई से सीखना चाहते हैं, तो हमारी ElevenLabs API गाइड देखें।
वॉइसलैब बनाम वॉइस लाइब्रेरी
इसे वॉइस लाइब्रेरी से मिलाना ठीक नहीं होगा।
- वॉइस लाइब्रेरी: पहले से बनी आवाज़ों को ब्राउज़ करें और उपयोग करें
- वॉइसलैब: अपनी खुद की आवाज़ें बनाएं और प्रबंधित करें
एक बार जब आप वॉइसलैब में कोई आवाज़ बनाते हैं, तो आप चाहें तो उसे दूसरों के उपयोग के लिए वॉइस लाइब्रेरी में प्रकाशित कर सकते हैं। लेकिन डिफ़ॉल्ट रूप से, वह आपके अकाउंट में निजी रहती है।
अपना ElevenLabs अकाउंट सेट करना
शुरू करना सीधा-सादा है।
- elevenlabs.io पर जाएं
- Sign Up पर क्लिक करें
- Google या ईमेल का उपयोग करें
- अपना प्रारंभिक प्लेटफ़ॉर्म चुनें। वॉइस क्रिएशन टूल्स पर फोकस करने के लिए Eleven Creative चुनें।

- अपना अकाउंट वेरिफ़ाई करें
लॉगिन होने के बाद, VoiceLab क्षेत्र में जाएं:
- बाएं साइडबार में Voices पर क्लिक करें।
- + Create Voice पर क्लिक करें

आपको चार विकल्प दिखेंगे:
- वॉइस डिज़ाइन
- इंस्टेंट वॉइस क्लोनिंग
- प्रोफेशनल वॉइस क्लोनिंग
- वॉइस रीमिक्सिंग

ध्यान दें कि सभी फीचर सभी टियर के लिए उपलब्ध नहीं हैं। नीचे दी गई तालिका देखें कि प्रत्येक टियर पर क्या उपलब्ध है:
|
प्लान |
वॉइस डिज़ाइन |
IVC |
PVC |
कमर्शियल लाइसेंस |
|
फ्री |
हाँ |
नहीं |
नहीं |
नहीं |
|
स्टार्टर |
हाँ |
हाँ |
नहीं |
हाँ |
|
क्रिएटर |
हाँ |
हाँ |
हाँ |
हाँ |
वॉइस डिज़ाइन से सिंथेटिक आवाज़ बनाना
वॉइस डिज़ाइन शुरू करने की सबसे आसान जगह है। आपको कोई रिकॉर्डिंग की जरूरत नहीं। यह आवाज़ को शून्य से जनरेट करता है। यह फ्री प्लान पर उपलब्ध एकमात्र विकल्प भी है, जो इसे शुरुआती लोगों के लिए उपयुक्त बनाता है।
वर्कफ़्लो सरल है:
- कुछ प्रमुख सेटिंग्स के साथ एक प्रॉम्प्ट लिखें
- जेनरेट करें
- प्रीव्यू देखें
- सेव करें
अनुभव से एक सुझाव: चुनने से पहले कम-से-कम 5 से 10 वैरिएशन जनरेट करें। एक ही सेटिंग्स के साथ भी परिणाम काफी अलग हो सकते हैं। शुरू करने के लिए, Voice Design बटन पर Create Voice मेन्यू में क्लिक करें। इससे एक मेन्यू खुलेगा जहां आप अपनी आवाज़ के लिए प्रॉम्प्ट लिख सकते हैं।

आप Settings टैप करके दो चीजें समायोजित कर सकते हैं:
- Loudness: जेनरेट होने पर आवाज़ कितनी तेज़ होगी।
- Guidance level: अन्य मॉडलों में टेम्परेचर जैसा—यह बताता है कि AI आपके प्रॉम्प्ट का कितना सख्ती से पालन करे। गाइडेंस अधिक होगा तो यह आपके कहे पर अधिक टिकेगा; कम होने पर इसे अधिक स्वतंत्रता मिलेगी।

आप चाहें तो AI एजेंट को अपना प्रीव्यू टेक्स्ट रखने दें, या सेटिंग बंद करके प्रीव्यू टेक्स्ट बॉक्स में अपना स्क्रिप्ट दें।

वॉइस पैरामीटर्स के लिए प्रॉम्प्टिंग
आप कॉन्फ़िगरेशन जनरेट करने के लिए प्रॉम्प्ट क्षेत्र का उपयोग करना चाहेंगे। जिन विशेष पैरामीटर्स पर जोर देना है, उनके लिए निम्न टेम्पलेट आज़माएं:
Native <Language>. <Accent>, <Gender>, <Age range>, <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>
प्रत्येक पैरामीटर आउटपुट को प्रभावित करता है:
- VoiceLabs बहुभाषी है, इसलिए भाषा आवाज़ की टोनैलिटी तय करती है
- एक्सेंट उच्चारण के पैटर्न बदलता है
- उम्र पिच और टोन को प्रभावित करती है
- जेंडर वोकल रेंज पर असर डालता है
- क्वालिटी लेवल तय करता है कि ऑडियो कितना साफ़ लगेगा
दिलचस्प बात यह है कि ये मिलकर कैसे काम करते हैं। कई बार अप्रत्याशित संयोजन बेहतरीन परिणाम देते हैं, इसलिए प्रयोग करना फायदेमंद है।
जेनरेट करना, प्रीव्यू लेना, और सेव करना
Generate voice पर क्लिक करें, और ElevenLabs एक छोटा सैंपल बनाता है।

आप जितनी बार चाहें, रीजेनरेट कर सकते हैं। हर वर्ज़न थोड़ा अलग होगा।
एक पसंद आ जाए तो:
-
Save पर क्लिक करें
-
narrator_us_male_30sजैसा वर्णनात्मक नाम दें
सेव करने के बाद, यह आवाज़ My Voices के तहत और स्पीच सिंथेसिस के ड्रॉपडाउन में दिखेगी।
इंस्टेंट वॉइस क्लोनिंग (IVC) से आवाज़ क्लोन करना
इंस्टेंट वॉइस क्लोनिंग आपको सिर्फ एक छोटे ऑडियो सैंपल से किसी आवाज़ की नकल करने देता है। यह तेज़ और चौंकाने वाला असरदार है, हालांकि परफेक्ट नहीं। याद रखें, इसके लिए आपको स्टार्टर ($6/माह) या उससे उच्च प्लान चाहिए।
महत्वपूर्ण: सिर्फ वही आवाज़ें क्लोन करें जिनके उपयोग की आपको अनुमति है। प्लेटफ़ॉर्म आपसे इसकी पुष्टि कराता है, और आपको इसे गंभीरता से लेना चाहिए। पूरा प्रोसेस काफी सीधा है:
- अपना ऑडियो तैयार करें
- ऑडियो अपलोड करें
- अपनी वॉइस क्लोन को नाम दें और सेव करें
- टेक्स्ट टू स्पीच में टेस्ट करें
अपना ऑडियो सैंपल तैयार करना
आपका ऑडियो सही लंबाई, सही फॉर्मैट और ठीक-ठाक गुणवत्ता का होना चाहिए। न्यूनतम लंबाई लगभग एक मिनट है, लेकिन मेरे अनुभव में 3 से 5 मिनट कहीं बेहतर परिणाम देता है।
आप 50MB से कम के MP3 या WAV फाइलें अपलोड करें; आप चाहें तो एक साथ कई फाइलें भी अपलोड कर सकते हैं।
बेहतर क्लोनिंग अनुभव और अच्छी ऑडियो क्वालिटी के लिए रिकॉर्डिंग करते समय मैं ये सुझाव देता हूं:
- शांत कमरा
- कोई बैकग्राउंड शोर नहीं
- माइक्रोफोन से समान दूरी बनाए रखें
निम्न से बचें:
- एक से अधिक वक्ता
- फ़ोन रिकॉर्डिंग
- भारी पोस्ट-प्रोसेसिंग
अपलोड करना और क्लोन बनाना
अपने Voices डैशबोर्ड पर वापस जाएं और ये करें:
- + Create Voice पर क्लिक करें
- Instant Voice Cloning चुनें
- अपना ऑडियो अपलोड करें और Next पर क्लिक करें

- अपनी आवाज़ को नाम दें, वैकल्पिक रूप से लेबल और विवरण जोड़ें
- कंसेंट की पुष्टि करें
- Save Voice पर क्लिक करें
निम्न लेबल ड्रॉपडाउन मेन्यू से चुने जा सकते हैं:
- Language
- Accent (भाषा पर निर्भर विकल्प खुलते हैं)
- Gender
- Age (विकल्प: युवा, मध्यम आयु, या वृद्ध)
आवाज़ तुरंत तैयार हो जाती है, और आप इसे टेक्स्ट-टू-स्पीच जेनरेटर में तुरंत टेस्ट कर सकते हैं। कुछ अलग-अलग वाक्य आज़माएं और देखें कहां यह स्वाभाविक लगता है और कहां अटकता है।
इसे करने के लिए, बाएं साइडबार में Text to Speech पर क्लिक करें। (ध्यान दें, कुछ वर्ज़न में इसे Speech Synthesis कहा गया है।)

यह एक विंडो खोलता है जिसमें मिलती-जुलती टेक्स्ट प्रॉम्प्ट विंडो होती है।

दाईं ओर, Voice ड्रॉपडाउन पर क्लिक करें और My Voices विंडो से अपनी आवाज़ चुनें।

एक परीक्षण वाक्य लिखें और Generate speech पर क्लिक करें।

यह आपके चुनी हुई आवाज़ के साथ एक ऑडियो सैंपल जेनरेट करेगा। अपनी पसंद के अनुसार दाईं ओर की सेटिंग्स एडजस्ट करने में संकोच न करें। आप निम्न सेटिंग्स समायोजित कर सकते हैं:
- स्पीड
- स्टेबिलिटी
- सिमिलैरिटी
- स्टाइल एग्जैजरेशन
अलग-अलग मॉडल चुनना भी अलग विकल्प दे सकता है!

अपनी फाइल सेव करने के लिए, दाईं ओर डाउनलोड बटन पर क्लिक करें और जेनरेटेड ऑडियो सेव करें।

प्रोफेशनल वॉइस क्लोनिंग (PVC) से हाई-फिडेलिटी क्लोन बनाना
यदि IVC आपको एक मोटा-सा अनुमान देता है, तो PVC आपको असल आवाज़ के बहुत करीब ले आता है। यहीं आप पेसिंग, सांस, और इमोशन जैसी बारीकियां पकड़ते हैं।
इसके लिए क्रिएटर प्लान ($22/माह) चाहिए। ElevenLabs के अनुसार, प्रोसेसिंग आमतौर पर 2 से 6 घंटे लेती है, हालांकि सर्वर लोड के आधार पर कुल ट्रेनिंग समय 24 घंटे तक हो सकता है।
यदि हम प्रोडक्शन-ग्रेड वॉइस एसेट बनाना चाहते हैं, तो यही सबसे प्रासंगिक विकल्प है। जैसे नैरेशन, ऑडियोबुक, और ब्रांडेड वॉइस एजेंट्स—ऐसी चीजें जिनका व्यावसायिक या व्यापक उपयोग हो सकता है।
ट्रेनिंग डेटा रिकॉर्ड करना और क्यूरेट करना
चूंकि हम सबसे अच्छा संभव मॉडल बनाना चाहते हैं, आवश्यकताएं बढ़ जाती हैं। उदाहरण के लिए, न्यूनतम रिकॉर्डिंग समय 30 मिनट का क्लीन ऑडियो है, लेकिन सर्वोत्तम परिणाम के लिए 3+ घंटे का लक्ष्य रखें। इतना ऑडियो सबमिट करने का सबसे अच्छा तरीका है इसे 30-मिनट के सैंपल में तोड़ना।
रिकॉर्डिंग का अधिकतम लाभ उठाने के लिए कुछ सुझाव:
- शांत रिकॉर्डिंग वातावरण का उपयोग करें
- अच्छा माइक्रोफोन उपयोग करने की कोशिश करें
- विविध कंटेंट शामिल करें, सिर्फ एक ही डॉक्युमेंट से न पढ़ें
उदाहरण के लिए, आप अपना नैरेशन स्टाइल मिलाकर रख सकते हैं:
- अलग-अलग तरह के संवाद रखें। कुछ इंस्ट्रक्शनल टेक्स्ट पढ़ें।
- कुछ संख्याएं और एक सूची पढ़ें। यह उच्चारण और वाक्य संरचना के लिहाज से अच्छी विविधता देता है।
- इसके अलावा, अलग-अलग पेस, अलग-अलग इमोशन के साथ रिकॉर्ड करें। अधिक फ्लेवर और स्टाइल बेहतर मॉडल बनाते हैं।
हमेशा की तरह, निम्न खराब गुणवत्ता वाले ऑडियो से बचें:
- बैकग्राउंड शोर
- भारी कंप्रेशन
- “उम” और “आह” जैसे फिलर्स
सबमिट करना और ट्रेनिंग का इंतज़ार
ऑडियो तैयार होने के बाद, स्टेप्स काफी आसान हैं:
- Professional Voice Clone चुनें
- Create new clone बटन पर क्लिक करें

- सारी रिकॉर्डिंग अपलोड करें, नाम, भाषा और अन्य लेबल भरें

- कंसेंट विवरण भरें
- सबमिट करें
ElevenLabs आपके क्लोन को ट्रेन करने से पहले, वे आपसे यह साबित कराते हैं कि आवाज़ वास्तव में आपकी ही है।
यही IVC से बड़ा अंतर है: प्रोफेशनल क्लोनिंग सिर्फ आपकी अपनी आवाज़ को क्लोन करने देती है, इसलिए आप किसी और की आवाज़ क्लोन नहीं कर सकते, भले ही उनकी सहमति हो। यदि कोई सहकर्मी अपनी आवाज़ देना चाहता है, तो उन्हें अपने अकाउंट पर PVC बनाना और वेरिफ़ाई करना होगा, फिर प्राइवेट शेयरिंग लिंक से आपको साझा करना होगा।
वेरिफ़िकेशन एक छोटी लाइव रिकॉर्डिंग है। आप स्क्रीन पर दिखी कुछ पंक्तियां माइक में पढ़ते हैं। दो चीजें तय करती हैं कि यह पास होगा या नहीं:
- वही या मिलते-जुलते उपकरण का उपयोग करें जिससे आपने सैंपल रिकॉर्ड किए थे, और टोन व डिलीवरी मिलती-जुलती रखें। यहां असंगति सबसे आम असफलता का कारण है।
- हर पंक्ति सिर्फ एक बार पढ़ें, फिर Stop दबाएं। एक से अधिक बार पढ़ना वेरिफ़िकेशन फेल करा सकता है।
यदि फेल हो जाए, तो आप 24 घंटे इंतज़ार कर दोबारा प्रयास कर सकते हैं, या सपोर्ट से संपर्क करें। एक बात ध्यान दें: वेरिफ़िकेशन स्टेज पर पहुंचने के बाद, क्लोन लॉक हो जाता है। आप अप्रमाणित PVC को खुद डिलीट नहीं कर सकते, इसलिए यहां आने से पहले अपने सैंपल सही रखें।
जब आपका वॉइस क्लोन तैयार हो जाएगा, आपको नोटिफिकेशन मिलेगा! तब एक उपयोगी तरकीब है कि एक ही वाक्य से अपने IVC और PVC आउटपुट्स की तुलना करें। फर्क आमतौर पर स्पष्ट होता है।
अपने वॉइसलैब वॉइस का प्रोजेक्ट्स में उपयोग
एक बार आपकी आवाज़ सेव हो जाए, जहां भी ElevenLabs ऑडियो जेनरेट करता है, पूरे प्लेटफ़ॉर्म पर वह उपलब्ध हो जाती है।
आप इसका उपयोग कर सकते हैं:
- Text to Speech (स्पीच सिंथेसिस) में त्वरित जेनरेशन के लिए
- Studio में दीर्घकालिक प्रोजेक्ट्स के लिए
- Python API के जरिए प्रोग्रामेटिक उपयोग के लिए
मैं इन प्रत्येक टूल्स में आपकी आवाज़ कैसे उपयोग करें, इस पर संक्षेप में चलूंगा। सबसे अच्छा आरंभिक संसाधन है Beginner’s Guide to the ElevenLabs API, जो Python API के साथ शुरू करने में मदद करता है।
Text to Speech और Studio में कस्टम वॉइस का उपयोग
Text to Speech में आपको बस Voices -> My Voices ड्रॉपडाउन से अपनी आवाज़ चुननी है, जैसा ऊपर बताया।
Text to Speech टूल के लिए कुछ ट्यूनिंग टिप्स:
- Stability 40 से 50 प्रतिशत पर शुरू करें
- Similarity लगभग 75 प्रतिशत रखें
- आउटपुट के आधार पर समायोजित करें
वांछित आवाज़ और रिकॉर्डिंग पाने में कुछ प्रयास लग सकते हैं, लेकिन जितना अधिक आप प्रयोग करेंगे, स्पीच जेनरेशन प्रक्रिया को उतना ही बेहतर समझेंगे।
Studio में भी तरीका मिलता-जुलता है। बाएं साइडबार से Studio पर जाएं, फिर + New Blank Project चुनें। अगला, आप प्रोजेक्ट का प्रकार चुन सकते हैं:
- Audio Project या
- Video Project
ऑडियो प्रोजेक्ट लंबा, बहु-वक्ता वार्तालापी कंटेंट बनाने देता है। वीडियो प्रोजेक्ट में पहले वीडियो अपलोड करना होता है, जिसके ऊपर आप वॉइस-ओवर जोड़ते हैं।
स्टूडियो में ऑडियो प्रोजेक्ट नेविगेशन
स्टूडियो ऑडियो प्रोजेक्ट से आप मल्टी-स्पीकर ऑडियो फाइल बना सकते हैं। यह पॉडकास्ट या वार्तालापी कंटेंट जनरेट करने के लिए बढ़िया है—यहां तक कि ऑडियोबुक जहां अलग-अलग किरदारों के लिए अलग आवाज़ चाहिए।
स्टूडियो का ऑडियो डैशबोर्ड एक खाली कैनवास है। हम यहां मुख्य वॉइस घटक पर ध्यान देंगे, पर बाकी चीजें भी आज़मा सकते हैं।

बाईं ओर एक वॉइस सेक्शन चयनित दिखेगा। जैसे ही आप प्रॉम्प्ट एरिया में टाइप करेंगे, यह किरदार के संवाद को हाईलाइट करेगा।

अगली लाइन पर जाएं तो आप अलग आवाज़ चुन सकते हैं और नया किरदार बना सकते हैं। हर लाइन एक “पैराग्राफ” है:

स्टूडियो की सीमाएं काफ़ी उदार हैं। प्रत्येक प्रोजेक्ट में अधिकतम 500 चैप्टर, हर चैप्टर में 400 पैराग्राफ तक हो सकते हैं। प्रत्येक पैराग्राफ में अधिकतम 5000 कैरेक्टर हो सकते हैं।
आपके पास कितने प्रोजेक्ट हो सकते हैं, यह आपके टियर पर निर्भर करता है:
- फ्री: 5 प्रोजेक्ट
- स्टार्टर: 20 प्रोजेक्ट
- क्रिएटर: 1,000 प्रोजेक्ट
स्टूडियो में वीडियो प्रोजेक्ट नेविगेशन
उन्हीं स्टेप्स का पालन करें, लेकिन इस बार वीडियो प्रोजेक्ट चुनें। आपको एक खाली कैनवास पर ले जाया जाएगा और वीडियो अपलोड करने के लिए कहा जाएगा:
वीडियो क्लिप अपलोड होने के बाद, आप उसे बाईं ओर देख सकते हैं और प्रीव्यू के लिए प्ले दबा सकते हैं। आवश्यकता हो तो कई वीडियो जोड़ सकते हैं।
फिर बाईं ओर जाकर Speech चुनें।

ऑडियो प्रोजेक्ट की तरह, आप कई आवाज़ें चुन सकते हैं और अपनी पंक्तियां टाइप कर सकते हैं। टाइप करते हुए, Enter दबाकर नई लाइन पर जाएं। हर लाइन के लिए अलग-अलग आवाज़ चुनकर बातचीत जैसा इफेक्ट बना सकते हैं।

नीचे, आप टाइमलाइन पर ड्रैग-एंड-ड्रॉप करके हर लाइन के समय-खंड आसानी से समायोजित कर सकते हैं।

यदि आपके पास फ़ोटो या वीडियो नहीं हैं, तो आप बाईं ओर के Video टैब से उन्हें जेनरेट कर सकते हैं। बस एक प्रॉम्प्ट लिखें और आपकी पसंद की इमेज या वीडियो जेनरेट हो जाएगी।
कृपया ध्यान दें कि पहले आपको इमेज और वीडियो बीटा टर्म्स ऑफ़ सर्विस स्वीकार करने होंगे। साथ ही, फ्री मेंबर्स सिर्फ इमेज जेनरेट कर सकते हैं; वीडियो जेनरेट करने के लिए कम-से-कम स्टार्टर मेंबरशिप ($5/माह) चाहिए।

ElevenLabs Python SDK के जरिए कस्टम वॉइस एक्सेस करना
Python SDK उपयोग करने के लिए, आपको पहले Python इंस्टॉल होना चाहिए। फिर आप एक Python एनवायरनमेंट बनाएं, जहां आप ElevenLabs SDK निम्न कमांड से इंस्टॉल करें: pip install "elevenlabs[pyaudio]"
इसके बाद, बाएं साइडबार के नीचे क्लिक करके अपने ElevenLabs डेवलपर्स डैशबोर्ड पर जाएं और API Keys -> Create Key चुनें।

आप चुनेंगे कि किन टूल्स को API एक्सेस देना है और फिर Create Key पर क्लिक करेंगे।

इसके बाद एक API Key पॉप-अप होगी जिसे आप जरूर कॉपी करें, वरना यह हमेशा के लिए खो जाएगी।

इसके बाद, API की को किसी सुरक्षित स्थान या प्रोजेक्ट फ़ोल्डर में .env फाइल में सेव करें।
उसके बाद, अपने Voices डैशबोर्ड पर जाएं और My Voices चुनें। अपनी आवाज़ का Voice ID कॉपी करें। इसे कहीं आसानी से सुलभ स्थान पर सेव कर लें।

अब आप अपनी ElevenLabs आवाज़ चलाने के लिए एक स्क्रिप्ट बना सकते हैं! यहां एक सरल उदाहरण है:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
# Loads the .env file from the folder
load_dotenv()
# uses the API key to get access to the ElevenLabs Client
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
# Sets the voice ID for your voice
custom_narrator_voice_id = "your_voice_id_here"
# Calls the text to speech API using your custom voice ID
# Creates an audio file with the specific text
# Uses the model and output format defined for the voice
audio = client.text_to_speech.convert(
voice_id=custom_narrator_voice_id,
text="Thanks for getting through this DataCamp article!.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
# Takes the output audio and joins it into a byte object
audio_bytes = b"".join(audio)
# Saves the audio bytes to a file
with open("output.mp3", "wb") as f:
f.write(audio_bytes)
निष्कर्ष
VoiceLab आपकी ज़रूरत के अनुसार तीन रास्ते देता है। वॉइस डिज़ाइन प्रयोग के लिए उत्तम है, इंस्टेंट वॉइस क्लोनिंग तेज़ प्रोटोटाइप के लिए बढ़िया है, और प्रोफेशनल वॉइस क्लोनिंग प्रोडक्शन-स्तरीय गुणवत्ता के लिए है।
यदि आप अभी शुरुआत कर रहे हैं, तो पहले वॉइस डिज़ाइन पर टिके रहें। जब स्पष्ट उपयोग-केस हो, तभी अपग्रेड करें।
यदि आप AI-संचालित एप्लिकेशन बनाने में गहराई से जाना चाहते हैं, तो हमारा Developing AI Applications स्किल ट्रैक देखें, जो आपको नवीनतम AI डेवलपर टूल्स—OpenAI API, Hugging Face, और LangChain—का उपयोग सिखाता है।
ElevenLabs VoiceLab FAQs
क्या ElevenLabs का उपयोग फ्री में किया जा सकता है?
हाँ। फ्री प्लान आपको महीने में लगभग 10,000 क्रेडिट (लगभग 10 मिनट ऑडियो) देता है, साथ में वॉइस डिज़ाइन और स्टॉक वॉइस लाइब्रेरी। लेकिन इसे कमर्शियल रूप से उपयोग नहीं किया जा सकता और इसमें वॉइस क्लोनिंग शामिल नहीं है; इंस्टेंट वॉइस क्लोनिंग और कमर्शियल लाइसेंस के लिए कम-से-कम स्टार्टर प्लान चाहिए।
क्या ElevenLabs की आवाज़ों का व्यावसायिक उपयोग करने के लिए पेड प्लान चाहिए?
हाँ। फ्री प्लान में ElevenLabs एट्रिब्यूशन आवश्यक है और कोई कमर्शियल अधिकार नहीं देता, इसलिए आप उस ऑडियो का मोनेटाइजेशन नहीं कर सकते। कमर्शियल लाइसेंस की शुरुआत स्टार्टर प्लान से होती है (करीब $6/माह, या सालाना बिलिंग पर $5), जबकि प्रोडक्शन-ग्रेड वॉइस के लिए प्रोफेशनल वॉइस क्लोनिंग हेतु क्रिएटर प्लान ($22/माह) या उससे ऊपर चाहिए।
क्या मैं ElevenLabs से किसी और की आवाज़ क्लोन कर सकता/सकती हूँ?
सिर्फ स्पष्ट अनुमति के साथ, और तरीका अनुसार नियम अलग हैं। इंस्टेंट वॉइस क्लोनिंग आपको किसी भी अधिकृत आवाज़ की क्लोनिंग करने देती है, लेकिन प्रोफेशनल वॉइस क्लोनिंग सिर्फ आपकी अपनी आवाज़ तक सीमित है और लाइव वेरिफ़िकेशन रिकॉर्डिंग मांगती है (भले ही सहमति हो)। किसी की नकल या धोखाधड़ी के लिए क्लोन की गई आवाज़ का उपयोग अधिकतर न्यायक्षेत्रों में गैरकानूनी है।
इंस्टेंट और प्रोफेशनल वॉइस क्लोनिंग में क्या अंतर है?
इंस्टेंट वॉइस क्लोनिंग (IVC) सिर्फ 1–2 मिनट के ऑडियो से सेकंडों में एक उपयोगी क्लोन बना देती है और प्रोटोटाइप के लिए आदर्श है, हालांकि बारीकियों से चूक सकती है। प्रोफेशनल वॉइस क्लोनिंग (PVC) 30 मिनट से 3 घंटे के ऑडियो पर एक समर्पित मॉडल ट्रेन करती है और प्रोसेस में कुछ घंटे लगते हैं, जिससे कहीं ज़्यादा सटीक, प्रोडक्शन-रेडी परिणाम मिलता है। जल्दी परीक्षण के लिए IVC और गुणवत्ता मायने रखे तो PVC चुनें।
क्या मैं अपनी कस्टम ElevenLabs आवाज़ को प्लेटफ़ॉर्म के बाहर उपयोग कर सकता/सकती हूँ?
सीधे नहीं। वॉइस क्लोन एक्सपोर्ट नहीं किए जा सकते और सिर्फ ElevenLabs के भीतर काम करते हैं। आप फिर भी जहां-जहां प्लेटफ़ॉर्म ऑडियो जेनरेट करता है—Text to Speech, Studio, और प्रोग्रामेटिक रूप से ElevenLabs API व Python SDK के जरिए—वहां उनका उपयोग कर सकते हैं; अधिकतर लोग इसी तरह अपनी ऐप्स या पाइपलाइंस में कस्टम वॉइस जोड़ते हैं।