course
स्ट्रीमिंग स्पीच-टू-टेक्स्ट अब एक भीड़भाड़ वाला लीडरबोर्ड बन चुका है। OpenAI, Google, ElevenLabs, Meta, और Deepgram सभी रीयल-टाइम ट्रांसक्रिप्शन मॉडल पेश करते हैं, और Artificial Analysis अब दर्जनों मॉडलों को एक ही वर्ड एरर रेट इंडेक्स पर रैंक करता है। SpaceXAI का नया मॉडल, Grok Voice Transcribe 2.0, अब उस इंडेक्स में शीर्ष पर आ गया है।
इस लेख में, मैं Grok Voice Transcribe 2.0 की नई बातों को कवर करूँगा—नई विशेषताएँ, सार्वजनिक और आंतरिक बेंचमार्क, साथ ही मूल्य निर्धारण और API एक्सेस। आप हमारे Grok Voice Think Fast 2.0 API और GPT Live Transcribe API के गाइड भी देख सकते हैं।
संक्षेप में
- Grok Voice Transcribe 2.0 xAI का नया स्पीच-टू-टेक्स्ट मॉडल है, जो Grok Voice Transcribe 1.0 को उसी प्रति घंटे की कीमत पर बदलता है।
- यह Artificial Analysis के सार्वजनिक लीडरबोर्ड पर स्ट्रीमिंग मॉडलों में सटीकता के लिए प्रथम स्थान पर है।
- सबसे बड़े लाभ कठिन ऑडियो पर हैं: फोन लाइनें, बोले गए अकाउंट कोड और ईमेल, और छोटी बहुभाषी कमांड।
- समझौता लेटेंसी है: अंतिम ट्रांसक्रिप्ट लौटाने में यह 1.0 और ElevenLabs Scribe v2 से अधिक समय लेता है।
- मौजूदा इंटीग्रेशन बिना कोड बदले अपग्रेड हो जाते हैं, लेकिन डिफ़ॉल्ट बदलने तक मॉडल ID स्पष्ट रूप से सेट करें।
- यदि आप आज किसी प्रतिद्वंद्वी स्ट्रीमिंग ट्रांसक्राइबर के लिए भुगतान करते हैं, तो अपने ऑडियो पर इसे साथ-साथ टेस्ट करना उचित है।
Grok Voice Transcribe 2.0 क्या है?
Grok Voice Transcribe 2.0 SpaceXAI का दूसरी पीढ़ी का स्पीच-टू-टेक्स्ट मॉडल है, और xAI अब इसे अपना सर्वश्रेष्ठ ट्रांसक्रिप्शन मॉडल कहता है। यह Grok Voice के पीछे के ऑडियो फाउंडेशन मॉडल पर आधारित है, जिसके बारे में SpaceXAI कहता है कि यह रोज़ाना दसियों हज़ार कस्टमर-सपोर्ट कॉल संभालता है, लाखों घंटों के वीडियो नैरेशन ट्रांसक्राइब करता है, और Tesla वाहनों में Grok सहायक को चलाता है।
1.0 से जो बदला है, वह ट्रेनिंग है, API नहीं। SpaceXAI ने 2.0 को विविध परिवेशों में रिकॉर्ड किए गए लाइव, शोरयुक्त, बहुभाषी ऑडियो पर प्रशिक्षित किया, फिर सबसे कठिन वास्तविक-विश्व स्थितियों को लक्ष्य करके पोस्ट-ट्रेनिंग से परिष्कृत किया:
- अस्थिर फोन लाइनें
- प्रतिस्पर्धी आवाज़ें
- स्थानीय लहजे
- फ़ोन नंबर या ईमेल पते को ज़ोर से पढ़ना
मुख्य दावा यह है कि 2.0 xAI के वास्तविक-विश्व मूल्यांकन में 1.0 की तुलना में दोगुना सटीक है, और कीमत पहली पीढ़ी जैसी ही है। मैं बेंचमार्क सेक्शन में उस दावे पर बात करूँगा, क्योंकि सार्वजनिक लीडरबोर्ड आंतरिक सेटों की तुलना में अधिक संयमित कहानी बताता है।
Grok Voice Transcribe 2.0 की प्रमुख विशेषताएँ
फीचर सूची वही है जो 1.0 के साथ आई थी—यही बात है: xAI ने पूरा अपग्रेड सटीकता में लगाया और API सतह को अपरिवर्तित रखा।
एक ही मॉडल से फ़ाइलें या लाइव ऑडियो ट्रांसक्राइब करें
आप बैच एंडपॉइंट पर रिकॉर्ड की गई फ़ाइल या URL भेज सकते हैं, या WebSocket पर कच्चा ऑडियो स्ट्रीम कर सकते हैं और वक्ता के बोलते समय ही ट्रांसक्रिप्ट इवेंट वापस पा सकते हैं। दोनों मार्ग एक ही मॉडल चलाते हैं, इसलिए कॉल रिकॉर्डिंग का ट्रांसक्रिप्ट और लाइव कॉल का ट्रांसक्रिप्ट एक जैसा पढ़ना चाहिए।
बैच 12 ऑडियो फ़ॉर्मैट में 500 MB तक की फ़ाइलें स्वीकार करता है, जिनमें WAV, MP3, FLAC, और MP4 कंटेनर शामिल हैं, साथ ही रॉ PCM और G.711 टेलीफोनी कोडेक्स। स्ट्रीमिंग लगभग हर 500 ms पर आंशिक ट्रांसक्रिप्ट जारी कर सकती है और प्रत्येक परिणाम को या तो लॉक्ड चंक या फिनिश्ड उच्चारण के रूप में टैग करती है, ताकि कैप्शनिंग UI टेक्स्ट को जल्दी दिखा सके और बाद में उसे बदल सके।
किसने क्या कहा, और कब—यह जानें
हर शब्द के साथ आरंभ और अंत समय आता है, और डायराइज़ेशन चालू करने पर बिना किसी अतिरिक्त लागत के प्रत्येक शब्द को एक स्पीकर लेबल मिल जाता है। कॉल-सेंटर ऑडियो के लिए, जहाँ एजेंट एक चैनल पर और ग्राहक दूसरे पर होता है, मल्टी-चैनल मोड 8 तक चैनलों को स्वतंत्र रूप से ट्रांसक्राइब करता है, जो डायराइज़ेशन की आवश्यकता को पूरी तरह दूर कर देता है।
रेस्पॉन्स एक JSON ऑब्जेक्ट होता है जिसमें पूरा टेक्स्ट, पता की गई भाषा BCP-47 कोड के रूप में, ऑडियो की अवधि, और शब्दों का एरे शामिल होता है। टाइमस्टैम्प के लिए अलग कॉल करने की ज़रूरत नहीं है।
अपनी शब्दावली सिखाएँ
आप प्रति अनुरोध 100 तक मुख्य शब्द दे सकते हैं, प्रत्येक अधिकतम 50 अक्षरों तक, ताकि मॉडल को प्रोडक्ट नाम, दवा के नाम, या आपकी डोमेन-विशिष्ट बोली जाने वाली शर्तों की ओर झुकाया जा सके जो शब्दकोश में नहीं मिलते। टेक्स्ट फॉर्मैटिंग, भाषा पैरामीटर सेट करने पर, संख्याएँ, तिथियाँ, मुद्राएँ, फोन नंबर, और ईमेल पते को लिखित रूप में लिखती है, जिसे SpaceXAI 25 भाषाओं के लिए सपोर्ट करता है।
“um” और “uh” जैसे फ़िलर शब्द डिफ़ॉल्ट रूप से हटा दिए जाते हैं। यह ऐसे ट्रांसक्रिप्ट्स के लिए सही डिफ़ॉल्ट है जिन्हें लोग पढ़ते हैं, और बातचीत एनालिटिक्स के लिए गलत—तो यदि आप फ़िलर्स वापस चाहते हैं तो फ़्लैग मौजूद है।
वॉयस एजेंट को बताइए कि कॉलर कब बोलना समाप्त कर चुका है
स्मार्ट टर्न डिटेक्शन वॉयस एजेंट को हर विराम पर कूदने के बजाय एक विचार के अंत का इंतज़ार करने देता है। आप 0 से 1 के बीच एक कॉन्फिडेंस थ्रेशहोल्ड सेट करते हैं, और मॉडल केवल तब उच्चारण को समाप्त के रूप में चिह्नित करता है जब उसे उतना भरोसा होता है कि वक्ता खत्म कर चुका है; SpaceXAI संतुलित उपयोग के लिए 0.5 और जब लोग नंबर या पते बोलते हैं तो 0.7 सुझाता है।
एक साथी टाइमआउट निश्चित साइलेंस के बाद टर्न को समाप्त करने को बाध्य करता है, ताकि जो कॉलर दूर चला जाए वह सत्र को अटका न दे। स्मार्ट टर्न के बिना, डिफ़ॉल्ट एंडपॉइंटिंग 400 ms की साइलेंस के बाद फायर होती है, जो छोटी कमांड्स के लिए ठीक है और किसी के लिए भी, जो फोन नंबर पढ़ रहा हो, तकलीफ़देह।
रिकॉर्डिंग के बीच में भाषा बदलें
मॉडल भाषा को स्वचालित रूप से पहचानता है और एक ही रिकॉर्डिंग के भीतर भाषा-स्विच को एक ही पास में संभालता है, किसी भाषा हिंट की आवश्यकता नहीं। SpaceXAI बहुभाषी सटीकता को 1.0 पर सबसे बड़ा सुधार बताता है, और अगला सेक्शन छोटी वाक्यांशों के आँकड़े इसे पुष्ट करते हैं।
एक सावधानी: फॉर्मैटिंग के लिए भाषा पैरामीटर अभी भी मायने रखता है। जब आपको लिखित-रूप संख्याएँ और मुद्राएँ चाहिए हों तो इसे सेट करें, और जब ऑडियो में भाषाएँ मिलती-जुलती हों और आप कच्चे शब्द ही रखना चाहते हों तो इसे छोड़ दें।
बेंचमार्क पर Grok Voice Transcribe 2.0 कैसा प्रदर्शन करता है?
Grok Voice Transcribe 2.0 सार्वजनिक स्ट्रीमिंग लीडरबोर्ड पर सटीकता में अग्रणी है और SpaceXAI द्वारा रिपोर्ट किए गए हर आंतरिक सेट पर 1.0 को पछाड़ता है, लेकिन लाभ का आकार इस पर बहुत निर्भर करता है कि आप कौन-सा ऑडियो देखते हैं।
सार्वजनिक लीडरबोर्ड पर स्ट्रीमिंग सटीकता
Artificial Analysis के स्ट्रीमिंग स्पीच-टू-टेक्स्ट इंडेक्स पर, Grok Voice Transcribe 2.0 का वर्ड एरर रेट (WER) 2.7% है, जो 21 सितंबर 2026 तक सूचीबद्ध 34 स्ट्रीमिंग मॉडलों में सबसे कम है। Meta का Muse Voice Transcribe 3.1% पर अगला है, ElevenLabs Scribe v2 Realtime 3.6% पर है, और Grok Voice Transcribe 1.0 3.9% पर पीछे है। SpaceXAI की घोषणा के समय उसी लीडरबोर्ड पर 32 मॉडल गिने गए थे।
WER क्या मापता है: WER उन शब्दों का हिस्सा है जिन्हें मॉडल गलत करता है, इसलिए कम होना बेहतर है।
स्पीच-टू-टेक्स्ट इंडेक्स क्या मापता है: Artificial Analysis का इंडेक्स 3 टेस्ट सेट (AA-AgentTalk, VoxPopuli, और Earnings-22) में WER का औसत लेता है। VoxPopuli पर Grok 2.0 की बढ़त सबसे चौड़ी है, जहाँ इसका 1.4% WER, 1.0 के 3.1% से आधे से भी कम है।

इस इंडेक्स पर 1.0 से अंतर 31% है, न कि घोषणा में बताई गई 2x। वह बड़ा दावा SpaceXAI के अपने प्रोडक्शन सेटों से आता है, जिन्हें मैं अगले भाग में कवर करता हूँ। वही लीडरबोर्ड यह भी दर्ज करता है कि अंतिम ट्रांसक्रिप्ट को कमिट करने में प्रत्येक मॉडल को कितना समय लगता है, और यहाँ तस्वीर उलट जाती है।
| Model | WER index (final transcript) | Time to final transcript |
|---|---|---|
| Grok Voice Transcribe 2.0 | 2.7% | 0.49 s |
| Muse Voice Transcribe (Meta) | 3.1% | 0.16 s |
| ElevenLabs Scribe v2 Realtime | 3.6% | 0.14 s |
| Grok Voice Transcribe 1.0 | 3.9% | 0.37 s |
| Deepgram Flux | 7.4% | 0.02 s |
लेटेंसी इसकी कीमत है। Grok 2.0 को अंतिम ट्रांसक्रिप्ट लौटाने में 0.49 s लगते हैं, जबकि 1.0 को 0.37 s और Scribe v2 Realtime को 0.14 s। कैप्शन के लिए यह अदृश्य है। एक वॉयस एजेंट के लिए जिसे हर टर्न पर जवाब देना होता है, ये अतिरिक्त दसवें सेकंड जुड़ते जाते हैं।
वास्तविक-विश्व ऑडियो: टेलीफोनी, क्रेडेंशियल्स, और छोटे वाक्यांश
SpaceXAI प्रोडक्शन ट्रैफ़िक से निकाले गए चार आंतरिक सेटों पर WER मापता है:
- कस्टमर-सपोर्ट कॉलों से 8 kHz टेलीफोनी
- Grok के साथ बातचीत
- अकाउंट कोड और ईमेल पते जैसे बोले गए क्रेडेंशियल्स
- 19 भाषाओं में छोटे वॉयस-असिस्टेंट कमांड
Grok Voice Transcribe 2.0 इन सभी चारों पर 1.0 से बेहतर है, और टेलीफोनी पर SpaceXAI कहता है कि यह हर मॉडल से आगे है जिसे उसने टेस्ट किया।
इन सेटों से SpaceXAI जो एक संख्या प्रकाशित करता है वह छोटे-वाक्यांश का परिणाम है: 1.0 के साथ WER 20.6% से 2.0 के साथ 6.8% पर आ जाता है। कार के भीतर की छोटी कमांड्स मॉडल को भाषा पहचानने के लिए लगभग कोई संदर्भ नहीं देतीं—यही वह जगह है जहाँ 1.0 जूझता था—और वहाँ 3x सुधार “दोगुना सटीक” दावे के पीछे सबसे ठोस साक्ष्य है।
बाकी आंतरिक चार्ट, जिनमें ElevenLabs Scribe v2 और Deepgram Nova-3 के विरुद्ध बहुभाषी तुलना शामिल है, बिना लेबल वाली पट्टियों के रूप में आते हैं। मैं टेलीफोनी पर “हमने जिन भी मॉडलों का परीक्षण किया, उन सभी से आगे” को तब तक वेंडर-क्लेम की तरह लूँगा जब तक कोई इसे अपनी कॉल ऑडियो पर पुन: प्रस्तुत न कर दे।
Grok Voice Transcribe 2.0 का मूल्य निर्धारण और उपलब्धता
Grok Voice Transcribe 2.0 की कीमत बैच ट्रांसक्रिप्शन के लिए प्रति घंटे ऑडियो पर $0.10 और स्ट्रीमिंग के लिए प्रति घंटे $0.20 है, जो Grok Voice Transcribe 1.0 के समान है। डायराइज़ेशन, वर्ड टाइमस्टैम्प्स, और की टर्म बायसिंग इन्हीं दरों में शामिल हैं, इन्हें ऐड-ऑन के रूप में बिल नहीं किया जाता।
| Mode | Price | Included |
|---|---|---|
| Batch (file or URL) | $0.10 per hour of audio | Diarization, timestamps, key terms, formatting |
| Streaming (WebSocket) | $0.20 per hour of audio | Diarization, timestamps, key terms, formatting, smart turn |
ये दरें स्ट्रीमिंग लीडरबोर्ड पर सबसे कम में हैं। Artificial Analysis Grok 2.0 को $3.33 प्रति 1,000 मिनट पर सूचीबद्ध करता है, Meta के Muse Voice Transcribe के $3.00 और ElevenLabs Scribe v2 Realtime तथा Deepgram Flux—दोनों के $6.50 के साथ। इंडेक्स पर चार सबसे सटीक मॉडलों में, केवल Muse सस्ता है, और Muse की सटीकता कम है।
मॉडल SpaceXAI API में सामान्य रूप से उपलब्ध है, और घोषणा या दस्तावेज़ों में किसी प्रतीक्षा सूची या क्षेत्रीय प्रतिबंध का उल्लेख नहीं है। यह उपभोक्ता योजना वाला उत्पाद नहीं है, क्योंकि यह एक API प्रोडक्ट है, और न ही घोषणा तथा न ही दस्तावेज़ों में स्पीच-टू-टेक्स्ट के लिए किसी मुफ्त स्तर का उल्लेख है।
डिफ़ॉल्ट संक्रमण में है। SpaceXAI कहता है कि 2.0 जल्द ही Speech-to-Text API में डिफ़ॉल्ट बन जाएगा और 1.0 आने वाले हफ्तों में डीप्रिकेट कर दिया जाएगा। तब तक, मॉडल ID को स्पष्ट रूप से सेट करना चाहिए।
Grok Voice Transcribe 2.0 तक एक्सेस कैसे पाएँ?
मॉडल ID grok-voice-transcribe-2.0 है, जिसे REST एंडपॉइंट पर फ़ॉर्म फ़ील्ड के रूप में या WebSocket एंडपॉइंट पर क्वेरी पैरामीटर के रूप में पास किया जाता है। डीप्रिकेशन विंडो के दौरान पुराने मॉडल पर बने रहने के लिए, grok-voice-transcribe-1.0 पिन करें।
यह दो सतहों पर चलता है: SpaceXAI API, जहाँ बैच https://api.x.ai/v1/stt पर और स्ट्रीमिंग wss://api.x.ai/v1/stt पर है, और SpaceXAI कंसोल, जिसमें लाइव स्पीच-टू-टेक्स्ट प्लेग्राउंड है। 21 सितंबर 2026 तक यह OpenRouter के कैटलॉग में नहीं है।
यहाँ सबसे छोटा बैच कॉल है जो डायराइज़्ड ट्रांसक्रिप्ट लौटाता है:
import os
import requests
response = requests.post(
"https://api.x.ai/v1/stt",
headers={"Authorization": f"Bearer {os.environ['XAI_API_KEY']}"},
data=[("model", "grok-voice-transcribe-2.0"), ("diarize", "true")],
files={"file": open("standup.wav", "rb")},
)
print(response.json()["text"])
xAI के WebSocket वॉयस APIs पर बने वॉयस एजेंट्स के लिए, हमारा Grok Voice Think Fast 2.0 API ट्यूटोरियल देखें, जो स्पीच-टू-स्पीच मॉडल को कवर करता है, और हमारा Grok Voice Agent API गाइड देखें। यदि आप उसी कोडबेस से Grok के टेक्स्ट मॉडलों को कॉल करते हैं, तो हमारा Grok 4.6 API ट्यूटोरियल कीज़ और टूल कॉलिंग को कवर करता है।
अंतिम विचार
Grok Voice Transcribe 2.0 सार्वजनिक लीडरबोर्ड पर सबसे सटीक स्ट्रीमिंग ट्रांसक्रिप्ट पाने का सबसे सस्ता तरीका है, और यह संयोजन दुर्लभ है। xAI यह संकेत दे रहा है कि उसका वॉयस स्टैक OpenAI, Google, और ElevenLabs के साथ प्रतिस्पर्धा करने के लिए है—सिर्फ उसके टेक्स्ट मॉडलों के लिए नहीं।
यदि मेरा ऑडियो फोन-क्वालिटी का, बहुभाषी, या बोले गए नंबरों से भरा हो, तो मैं स्विच करूँगा—यही वे क्षेत्र हैं जहाँ 2.0, 1.0 और अधिकांश प्रतिद्वंद्वियों से आगे निकलता है। मैं एक लेटेंसी-संवेदनशील वॉयस एजेंट पर तब तक रुकूँगा जब तक xAI समय-से-अंतिम-ट्रांसक्रिप्ट पर Scribe v2 के अंतर को बंद नहीं कर देता।
यदि आप स्वयं ट्रांसक्रिप्शन पाइपलाइनों का निर्माण करना चाहते हैं, तो मैं हमारा Spoken Language Processing in Python कोर्स सुझाता हूँ, जो कच्ची ऑडियो फ़ाइलों से लेकर ट्रांसक्राइब और वर्गीकृत फोन कॉल तक ले जाता है।
Grok Voice Transcribe 2.0 FAQs
Grok Voice Transcribe 2.0, Grok Voice Transcribe 1.0 की तुलना में कैसा है?
Grok Voice Transcribe 2.0, 1.0 की तुलना में उसी कीमत और उसी API के माध्यम से अधिक सटीक है। Artificial Analysis के स्ट्रीमिंग वर्ड एरर रेट इंडेक्स पर, यह 1.0 के 3.9% के मुकाबले 2.7% स्कोर करता है, और xAI के आंतरिक छोटे-वाक्यांश सेट पर, एरर रेट 20.6% से 6.8% पर गिरता है। अंतिम ट्रांसक्रिप्ट लौटाने में यह धीमा है: 1.0 के 0.37 s की तुलना में 0.49 s।
Grok Voice Transcribe 2.0 की कीमत कितनी है?
बैच ट्रांसक्रिप्शन की कीमत प्रति घंटे ऑडियो पर $0.10 है और स्ट्रीमिंग की कीमत प्रति घंटे $0.20, जो Grok Voice Transcribe 1.0 के समान है। स्पीकर डायराइज़ेशन, वर्ड-लेवल टाइमस्टैम्प्स, और की टर्म बायसिंग इन दरों में शामिल हैं। xAI स्पीच-टू-टेक्स्ट के लिए कोई मुफ्त स्तर प्रकाशित नहीं करता।
मैं Grok Voice Transcribe 2.0 तक कैसे पहुँचूँ?
xAI Speech-to-Text API को मॉडल ID grok-voice-transcribe-2.0 के साथ कॉल करें, या तो REST एंडपॉइंट पर मल्टीपार्ट फ़ॉर्म फ़ील्ड के रूप में, या WebSocket स्ट्रीमिंग एंडपॉइंट पर क्वेरी पैरामीटर के रूप में। आप इसे xAI कंसोल के स्पीच-टू-टेक्स्ट प्लेग्राउंड में भी आज़मा सकते हैं।
Grok Voice Transcribe 2.0 कौन-सी भाषाएँ सपोर्ट करता है?
मॉडल दर्जनों भाषाओं को ट्रांसक्राइब करता है, भाषा को स्वचालित रूप से पहचानता है, और एक ही रिकॉर्डिंग के भीतर भाषाओं के बीच स्विच का पालन करता है। लिखित-रूप टेक्स्ट फॉर्मैटिंग 25 भाषाओं में उपलब्ध है जब आप भाषा पैरामीटर सेट करते हैं, जिनमें अंग्रेज़ी, स्पैनिश, जर्मन, फ़्रेंच, जापानी, हिंदी, और अरबी शामिल हैं।
क्या Grok Voice Transcribe 2.0 स्पीकर डायराइज़ेशन और रीयल-टाइम स्ट्रीमिंग सपोर्ट करता है?
हाँ। डायराइज़ेशन बिना अतिरिक्त लागत के हर शब्द में स्पीकर लेबल जोड़ता है, और मल्टीचैनल मोड 8 तक ऑडियो चैनलों को स्वतंत्र रूप से ट्रांसक्राइब करता है। स्ट्रीमिंग WebSocket पर चलती है, लगभग हर 500 ms पर आंशिक ट्रांसक्रिप्ट के साथ, साथ ही स्मार्ट टर्न डिटेक्शन ताकि वॉयस एजेंट हर विराम के बजाय विचार के अंत तक इंतज़ार कर सके।