Kurs
Akışta konuşmadan metne dönüştürme alanı kalabalık bir sıralama tablosuna dönüştü. OpenAI, Google, ElevenLabs, Meta ve Deepgram'ın tamamı gerçek zamanlı transkripsiyon modelleri sunuyor ve Artificial Analysis artık onlarcasını tek bir kelime hata oranı endeksinde sıralıyor. SpaceXAI'nin en yeni modeli Grok Voice Transcribe 2.0, bu endekste zirveye oturdu.
Bu yazıda, Grok Voice Transcribe 2.0'daki tüm yenilikleri ele alacağım: yeni özelliklere bakacak, halka açık ve dahili kıyaslamaları inceleyecek ve fiyatlandırma ile API erişimini değerlendireceğim. Ayrıca Grok Voice Think Fast 2.0 API ve GPT Live Transcribe API için rehberlerimize de göz atabilirsiniz.
Özet
- Grok Voice Transcribe 2.0, xAI'nin yeni konuşmadan metne modeli olup, 1.0'ın yerini aynı saatlik fiyatla alıyor.
- Artificial Analysis'in halka açık sıralamasında akış modelleri arasında doğrulukta birinci sırada yer alıyor.
- En büyük kazançlar zorlayıcı seslerde: telefon hatları, sözlü hesap kodları ve e-postalar, ayrıca kısa çok dilli komutlar.
- Takası ise gecikme: nihai transkripti 1.0'a ve ElevenLabs Scribe v2'ye göre daha geç döndürüyor.
- Mevcut entegrasyonlar hiçbir kod değişikliği olmadan yükseltmeyi alıyor, ancak varsayılan değişene kadar model kimliğini açıkça belirtin.
- Bugün rakip bir akış transkripsiyon hizmeti için ödeme yapıyorsanız, kendi sesinizle yan yana test etmeye değer.
Grok Voice Transcribe 2.0 Nedir?
Grok Voice Transcribe 2.0, SpaceXAI'nin ikinci nesil konuşmadan metne modeli ve xAI'nin artık en iyi transkripsiyon modeli olarak adlandırdığı modeldir. Grok Voice'un arkasındaki ses temeli modeli üzerine inşa edilmiştir; SpaceXAI, bunun halihazırda günde on binlerce müşteri destek çağrısını işlediğini, milyonlarca saatlik video anlatımını yazıya döktüğünü ve Tesla araçlarındaki Grok asistanını çalıştırdığını söylüyor.
1.0'dan değişen şey API değil, eğitim. SpaceXAI, 2.0'ı çeşitli ortamlarda kaydedilmiş canlı, gürültülü, çok dilli ses üzerinde eğitti ve ardından gerçek dünyanın en zor koşullarına yönelik art eğitimle geliştirdi:
- İstikrarsız telefon hatları
- Rekabet eden sesler
- Yerel aksanlar
- Yüksek sesle okunan telefon numaraları veya e-posta adresleri
Manşet iddiası, 2.0'ın xAI'nin gerçek dünya değerlendirmelerinde 1.0'dan iki kat daha doğru olduğu ve fiyatlandırmanın ilk nesil ile değişmediğidir. Bu iddiayı kıyaslama bölümünde irdeleyeceğim; çünkü halka açık sıralama tablosu, dahili setlerin sunduğundan daha mütevazı bir tablo çiziyor.
Grok Voice Transcribe 2.0 Temel Özellikler
Özellik listesi 1.0 ile birebir aynı; amaç da bu: xAI yükseltmenin tamamını doğruluğa yatırdı ve API yüzeyini olduğu gibi bıraktı.
Tek bir modelle dosyaları veya canlı sesi yazıya dökün
Kayıtlı bir dosyayı veya bir URL'yi toplu uç noktaya gönderebilir ya da ham sesi bir WebSocket üzerinden aktararak konuşmacı hâlâ konuşurken transkript olaylarını geri alabilirsiniz. Her iki yol da aynı modeli çalıştırır; dolayısıyla bir çağrı kaydının transkriptiyle canlı çağrının transkripti aynı şekilde okunmalıdır.
Toplu işlem, WAV, MP3, FLAC ve MP4 kapsayıcıları ile ham PCM ve G.711 telefon kodekleri dahil 12 ses biçiminde 500 MB'a kadar dosyaları kabul eder. Akış modu yaklaşık her 500 ms'de kısmi transkriptler yayabilir ve her sonucu kilitli parça veya bitmiş sözce olarak etiketler; böylece bir altyazı arayüzü metni erken gösterip sonra değiştirebilir.
Kim neyi, ne zaman söylediğini bilin
Her kelime başlangıç ve bitiş zamanıyla birlikte döner; diyarlama (diarization) açıldığında ise hiçbir ek ücret olmadan her kelimeye bir konuşmacı etiketi eklenir. Temsilcinin bir kanalda, müşterinin diğer kanalda olduğu çağrı merkezi sesleri için çok kanallı mod 8 kanala kadar bağımsız transkripsiyon yapar ve böylece diyarlamayı tamamen devre dışı bırakır.
Yanıt; tam metin, BCP-47 kodu olarak algılanan dil, ses süresi ve kelime dizisini içeren tek bir JSON nesnesidir. Ayrı bir zaman damgası çağrısı yapmanız gerekmez.
Kendi söz dağarcığınızı öğretin
İstek başına 50 karaktere kadar 100 anahtar terime kadar geçebilirsiniz; böylece modeli ürün adları, ilaç adları veya sözlüğün içermediği alanınızın yüksek sesle söylediği ne varsa ona doğru yönlendirebilirsiniz. Metin biçimlendirme, dil parametresini ayarladığınızda sayıları, tarihleri, para birimlerini, telefon numaralarını ve e-posta adreslerini yazılı biçimde yazar; SpaceXAI bunu 25 dil için destekler.
“ıı” ve “eee” gibi dolgu sözcükleri varsayılan olarak ayıklanır. İnsanların okuyacağı transkriptler için doğru, konuşma analitiği için yanlış varsayılandır; dolayısıyla dolgu sözcüklerini geri istiyorsanız bayrak mevcuttur.
Bir sesli ajana arayanın sözünü bitirdiğini söyleyin
Akıllı tur (turn) algılama, bir sesli ajanın her durakta araya girmek yerine bir düşüncenin sonunu beklemesine olanak tanır. 0 ile 1 arasında bir güven eşiği belirlersiniz ve model yalnızca konuşmacının işinin bittiğinden o kadar emin olduğunda sözceyi bitmiş olarak işaretler; SpaceXAI dengeli kullanım için 0,5'i ve insanlar sayı veya adres dikte ettiğinde 0,7'yi önerir.
Eşlik eden bir zaman aşımı, sabit bir sessizlikten sonra turu sona erdirir; böylece uzaklaşan bir arayan oturumu askıda bırakmaz. Akıllı tur olmadan varsayılan sonlandırma 400 ms sessizlikten sonra tetiklenir; bu, kısa komutlar için iyi ama birinin bir telefon numarasını okuduğu durumlar için can sıkıcıdır.
Kayıt ortasında dil değiştirin
Model dili otomatik olarak algılar ve tek bir kayıt içinde dil değişimlerini ipucu olmadan tek geçişte işler. SpaceXAI, çok dilli doğruluğu 1.0'a kıyasla en büyük iyileşme olarak nitelendiriyor ve bir sonraki bölümdeki kısa ifade sayıları bunu destekliyor.
Bir uyarı: Biçimlendirme için dil parametresi hâlâ önemlidir. Yazılı-biçim sayılar ve para birimleri istediğinizde ayarlayın; ses dilleri karıştırıyorsa ve ham kelimeleri tercih ediyorsanız kapalı bırakın.
Grok Voice Transcribe 2.0 Kıyaslamalarda Nasıl Performans Gösteriyor?
Grok Voice Transcribe 2.0, doğrulukta halka açık akış sıralamasının başında yer alıyor ve SpaceXAI'nin raporladığı tüm dahili setlerde 1.0'ı geride bırakıyor; ancak kazancın büyüklüğü hangi sese baktığınıza fazlasıyla bağlı.
Halka açık sıralamada akış doğruluğu
Artificial Analysis'in akışta konuşmadan metne endeksinde Grok Voice Transcribe 2.0, 21 Eylül 2026 itibarıyla listelenen 34 akış modelinin en düşüğü olan %2,7 kelime hata oranı (WER) sergiliyor. Meta'nın Muse Voice Transcribe'ı %3,1 ile onu izliyor, ElevenLabs Scribe v2 Realtime %3,6'da ve Grok Voice Transcribe 1.0 %3,9 ile geriden geliyor. SpaceXAI'nin duyurusu, aynı sıralama tablosunda lansmanda 32 model sayıyor.
WER neyi ölçer: WER, modelin yanlış aldığı kelimelerin payıdır; dolayısıyla daha düşük daha iyidir.
Konuşmadan metne endeksi neyi ölçer: Artificial Analysis'in endeksi, 3 test seti (AA-AgentTalk, VoxPopuli ve Earnings-22) üzerindeki WER'i ortalar. Grok 2.0'ın en geniş farkı VoxPopuli'de; burada %1,4 WER, 1.0'ın %3,1'inin yarısından daha azdır.

Bu endekste 1.0 ile fark %31, duyurunun öne çıkardığı 2 kat değil. Daha büyük iddia, bir sonraki bölümde ele alacağım SpaceXAI'nin kendi üretim setlerinden geliyor. Aynı sıralama tablosu, her modelin nihai transkripti taahhüt etmesinin ne kadar sürdüğünü de kaydediyor ve burada tablo tersine dönüyor.
| Model | WER endeksi (nihai transkript) | Nihai transkripte kadar süre |
|---|---|---|
| Grok Voice Transcribe 2.0 | %2,7 | 0,49 sn |
| Muse Voice Transcribe (Meta) | %3,1 | 0,16 sn |
| ElevenLabs Scribe v2 Realtime | %3,6 | 0,14 sn |
| Grok Voice Transcribe 1.0 | %3,9 | 0,37 sn |
| Deepgram Flux | %7,4 | 0,02 sn |
Gecikme maliyettir. Grok 2.0, nihai transkripti döndürmek için 0,49 sn alır; 1.0 için 0,37 sn ve Scribe v2 Realtime için 0,14 sn. Altyazılar için bu görünmezdir. Her turda yanıt vermesi gereken bir sesli ajan için ise ekstra saliseler birikir.
Gerçek dünya sesleri: telefon, kimlik bilgileri ve kısa ifadeler
SpaceXAI, üretim trafiğinden alınan dört dahili set üzerinde WER ölçüyor:
- Müşteri destek çağrılarından 8 kHz telefon sesleri
- Grok ile yapılan konuşmalar
- Hesap kodları ve e-posta adresleri gibi sözlü kimlik bilgileri
- 19 dilde kısa sesli asistan komutları
Grok Voice Transcribe 2.0, bu dört alanın tamamında 1.0'a göre ilerleme kaydediyor ve telefon seslerinde SpaceXAI, test ettiği her modeli geçtiğini söylüyor.
SpaceXAI'nin bu setlerden yayımladığı tek sayı kısa ifade sonucudur: WER, 1.0 ile %20,6'dan 2.0 ile %6,8'e düşüyor. Kısa araç içi komutlar, modele dili tanımlamak için neredeyse hiç bağlam vermez; bu da 1.0'ın zorlandığı noktaydı ve burada 3 kat iyileşme, “iki kat daha doğru” iddiasının en güçlü kanıtıdır.
Kalan dahili grafikler, ElevenLabs Scribe v2 ve Deepgram Nova-3'e karşı çok dilli karşılaştırma dahil, değer etiketleri olmadan çubuklar halinde sunuluyor. Telefon seslerinde “test ettiğimiz her modelin önünde” ifadesini, biri kendi çağrı sesinde yeniden üretmedikçe tedarikçi iddiası olarak değerlendirirdim.
Grok Voice Transcribe 2.0 Fiyatlandırma ve Kullanılabilirlik
Grok Voice Transcribe 2.0, toplu transkripsiyon için saat başına 0,10 $ ve akış için saat başına 0,20 $ tutarındadır; Grok Voice Transcribe 1.0 ile aynıdır. Diyarlama, kelime zaman damgaları ve anahtar terim yönlendirmesi, eklenti olarak faturalandırılmak yerine bu ücretlere dahildir.
| Mod | Fiyat | Dahil |
|---|---|---|
| Toplu (dosya veya URL) | Ses saati başına 0,10 $ | Diyarlama, zaman damgaları, anahtar terimler, biçimlendirme |
| Akış (WebSocket) | Ses saati başına 0,20 $ | Diyarlama, zaman damgaları, anahtar terimler, biçimlendirme, akıllı tur |
Bu ücretler akış sıralama tablosundaki en düşükler arasındadır. Artificial Analysis, Grok 2.0'ı 1.000 dakika başına 3,33 $ olarak listeliyor; Meta'nın Muse Voice Transcribe'ı 3,00 $ ve ElevenLabs Scribe v2 Realtime ile Deepgram Flux ise 6,50 $. Endeksteki en doğru dört model arasında yalnızca Muse daha ucuz ve Muse'un doğruluk puanı daha düşük.
Model, duyuruda veya dokümanlarda bir bekleme listesi ya da bölge kısıtı belirtilmeden genel olarak SpaceXAI API'sinde kullanılabilir. Bu bir API ürünü olduğundan seçilecek bir tüketici planı yoktur ve ne duyuruda ne de dokümanlarda konuşmadan metne için ücretsiz katman belirtilir.
Varsayılan geçiş halinde. SpaceXAI, 2.0'ın yakında Speech-to-Text API'de varsayılan olacağını ve 1.0'ın önümüzdeki haftalarda kullanım dışı bırakılacağını söylüyor. O zamana kadar model kimliği açıkça ayarlanmalıdır.
Grok Voice Transcribe 2.0 Erişimi Nasıl Alınır?
Model kimliği grok-voice-transcribe-2.0 olup, REST uç noktasında form alanı olarak veya WebSocket uç noktasında sorgu parametresi olarak iletilir. Kullanım dışı bırakma penceresi boyunca eski modelde kalmak için grok-voice-transcribe-1.0 öğesini sabitleyin.
İki yüzeyde çalışır: SpaceXAI API'sinde, toplu işlem https://api.x.ai/v1/stt ve akış wss://api.x.ai/v1/stt; ayrıca canlı konuşmadan metne oyun alanı bulunan SpaceXAI konsolunda. 21 Eylül 2026 itibarıyla OpenRouter'ın kataloğunda yer almıyor.
İşte diyarlamalı bir transkript döndüren en küçük toplu çağrı:
import os
import requests
response = requests.post(
"https://api.x.ai/v1/stt",
headers={"Authorization": f"Bearer {os.environ['XAI_API_KEY']}"},
data=[("model", "grok-voice-transcribe-2.0"), ("diarize", "true")],
files={"file": open("standup.wav", "rb")},
)
print(response.json()["text"])
xAI'nin WebSocket ses API'leri üzerine kurulu sesli ajanlar için, konuşmadan konuşmaya modeli kapsayan Grok Voice Think Fast 2.0 API eğitimimize ve Grok Voice Agent API rehberimize bakın. Aynı kod tabanından Grok'un metin modellerini çağırıyorsanız, Grok 4.6 API eğitimi anahtarları ve araç çağırmayı kapsar.
Son Düşünceler
Grok Voice Transcribe 2.0, halka açık sıralamada en doğru akış transkriptini en ucuza almanın yoludur ve bu kombinasyon nadirdir. xAI, ses yığınının yalnızca metin modelleriyle değil, OpenAI, Google ve ElevenLabs ile rekabet etmeyi amaçladığına dair bir mesaj veriyor.
Sesim telefon kalitesindeyse, çok dilli ise veya sözlü sayılarla doluysa geçiş yapardım; çünkü 2.0 burada 1.0'dan ve çoğu rakipten ayrılıyor. Zaman açısından hassas bir sesli ajan için ise xAI, nihai transkript süresinde Scribe v2 ile arayı kapatana kadar beklerdim.
Transkripsiyon hatlarını kendiniz kurmak istiyorsanız, ham ses dosyalarından yazıya dökülmüş ve sınıflandırılmış çağrılara kadar giden Python ile Konuşulan Dil İşleme kursumuzu öneririm.
Grok Voice Transcribe 2.0 SSS
Grok Voice Transcribe 2.0, Grok Voice Transcribe 1.0 ile nasıl karşılaştırılır?
Grok Voice Transcribe 2.0, aynı fiyat ve aynı API üzerinden 1.0'dan daha doğrudur. Artificial Analysis'in akış kelime hata oranı endeksinde 1.0 için %3,9'a karşı %2,7 puan alır ve xAI'nin dahili kısa ifade setinde hata oranı %20,6'dan %6,8'e düşer. Nihai transkripti döndürmesi ise daha yavaştır: 1.0 için 0,37 sn'ye karşı 0,49 sn.
Grok Voice Transcribe 2.0 ne kadar tutar?
Toplu transkripsiyon ses saati başına 0,10 $ ve akış ses saati başına 0,20 $ tutarındadır; Grok Voice Transcribe 1.0 ile aynıdır. Konuşmacı diyarlaması, kelime düzeyinde zaman damgaları ve anahtar terim yönlendirmesi bu ücretlere dahildir. xAI, konuşmadan metne için ücretsiz bir katman yayımlamıyor.
Grok Voice Transcribe 2.0'a nasıl erişirim?
xAI Speech-to-Text API'yi grok-voice-transcribe-2.0 model kimliğiyle çağırın; bunu REST uç noktasında çok parçalı form alanı olarak veya WebSocket akış uç noktasında sorgu parametresi olarak geçirebilirsiniz. Ayrıca xAI konsolunun konuşmadan metne oyun alanında da deneyebilirsiniz.
Grok Voice Transcribe 2.0 hangi dilleri destekler?
Model onlarca dili yazıya döker, dili otomatik olarak algılar ve tek bir kayıt içindeki dil değişimlerini takip eder. Sayılar, tarihler ve para birimleri için yazılı-biçim metin biçimlendirme, dil parametresini ayarladığınızda İngilizce, İspanyolca, Almanca, Fransızca, Japonca, Hintçe ve Arapça dahil 25 dilde mevcuttur.
Grok Voice Transcribe 2.0 konuşmacı diyarlaması ve gerçek zamanlı akışı destekler mi?
Evet. Diyarlama, hiçbir ek ücret olmadan her kelimeye bir konuşmacı etiketi ekler ve çok kanallı mod 8 ses kanalına kadar bağımsız transkripsiyon yapar. Akış modu, yaklaşık her 500 ms'de kısmi transkriptler ve bir sesli ajanın her duraklama yerine bir düşüncenin sonunu bekleyebilmesi için akıllı tur algılamasıyla bir WebSocket üzerinden çalışır.
Tom bir veri bilimci ve teknik eğitmendir. DataCamp'in veri bilimi eğitim içerikleri ve blog yazılarını yazar ve yönetir. Daha önce Tom, Deutsche Telekom'da veri bilimi alanında çalıştı.
