Ana içeriğe atla

Gemini 3.8 Live: Özellikler, Karşılaştırmalar, Fiyatlandırma ve Erişim

Google'ın yeni konuşmadan konuşmaya modelleri, sesli ajanları ucuz bir varsayılan ve arka plan akıl yürütmeli bir varyant olarak ayırıyor. İşte nelerin değiştiği, maliyetler ve hangisini seçmeniz gerektiği.
Güncel 17 Eyl 2026  · 13 dk. oku

Yapay Zekâyla Keşfet

ChatGPTClaudePerplexity

Ses, bu ayın rekabet alanı. Artificial Analysis'in Speech to Speech Index'inde OpenAI'nin GPT-Live-1 Astra'sı ile SpaceXAI'nin Grok Voice Think Fast 2.0'ı zirvede 0,2 puan farkla yer alıyordu ve OpenAI Eylül başında GPT-6 Astra'yı yayımladı. 15 Eylül'de Google, iki yeni konuşmadan konuşmaya modelle yanıt verdi: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking.

Extended Thinking, 82,6 puanla o endekste bir numaraya yerleşiyor ve τ-Voice aracılık kıyaslamasında %68,6 ile lider. Temel 3.8 Live modeli ise ucuz olan: Artificial Analysis'in maliyet testinde bir saatlik girdi sesini 0,84 $ karşılığında işliyor; Google'ın çizelgesindeki tüm modeller arasında en düşük değer. Her ikisi de bugün Gemini API'sinde genel erişimde ve selefi Gemini 3.1 Flash Live ile aynı fiyattan sunuluyor.

Bu yazıda, Gemini 3.8 Live ile gelen tüm yenilikleri; özellikleri, kıyaslamaları, iki varyant arasındaki farkları ve çalıştırma maliyetlerini ele alacağım. Ayrıca Gemini Live API'ye başlama ve GPT-Live-1 ile bir sesli asistan oluşturma rehberlerimize de göz atabilirsiniz.

Özet

  • Gemini 3.8 Live ve 3.8 Live Extended Thinking, Gemini 3.1 Flash Live'ın yerini alan, sesli ajanlar için Google'ın yeni konuşmadan konuşmaya modelleridir.
  • Extended Thinking, konuşmaya devam ederken arka planda akıl yürütür ve araç çağrıları yapar; şu anda Artificial Analysis'in konuşmadan konuşmaya ve τ-Voice sıralamalarında zirvede.
  • Temel model hızlı ve ucuzdur ancak çok adımlı aracılık işlerinde zayıftır; araçlar bir anı aşan sürede dönüyorsa Extended Thinking'i tercih edin.
  • Fiyatlandırma önceki nesille aynı; model dizesini değiştirmenin ötesinde taşınma maliyeti yok.
  • Gemini 3.1 Flash Live kullanıyorsanız yükseltin. OpenAI'nin gerçek zamanlı yığını üzerindeyseniz, sadece fiyat farkı bile bir öğleden sonralık denemeye değer.

Gemini 3.8 Live Nedir?

Gemini 3.8 Live, gerçek zamanlı sesli ajanlar için Google'ın yerel konuşmadan konuşmaya modelidir ve 15 Eylül 2026'da daha yüksek akıl yürütme yetenekli kardeşi Gemini 3.8 Live Extended Thinking ile birlikte yayımlandı. Her ikisi de Gemini Live API üzerinden WebSocket bağlantısıyla çalışır; girdi olarak ses, video, görseller ve metin alır ve çıktı olarak ses döndürür. Google, 3.8 Live'ı düşük gecikmeli diyaloglar için varsayılan, Extended Thinking'i ise karmaşık, çok adımlı görevler için tercih olarak konumlandırıyor.

Gemini 3.1 Flash Live'a göre nesil değişimi, modelin konuşma dışındaki işleri nasıl ele aldığıdır. Araç ve API çağrıları artık varsayılan olarak arka planda çalışırken model sohbete devam eder ve Extended Thinking bunun üzerine yapılandırılabilir arka plan akıl yürütme ekler. Google, bu ikiliyi önceki canlı modellerine göre sıçrama olarak ve konuşmadan metne, bir BBA ve metinden konuşmaya zincirleyen kademeli boru hatlarının yerine geçecek şekilde tanımlıyor.

Gemini 3.8 Live'ın Temel Özellikleri

Google, yeni modeller için beş yetenek listeliyor ve sesli ajan geliştiren herkes için en kritik olanlar, konuşma döngüsünü değiştiren ikisi: eşzamansız araç çağrıları ve arka plan akıl yürütme.

Araçlar çalışırken konuşmaya devam edin

Her iki model de ses akışını kullanıcıya geri gönderirken fonksiyon çağrılarını ve API isteklerini arka planda yürütür. Gemini 3.8 Live'da eşzamansız yürütme artık varsayılan fonksiyon çağırma modudur. Bir araç bildiriminde behavior: BLOCKING ayarlayarak eski eşzamanlı davranışı hâlâ zorlayabilirsiniz ve model, bir sonucun ne zaman seslendirileceğine karar veren SILENT, WHEN_IDLE ve INTERRUPTED seçenekleriyle zamanlamayı destekler.

Extended Thinking daha da ileri gider: engelleyici (blocking) araçlara izin vermez ve böyle bir araç bildirirseniz katı bir hata döndürür. Pratikte bu, bir aramayı değiştirmeyi isteyen bir arayanın, bir API'yi bekleyen kademeli boru hattının ürettiği sessizlik yerine, hemen bir onay, ardından bir ilerleme güncellemesi ve sonra sonucu duyması anlamına gelir. Gemini 3.1 Flash Live'da fonksiyon çağrıları yalnızca sıralıydı ve aracı sonucunu geri gönderene kadar model yanıt vermeye başlamazdı.

Sessiz kalmadan arka planda akıl yürütme

Gemini 3.8 Live Extended Thinking aynı anda hem akıl yürütür hem konuşur. Google'ın dokümanları, modelin bir istemi onaylamak için "Bir bakayım" gibi erken sözel ipuçları kullandığını ve çok adımlı arka plan işi tamamlanırken ilerlemeyi anlatı olarak aktardığını açıklıyor. Derinliği, thinking_level'i low, medium veya high olarak ayarlayarak kontrol edersiniz; 3.1 Flash Live'da bulunan MINIMAL seviyesi artık yok.

Bu, protokolü değiştiriyor ve bence sürümdeki en önemli geçiş ayrıntısı bu. Model bir istekte birden fazla kez konuşabileceği için, turnComplete: true artık modelin boşta olduğu anlamına gelmiyor.

İstemcinizin, akıl yürütme veya araçlar çalışırken IN_PROGRESS, tüm görev bittiğinde IDLE bildiren yeni interaction_status alanını izlemesi gerekir. Bunu atladığınızda, model hâlâ görev ortasındayken arayüzünüz "dinliyor" durumuna geri dönecektir.

Kullanıcının gördüğünü görün

Gemini 3.8 Live, canlı görsel girdiye dayanarak diyaloğu temellendirir; bir ajan, bir kullanıcının söylediğinin yanı sıra baktığı şeye de yanıt verebilsin diye video karelerini neredeyse gerçek zamanlı işler. Google'ın demolarında canlı bir satranç oyunu ve modelin ekrandakiler hakkında soruları yanıtladığı bir çalışan işe alım akışı yer alıyor.

Video ise ücretsiz değil. Artık tur kapsamı varsayılan olarak ses etkinliğini ve tüm video karelerini modele göndermeye ayarlı; bu nedenle, uygulamanız görmeye ihtiyaç duymuyorsa, hem bağlam bütçesi hem de maliyet açısından kareleri yalnızca faydalı olduklarında gönderin. Ses artı video oturumları ayrıca 2 dakika ile sınırlıdır ve uzatmak için oturum yönetimi gerekir; ses-only oturumları için bu sınır 15 dakikadır.

Onay kodlarını ve başvuru numaralarını doğru alın

Google, buna "alfanümerik hassasiyet" diyor: yüksek sesle telaffuz edilen onay kodları, başvuru numaraları ve teknik tanımlayıcılar gibi dizgileri doğru şekilde ayrıştırmak. Destek veya lojistik için sesli ajan kuran herkes bilir ki kademeli yığınlar burada tökezler; çünkü zincirin başındaki bir konuşmadan yazıya hatası, aşağı akışta telafi edilemez. Tüm ifadeyi bağlam içinde duyan yerel bir konuşma modeli burada yapısal bir avantaja sahiptir.

Cümlenin ortasında dil değiştirin

Gemini 3.8 Live, bir konuşma sırasında desteklenen 97 dil arasında algılar ve geçiş yapar; Google buna diller arasında aksan tutarlılığı diyor. Her iki model de Google'ın artımlı içerik güncellemeleri dediği özelliği destekler: oturuma herhangi bir noktada, açık bir user veya model rolüyle yapılandırılmış veri gönderebilirsiniz ve model bunu canlı sesle birleştirir. Müşteri kaydını veya sipariş durumunu akışı bozmadan devam eden bir aramaya bu şekilde aktarırsınız.

İki küçük değişiklik mevcut kodu etkiler. Modelin kendisine yöneltilmeyen konuşmalara yanıt vermemeye karar verebildiği proaktif ses artık kalıcı olarak açık ve bunu false yapmaya çalışmak hata döndürür. Duygusal diyalog API'den tamamen kaldırılmıştır; dolayısıyla herhangi bir enable_affective_dialog yapılandırmasını kaldırmanız gerekir.

Gemini 3.8 Live Kıyaslamalarda Nasıl Performans Gösteriyor?

Extended Thinking, Google'ın yayımladığı tüm kalite ve aracılık tablolarında lider, ancak OpenAI'nin GPT-Live-1 Astra'sı üzerinde dar farklarla; temel 3.8 Live modeli ise maliyette açık ara kazanırken aracılık görevlerinde geride kalıyor.

Aşağıdaki endeks, τ-Voice, Big Bench Audio ve maliyet rakamları Artificial Analysis'in herkese açık lider panosundan; yani satıcı raporu değil, bağımsız ölçümler. τ³-Banking sayıları ise Google'ın Sierra'yı kaynak gösterdiği lansman grafiğinden geliyor; Sierra'nın panosunda aynı değerler görünene kadar bu satırı satıcı raporu olarak değerlendirin.

Aracılık görev tamamlama

Artificial Analysis tarafından ölçülen, bir sesli ajanın araçlarla çok adımlı görevleri tamamlayıp tamamlamadığını değerlendiren Sierra'nın τ-Voice kıyaslamasında Gemini 3.8 Live Extended Thinking önde. GPT-Live-1 Astra hemen arkasında, diğer rakipler daha geride:

  • Gemini 3.8 Live Extended Thinking: %68,6
  • GPT-Live-1 Astra: %67,9
  • Grok Voice Think Fast 2.0: %56,5
  • Gemini 3.1 Flash Live: %37,7
  • Gemini 3.8 Live (temel sürüm): %30,1

Beni şaşırtan sayı, temel modelin τ-Voice skorunun kendi selefinin altında kalması. Google, 3.8 Live'ın karmaşık iş akışlarından ziyade ölçek ve maliyet verimliliği için tasarlandığını açıkça belirtiyor; ancak iki varyant arasında 38 puanı aşan bir fark, katman seçiminin nüans meselesi olmadığını gösteriyor. Ajanınız araçları zincirliyorsa temel model yanlış varsayılandır.

Extended Thinking, τ-Voice görevlerinin %68,6'sını tamamlayarak temel modelin iki katından fazla

Sierra'nın bankacılık iş akışları etrafında kurgulanmış daha zor müşteri hizmetleri kıyaslaması τ³-Banking panosunda, Extended Thinking %35,1 puan alırken GPT-Live-1 Astra %32,0, SpaceXAI'nin Grok Voice Think Fast 2.0'ı %16,5, Gemini 3.1 Flash Live %11,3 ve GPT-Realtime 2 %10,3 alıyor. Bu panodaki her model çoğu zaman başarısız oluyor; bu da sesli ajanların gözetimsiz bankacılık işlerinden hâlâ ne kadar uzak olduğunu gösteriyor; ancak önceki Gemini nesline göre üçe katlama gerçek bir adım.

Konuşma kalitesi ve akıl yürütme

Speech to Speech Index'te Extended Thinking rakiplerinin önünde, az da olsa:

  • Gemini 3.8 Live Extended Thinking: 82,6
  • GPT-Live-1 Astra: 81,5
  • Grok Voice Think Fast 2.0: 81,3
  • Gemini 3.8 Live (temel sürüm): 76,0
  • Gemini 3.1 Flash Live: 71,5

OpenAI'ye karşı 1,1 puanlık bir fark, farktır; fakat buna satın alma kararı bağlamazdım.

Yalnızca konuşma girdisi üzerinde akıl yürütmede, Google Extended Thinking için Big Bench Audio'da %97,7 rapor ediyor. Google ayrıca her iki modelin de ServiceNow'un sesli ajanlar için EVA-Bench'inde Pareto sınırını ileri ittiğini, doğruluğu konuşma kalitesiyle dengelediğini bildiriyor; ancak bu çalışma, herkese açık API yerine Gemini Enterprise Agent Platform üzerinden Live API'de yapılmış.

Saat başına ses maliyeti

Google'ın en çok görmek istediği grafik bu. Artificial Analysis'in Big Bench Audio alt kümesindeki maliyet testinde, Gemini 3.8 Live bir saatlik girdi sesini 0,84 $ karşılığında işliyor.

Aynı saat için Extended Thinking 3,50 $, Grok Voice Think Fast 2.0 4,80 $ ve GPT-Live-1 Astra 5,83 $ tutuyor. Gemini 3.1 Flash Live ise düşünme seviyesine bağlı olarak 1,50 $ ve 1,75 $ seviyelerindeydi.

İki Gemini çubuğunu birlikte okuyun; ürün stratejisi açık. Temel model, tahtadaki her şeyi geniş bir farkla alt ediyor ve OpenAI ile kalitede başa baş giden akıl yürütme modeli, girdi sesinin saati başına hâlâ %40 daha ucuz. Dikkat: Akıl yürütme modeli, daha yüksek düşünme seviyelerinde daha fazla belirteç tüketir; bu yüzden aynı fiyat tablosunu paylaşmasına rağmen kardeşinin yaklaşık 4 katı tutar.

Hangi Katmanı Kullanmalısınız?

Gemini 3.8 Live, çoğu sesli ajan için doğru varsayılandır; Extended Thinking ise ajan planlama, karşılaştırma yapma veya yavaş araçları bekleme gerektirdiğinde, daha yüksek belirteç tüketimine değer. Google'ın kendi rehberi çizgiyi araç gecikmesinde çeker: fonksiyonlarınız milisaniyelerde dönüyorsa temel modelde kalın.

Gemini 3.8 Live ile başlayın; araçlar saniyeler alıyorsa Extended Thinking'e geçin

İki varyant aynı fiyat tablosunu (aşağıda ele alacağım), 131.072 giriş ve 65.536 çıkış belirteci sınırlarını ve aynı WebSocket uç noktasını paylaşır. Onları ayıran, akıl yürütme mimarisidir.

Gemini 3.8 Live, sabit gecikme profiliyle iç içe akıl yürütme kullanır ve thinking_level ayarı hiç yoktur. Extended Thinking, low, medium ve high arka plan akıl yürütmesini sunar, çalışırken konuşma dolgu sözcükleri akıtır ve eşzamansız araçları zorunlu kılar. Bu düşünme seviyeleri, sürümdeki tek çaba kontrolüdür.

Kullanım durumu Seçim Neden
Müşteri hizmetleri triyajı, sesli arama, dil pratiği Gemini 3.8 Live Anında sıra alma derinlikten daha önemlidir ve her kullanıcının turu bir yanıt alır
Akıllı cihaz kontrolü, sensör değerlerini okuma Gemini 3.8 Live Araçlar milisaniyelerde döner; maskelenecek bir boşluk yoktur
Günlükler, hata kodları ve yapılandırma kontrolleri genelinde teknik destek Extended Thinking Çok adımlı bir teşhis, ifadeler arasında arka plan akıl yürütmesi ister
Uçuş ve otelleri paralel sorgulayan seyahat ve rezervasyon ajanları Extended Thinking Sessizlik yerine konuşarak ilerleme güncellemeleriyle paralel eşzamansız çağrılar
STEM ve kod mentörlüğü Extended Thinking Model, açıklama yapmadan önce formülleri doğrular veya kodu hata ayıklar

Bir husus daha: istemci karmaşıklığı. Extended Thinking'e geçmek, durumu interaction_status etrafında yeniden yazmak demektir; bu nedenle çalışan bir 3.1 Flash Live uygulamanız varsa, temel model doğrudan yükseltmedir ve akıl yürütme modeli küçük bir yeniden düzenlemedir.

Gemini 3.8 Live Fiyatlandırma ve Kullanılabilirlik

Her iki model de Gemini 3.1 Flash Live Preview fiyat tablosunu paylaşır; dolayısıyla yükseltme ücretsizdir. Ücretli katmanda, ses girişi 1 milyon belirteç başına 3,00 $ (Google'ın tahminiyle dakikada 0,005 $) ve ses çıkışı 1 milyon belirteç başına 12,00 $ (yaklaşık dakikada 0,018 $) tutar. Düşünme belirteçleri çıkış oranından faturalandırılır; Extended Thinking'in daha yüksek çalışma maliyeti buradan gelir.

Biçim Ücretli katman, 1M belirteç başına Dakika başına tahmin
Metin girişi $0.75 n/a
Ses girişi $3.00 $0.005/dk
Görsel ve video girişi $1.00 $0.002/dk
Metin çıkışı $4.50 n/a
Ses çıkışı (düşünme belirteçleri dahil) $12.00 $0.018/dk

Ücretsiz katman, her iki modeli de girdi ve çıktı için ücretsiz kapsar; tek koşul, Google'ın ücretsiz katman verilerini ürünlerini geliştirmek için kullanmasıdır; ücretli katman verileri bu şekilde kullanılmaz.

Google Arama ile köprüleme her iki katmanda da desteklenir; Gemini 3.x modelleri genelinde aylık 5.000 ücretsiz arama isteği vardır ve sonrasında 1.000 istek başına 14 $ ücret alınır. Google, bu modellere özgü hız limitlerini yayımlamadı; bu yüzden bir lansman planlamadan önce katmanınıza uygun Gemini API hız limitleri sayfasını kontrol edin.

Kullanılabilirlik üçe ayrılıyor:

  • Geliştiriciler: her iki model de 15 Eylül itibarıyla Gemini API ve Google AI Studio'da genel erişimde.
  • Kurumsal müşteriler: her ikisi de Gemini Enterprise içinde özel ön izlemede ve yakında Gemini Enterprise for Customer Experience'e geliyor; Extended Thinking ayrıca Google Workspace iş müşterilerine geliyor.
  • Tüketiciler: Gemini 3.8 Live, Search Live'ı güçlendiriyor; Extended Thinking, Gemini Live'a; Google AI Pro ve Ultra aboneleri için Docs'a ve tüm Google AI aboneleri için Gmail ve Keep'e sunuluyor.

Her iki modelden çıkan her ses, bir SynthID filigranı taşır ve Google'ın model kartı sınırlar konusunda açık: modeller hâlâ halüsinasyon üretebilir, jailbreak direnci hâlâ geliştirilmektedir ve zaman zaman yavaşlık veya zaman aşımı olabilir. Bu uyarıları, herhangi bir modeli müşterilerin önüne koymadan önce okumaya değer.

Gemini 3.8 Live'a Nasıl Erişim Sağlanır?

Model kimlikleri gemini-3.8-live ve gemini-3.8-live-extended-thinking; ikisi de ön izleme soneki olmayan kararlı dizelerdir.

Google-genai Python veya JavaScript SDK'sıyla Gemini Live API üzerinden, ham WebSocket'lerle ya da Google AI Studio'nun Stream görünümünde etkileşimli olarak erişebilirsiniz.  Google ayrıca medya akış katmanını yöneten Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel ve Vision Agents'ı entegrasyon ortağı olarak listeliyor ve hâlihazırda ADK üzerinde geliştiriyorsanız bir Agent Development Kit akış yolu da mevcut.

Aşağıdaki minimal Python oturumu bir bağlantı açar, bir metin turu gönderir ve modelin söylediklerini okuyabilmeniz için bir çıktı transkriptini etkinleştirir:

import asyncio
from google import genai

client = genai.Client()
config = {"response_modalities": ["AUDIO"], "output_audio_transcription": {}}

async def main():
    async with client.aio.live.connect(model="gemini-3.8-live", config=config) as session:
        await session.send_client_content(
            turns={"role": "user", "parts": [{"text": "Read back the claim number 7Q-4418-B."}]},
            turn_complete=True,
        )
        async for response in session.receive():
            if response.server_content and response.server_content.output_transcription:
                print(response.server_content.output_transcription.text)

asyncio.run(main())

gemini-3.1-flash-live-preview'dan geçiş yapıyorsanız, model dizgesini değiştirin ve kurulumunuzdan herhangi bir thinking_level veya thinking_config'i kaldırın; tur yaşam döngüsü bunun dışında aynıdır. Live API varsayılan olarak sunucudan sunucuya çalışır; bu nedenle tarayıcı ve mobil istemciler geçici belirteçlere ihtiyaç duyar.

Ses yakalama, çalma ve oturum yönetiminin tam bir anlatımı için Gemini Live API eğitimimize; aynı ailenin metin tarafı için ise Gemini 3.8 Flash API eğitimimize bakın; burada Python'da düşünme seviyeleri ve fonksiyon çağırma ele alınır.

Son Düşünceler

Google, ham kaliteden ziyade fiyatla bir mesaj veriyor. Extended Thinking'in GPT-Live-1 Astra'ya üstünlüğü her tabloda bir iki puan; fakat Gemini 3.8 Live'ın girdi sesinin saati başına 0,84 $ olması, OpenAI'nin modelini neredeyse 7 kat farkla geride bırakıyor ve üretim ses trafiğinin nereye gideceğine de bu sayı karar veriyor.

Benim görüşüm: Gemini 3.1 Flash Live üzerinde herhangi bir şey çalıştırıyorsanız, fiyat aynı olduğundan ve sadece eşzamansız araç çağırma bile buna değdiğinden, bu hafta yükseltin. OpenAI'nin gerçek zamanlı yığını üzerindeyseniz, temel model triyaj ve arama akışları için denemeye değer; araçlarınızın saniyeler aldığı her yerde ise Extended Thinking de denemeye değer. Temel modelin τ-Voice'ta %30,1'i, onu aracılık gerektiren işler için kullanmama nedenidir.

Bir sesli ajanın araç çağırma tarafını doğru inşa etmek istiyorsanız, Gemini'yi araçlar, emniyet şeritleri ve yetki devriyle bir müşteri destek ajanına bağlayan Google ADK ile Yapay Zekâ Ajanları Oluşturma kursumuzu öneririm.

SSS

Gemini 3.8 Live ile Gemini 3.8 Live Extended Thinking arasındaki fark nedir?

Gemini 3.8 Live, doğrudan ses görevleri için düşük gecikmeli Google konuşmadan konuşmaya modelidir; iç içe akıl yürütme sunar ve düşünme seviyesi ayarı yoktur. Gemini 3.8 Live Extended Thinking, yapılandırılabilir arka plan akıl yürütmesi (low, medium veya high) ekler ve eşzamansız araçlar çalışırken ilerleme güncellemelerini seslendirir. Extended Thinking, τ-Voice'ta %68,6; temel model ise %30,1 skor alır; bu yüzden çok adımlı aracılık işleri için Extended Thinking'i seçin.

Gemini 3.8 Live ne kadar maliyetlidir?

Her iki model de ücretli katmanda tek bir fiyat tablosunu paylaşır: 1 milyon ses girdi belirteci için 3,00 $ (dakika başına yaklaşık 0,005 $) ve düşünme belirteçleri dahil 1 milyon ses çıktı belirteci için 12,00 $ (dakika başına yaklaşık 0,018 $). Metin, 1 milyon giriş belirteci için 0,75 $ ve 1 milyon çıkış belirteci için 4,50 $ tutar. Ücretsiz katman her iki modeli de kapsar; ücretsiz katman verileri Google'ın ürünlerini geliştirmek için kullanılır.

Gemini 3.8 Live'a nereden erişebilirim?

Geliştiriciler gemini-3.8-live ve gemini-3.8-live-extended-thinking modellerini Gemini Live API ve Google AI Studio üzerinden kullanabilir; ikisi de genel erişimdedir. Kurumlar, Gemini Enterprise içinde özel ön izleme alır. Tüketiciler, Gemini 3.8 Live'ı Search Live'da; Extended Thinking'i ise Gemini Live'da ve ayrıca Google AI aboneleri için Docs, Gmail ve Keep'te bulur.

Gemini 3.8 Live, Gemini 3.1 Flash Live ile nasıl karşılaştırılır?

Gemini 3.8 Live, aynı fiyattan 3.1 Flash Live ön izlemesinin yerini alır; varsayılan olarak eşzamansız fonksiyon çağırma açık gelir ve Google'ın tablolarının çoğunda daha yüksek skorlar alır: Artificial Analysis'in Speech to Speech Index'inde 71,5'e karşı 76,0. Geçiş yapmak, model dizgesini değiştirmek ve oturum kurulumunuzdan herhangi bir thinking_level veya thinking_config'i kaldırmak anlamına gelir. Google, 3.1 Flash Live kullanıcılarının 3.8 Live'a geçmesini önerir.

Gemini 3.8 Live fonksiyon çağırma ve video girişi destekliyor mu?

Evet. Her iki model de fonksiyon çağırmayı destekler ve araç çağrıları, model konuşmaya devam ederken arka planda çalışır. Gemini 3.8 Live ayrıca ses ve metnin yanı sıra video karelerini ve görselleri de kabul eder; böylece bir ajan, kullanıcının baktığı şeye de yanıt verebilir. Ses artı video oturumları 2 dakika ve yalnızca sesli oturumlar 15 dakika ile sınırlıdır; uzatmak için oturum yönetimi gerekir.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom bir veri bilimci ve teknik eğitmendir. DataCamp'in veri bilimi eğitim içerikleri ve blog yazılarını yazar ve yönetir. Daha önce Tom, Deutsche Telekom'da veri bilimi alanında çalıştı.

Konular
Yapay Zekâ Aracıları
Yapay Zeka

DataCamp ile Aracılık Yapay Zekâyı Öğrenin!

Kurs

Google ADK ile AI Ajanları Oluşturma

1 sa
7.5K
Google'ın Ajan Geliştirme Kiti (ADK) ile adım adım bir müşteri destek asistanı oluşturun.
Ayrıntıları GörRight Arrow
Kursa Başla
Devamını GörRight Arrow