Chuyển đến nội dung chính

Gemini 3.8 Live: Tính năng, điểm chuẩn, giá và cách truy cập

Các mô hình speech-to-speech mới của Google chia tác tử giọng nói thành một mặc định giá rẻ và một biến thể suy luận nền. Đây là những gì đã thay đổi, chi phí, và cách chọn.
Đã cập nhật 17 thg 9, 2026  · 13 phút đọc

Khám phá với AI

ChatGPTClaudePerplexity

Giọng nói là mặt trận nóng trong tháng. Trên Speech to Speech Index của Artificial Analysis, GPT-Live-1 Astra của OpenAI và Grok Voice Think Fast 2.0 của SpaceXAI chỉ cách nhau 0,2 điểm ở nhóm dẫn đầu, và OpenAI đã phát hành GPT-6 Astra đầu tháng 9. Ngày 15/9, Google hồi đáp với hai mô hình speech-to-speech mới: Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking.

Extended Thinking giành vị trí số một trên chỉ số đó với điểm 82,6 và dẫn đầu bảng đánh giá tác tử τ-Voice với 68,6%. Bản 3.8 Live nền tảng thì rẻ: trong bài kiểm tra chi phí của Artificial Analysis, mô hình xử lý một giờ âm thanh đầu vào với giá 0,84 USD, thấp nhất trong các mô hình Google công bố. Cả hai hiện đã khả dụng rộng rãi trong Gemini API với mức giá tương đương thế hệ trước, Gemini 3.1 Flash Live.

Bài viết này sẽ tổng hợp tất cả điểm mới của Gemini 3.8 Live, gồm tính năng, điểm chuẩn, sự khác biệt giữa hai biến thể và chi phí vận hành. Bạn cũng có thể xem hướng dẫn của chúng tôi về bắt đầu với Gemini Live APIxây dựng trợ lý giọng nói với GPT-Live-1.

TL;DR

  • Gemini 3.8 Live và 3.8 Live Extended Thinking là các mô hình speech-to-speech mới của Google dành cho tác tử giọng nói, thay thế Gemini 3.1 Flash Live.
  • Extended Thinking lập luận và gọi công cụ ở chế độ nền trong khi vẫn tiếp tục trò chuyện, và hiện đứng đầu bảng xếp hạng speech-to-speech và τ-Voice của Artificial Analysis.
  • Bản nền tảng nhanh và rẻ nhưng yếu ở công việc tác tử nhiều bước, nên hãy chọn Extended Thinking bất cứ khi nào công cụ mất hơn một khoảnh khắc để trả kết quả.
  • Giá không đổi so với thế hệ trước, vì vậy việc di chuyển không phát sinh chi phí ngoài thay đổi chuỗi tên mô hình.
  • Nếu bạn đang dùng Gemini 3.1 Flash Live, hãy nâng cấp. Nếu bạn đang dùng stack realtime của OpenAI, chỉ riêng chênh lệch giá đã đáng để thử trong một buổi chiều.

Gemini 3.8 Live là gì?

Gemini 3.8 Live là mô hình speech-to-speech gốc của Google cho tác tử giọng nói thời gian thực, ra mắt ngày 15/9/2026 cùng người anh em có khả năng suy luận cao hơn, Gemini 3.8 Live Extended Thinking. Cả hai chạy qua Gemini Live API qua kết nối WebSocket, nhận âm thanh, video, hình ảnh và văn bản làm đầu vào, và trả về âm thanh. Google định vị 3.8 Live là mặc định cho đối thoại độ trễ thấp và Extended Thinking là lựa chọn cho tác vụ phức tạp, nhiều bước.

Sự thay đổi thế hệ so với Gemini 3.1 Flash Live nằm ở cách mô hình xử lý phần công việc ngoài “nói chuyện”. Lời gọi công cụ và API nay mặc định chạy nền trong khi mô hình tiếp tục hội thoại, và Extended Thinking bổ sung khả năng suy luận nền có thể cấu hình. Google mô tả cặp đôi này như một bước nhảy so với các mô hình live trước đó và là sự thay thế cho các pipeline xếp tầng nối speech-to-text, một LLM và text-to-speech.

Tính năng chính của Gemini 3.8 Live

Google liệt kê năm khả năng cho các mô hình mới, và điều quan trọng nhất với bất cứ ai xây tác tử giọng nói là hai yếu tố thay đổi vòng lặp hội thoại: gọi công cụ bất đồng bộ và suy luận nền.

Tiếp tục nói trong khi công cụ chạy

Cả hai mô hình thực thi lời gọi hàm và yêu cầu API ở chế độ nền trong khi vẫn phát âm thanh về phía người dùng. Trên Gemini 3.8 Live, thực thi bất đồng bộ nay là chế độ gọi hàm mặc định. Bạn vẫn có thể ép hành vi đồng bộ cũ bằng cách đặt behavior: BLOCKING trong khai báo công cụ, và mô hình hỗ trợ lập lịch hàm với các tùy chọn SILENT, WHEN_IDLEINTERRUPTED để quyết định khi nào kết quả được đọc ra.

Extended Thinking đi xa hơn: nó yêu cầu công cụ không chặn và trả lỗi cứng nếu bạn khai báo công cụ chặn. Hiệu ứng thực tế là người gọi yêu cầu đổi đặt chỗ sẽ nghe xác nhận ngay lập tức, rồi cập nhật tiến độ, rồi kết quả, thay vì im lặng như pipeline xếp tầng trong lúc chờ API. Trên Gemini 3.1 Flash Live, gọi hàm chỉ theo trình tự, và mô hình sẽ không bắt đầu phản hồi cho đến khi bạn gửi lại kết quả công cụ.

Suy luận ở chế độ nền mà không im lặng

Gemini 3.8 Live Extended Thinking vừa suy luận vừa nói. Tài liệu của Google mô tả mô hình dùng các tín hiệu lời nói sớm như “Để tôi kiểm tra” để xác nhận lời nhắc, rồi tường thuật tiến trình khi công việc nền nhiều bước hoàn tất. Bạn điều khiển độ sâu bằng thinking_level đặt thành low, medium hoặc high; mức MINIMAL từng có trên 3.1 Flash Live đã bị loại bỏ.

Điều này thay đổi giao thức, và theo tôi đây là chi tiết di trú quan trọng nhất của bản phát hành. Vì mô hình có thể nói nhiều lần trong một yêu cầu, turnComplete: true không còn đồng nghĩa là nó đang rảnh.

Ứng dụng khách của bạn phải theo dõi trường interaction_status mới, trường này báo IN_PROGRESS khi đang suy luận hoặc chạy công cụ và IDLE khi toàn bộ tác vụ đã xong. Bỏ qua điều đó, UI của bạn sẽ chuyển về “đang lắng nghe” trong khi mô hình vẫn đang giữa chừng tác vụ.

Nhìn thấy những gì người dùng thấy

Gemini 3.8 Live neo hội thoại vào đầu vào hình ảnh trực tiếp, xử lý khung hình video gần thời gian thực để tác tử có thể phản hồi cả những gì người dùng đang nhìn lẫn những gì họ nói. Bản demo của Google bao gồm một ván cờ trực tiếp và một quy trình hướng dẫn nhân viên mới, nơi mô hình trả lời câu hỏi về nội dung trên màn hình.

Tuy nhiên, video không miễn phí. Phạm vi phiên nay mặc định gửi hoạt động âm thanh cùng tất cả khung hình video tới mô hình, nên nếu ứng dụng của bạn không cần thị giác, bạn chỉ nên gửi khung hình khi hữu ích, cả vì ngân sách ngữ cảnh lẫn chi phí. Phiên âm thanh kèm video cũng bị giới hạn 2 phút trước khi cần quản lý phiên để kéo dài, so với 15 phút cho phiên chỉ âm thanh.

Đọc đúng mã xác nhận và số hồ sơ

Google gọi đây là “độ chính xác chữ-số”: phân tích chính xác các chuỗi như mã xác nhận, số hồ sơ, và định danh kỹ thuật được đọc to. Ai từng xây tác tử giọng nói cho hỗ trợ hoặc logistics đều biết đây là nơi các stack xếp tầng hay “ngã ngựa”, vì lỗi speech-to-text sớm trong chuỗi sẽ không thể khắc phục về sau. Một mô hình giọng nói gốc nghe trọn vẹn phát ngôn trong bối cảnh có lợi thế cấu trúc ở đây.

Chuyển ngôn ngữ giữa chừng câu

Gemini 3.8 Live nhận diện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong suốt cuộc trò chuyện, với điều Google gọi là sự nhất quán về giọng. Cả hai mô hình cũng hỗ trợ cái gọi là cập nhật nội dung tăng dần: bạn có thể gửi dữ liệu có cấu trúc vào phiên bất cứ lúc nào, với vai trò user hoặc model rõ ràng, và mô hình sẽ hợp nhất nó với âm thanh trực tiếp. Đó là cách bạn đưa hồ sơ khách hàng hoặc trạng thái đơn hàng vào một cuộc gọi đang diễn ra mà không làm đứt mạch.

Hai thay đổi nhỏ ảnh hưởng mã hiện có. Âm thanh chủ động, nơi mô hình có thể quyết định không phản hồi lời nói không nhắm vào nó, nay được bật vĩnh viễn, và đặt false sẽ trả lỗi. Đối thoại cảm xúc đã bị loại khỏi API hoàn toàn, nên mọi cấu hình enable_affective_dialog phải gỡ bỏ.

Gemini 3.8 Live thể hiện ra sao trên các điểm chuẩn?

Extended Thinking dẫn đầu mọi bảng chất lượng và tác tử mà Google công bố, nhưng chỉ nhỉnh hơn một chút so với GPT-Live-1 Astra của OpenAI, trong khi bản 3.8 Live nền tảng thắng lớn về chi phí nhưng thua ở tác vụ tác tử.

Các con số về chỉ số, τ-Voice, Big Bench Audio và chi phí dưới đây đều nằm trên bảng xếp hạng công khai của Artificial Analysis, nên được đo độc lập chứ không do nhà cung cấp báo cáo. Số liệu τ³-Banking đến từ biểu đồ ra mắt của Google trích dẫn Sierra, vì vậy hãy coi hàng đó là do nhà cung cấp báo cáo cho đến khi bảng của Sierra hiển thị tương tự.

Hoàn thành tác vụ tác tử

Gemini 3.8 Live Extended Thinking dẫn đầu trên τ-Voice, điểm chuẩn của Sierra đo xem một tác tử giọng nói có hoàn thành tác vụ nhiều bước với công cụ hay không, được Artificial Analysis đo lường. GPT-Live-1 Astra bám sát, trong khi phần còn lại tụt lại sau:

  • Gemini 3.8 Live Extended Thinking: 68,6%
  • GPT-Live-1 Astra: 67,9%
  • Grok Voice Think Fast 2.0: 56,5%
  • Gemini 3.1 Flash Live: 37,7%
  • Gemini 3.8 Live (bản nền tảng): 30,1%

Điểm khiến tôi bất ngờ là điểm của bản nền tảng trên τ-Voice thấp hơn cả tiền nhiệm. Google nói rõ 3.8 Live được xây cho quy mô và hiệu quả chi phí hơn là quy trình phức tạp, nhưng việc chênh hơn 38 điểm giữa hai biến thể cho thấy lựa chọn tầng không còn là chuyện tinh chỉnh nhỏ. Nếu tác tử của bạn xâu chuỗi công cụ, bản nền tảng không phải mặc định đúng.

Extended Thinking hoàn thành 68,6% tác vụ τ-Voice, hơn gấp đôi bản nền tảng

Trên bảng τ³-Banking của Sierra, một điểm chuẩn dịch vụ khách hàng khó hơn xoay quanh quy trình ngân hàng, Extended Thinking đạt 35,1% so với 32,0% của GPT-Live-1 Astra, 16,5% của Grok Voice Think Fast 2.0 của SpaceXAI, 11,3% của Gemini 3.1 Flash Live, và 10,3% của GPT-Realtime 2. Mọi mô hình trên bảng đó đều thất bại phần lớn thời gian, cho thấy tác tử giọng nói còn xa mới có thể làm việc ngân hàng không giám sát, nhưng việc tăng gấp ba so với thế hệ Gemini trước là một bước tiến thực sự.

Chất lượng giọng nói và suy luận

Trên Speech to Speech Index, Extended Thinking cũng nhỉnh hơn đối thủ:

  • Gemini 3.8 Live Extended Thinking: 82,6
  • GPT-Live-1 Astra: 81,5
  • Grok Voice Think Fast 2.0: 81,3
  • Gemini 3.8 Live (bản nền tảng): 76,0
  • Gemini 3.1 Flash Live: 71,5

Hơn OpenAI 1,1 điểm vẫn là dẫn đầu, nhưng tôi sẽ không xây quyết định mua dựa trên con số này.

Về suy luận thuần trên đầu vào lời nói, Google báo cáo 97,7% trên Big Bench Audio cho Extended Thinking. Google cũng báo cáo cả hai mô hình đẩy đường biên Pareto trên EVA-Bench của ServiceNow cho tác tử giọng nói, cân bằng giữa độ chính xác và chất lượng hội thoại, dù lần chạy đó thực hiện trên Live API qua Gemini Enterprise Agent Platform chứ không phải API công khai.

Chi phí mỗi giờ âm thanh

Đây là biểu đồ Google muốn bạn thấy nhất. Trong bài kiểm tra chi phí của Artificial Analysis trên tập con Big Bench Audio, Gemini 3.8 Live xử lý một giờ âm thanh đầu vào với giá 0,84 USD.

Extended Thinking tốn 3,50 USD cho cùng một giờ, Grok Voice Think Fast 2.0 tốn 4,80 USD, và GPT-Live-1 Astra tốn 5,83 USD. Gemini 3.1 Flash Live ở mức 1,50 USD và 1,75 USD tùy mức suy nghĩ.

Đọc hai cột Gemini cùng nhau, chiến lược sản phẩm hiện ra rõ ràng. Bản nền tảng hạ giá tất cả đối thủ trên bảng với biên độ lớn, và bản suy luận ngang chất lượng với OpenAI vẫn rẻ hơn 40% mỗi giờ đầu vào. Lưu ý bản suy luận đốt nhiều token hơn ở mức suy nghĩ cao, đó là lý do nó đắt gấp khoảng 4 lần người anh em dù dùng chung bảng giá.

Nên chọn tầng nào?

Gemini 3.8 Live là mặc định đúng cho đa số tác tử giọng nói, và Extended Thinking chỉ đáng với mức đốt token cao hơn khi tác tử phải lập kế hoạch, so sánh, hoặc chờ công cụ chậm. Hướng dẫn của Google vạch ranh theo độ trễ công cụ: nếu hàm của bạn trả về trong mili-giây, hãy ở lại với bản nền tảng.

Bắt đầu với Gemini 3.8 Live và chuyển sang Extended Thinking khi công cụ mất vài giây

Hai biến thể dùng chung bảng giá (tôi sẽ trình bày bên dưới), giới hạn token 131.072 đầu vào và 65.536 đầu ra, và cùng endpoint WebSocket. Điều khác biệt là kiến trúc suy luận.

Gemini 3.8 Live dùng suy luận đan xen với hồ sơ độ trễ cố định và không có thiết lập thinking_level. Extended Thinking mở ra low, medium, và high cho suy luận nền, truyền các câu đệm hội thoại trong khi làm việc, và yêu cầu công cụ bất đồng bộ. Những mức suy nghĩ đó là điều khiển nỗ lực duy nhất trong bản phát hành.

Trường hợp sử dụng Lựa chọn Lý do
Phân loại yêu cầu CS, tìm kiếm bằng giọng, luyện ngôn ngữ Gemini 3.8 Live Luân phiên lượt nói tức thời quan trọng hơn chiều sâu, và mỗi lượt của người dùng nhận một phản hồi
Điều khiển thiết bị thông minh, đọc giá trị cảm biến Gemini 3.8 Live Công cụ trả về trong mili-giây, không có gì cần che lấp
Hỗ trợ kỹ thuật qua log, mã lỗi và kiểm tra cấu hình Extended Thinking Chẩn đoán nhiều bước cần suy luận nền giữa các phát ngôn
Đại lý du lịch và đặt chỗ truy vấn chuyến bay, khách sạn song song Extended Thinking Gọi bất đồng bộ song song với cập nhật tiến độ bằng lời thay vì im lặng
Dạy kèm STEM và mã Extended Thinking Mô hình kiểm tra công thức hoặc gỡ lỗi trước khi nói lời giải thích

Một cân nhắc nữa: độ phức tạp phía client. Chuyển sang Extended Thinking đồng nghĩa viết lại cách xử lý trạng thái quanh interaction_status, nên nếu bạn có app 3.1 Flash Live đang chạy ổn, bản nền tảng là nâng cấp lắp-vào-liền, còn bản suy luận là một chỉnh sửa nhỏ.

Giá và khả dụng của Gemini 3.8 Live

Cả hai mô hình dùng chung bảng giá Gemini 3.1 Flash Live Preview, nên nâng cấp là miễn phí. Ở gói trả phí, âm thanh đầu vào tính 3,00 USD mỗi 1 triệu token, Google ước tính khoảng 0,005 USD mỗi phút, và âm thanh đầu ra tính 12,00 USD mỗi 1 triệu token, khoảng 0,018 USD mỗi phút. Token suy nghĩ được tính theo mức đầu ra, đó là lý do chi phí chạy của Extended Thinking cao hơn.

Phương thức Tầng trả phí, mỗi 1M token Ước tính mỗi phút
Văn bản đầu vào $0.75 n/a
Âm thanh đầu vào $3.00 $0.005/phút
Hình ảnh và video đầu vào $1.00 $0.002/phút
Văn bản đầu ra $4.50 n/a
Âm thanh đầu ra (bao gồm token suy nghĩ) $12.00 $0.018/phút

Tầng miễn phí bao phủ cả hai mô hình không tính phí cho đầu vào và đầu ra, với điều kiện quen thuộc là Google dùng dữ liệu tầng miễn phí để cải thiện sản phẩm; dữ liệu tầng trả phí không dùng theo cách đó.

Neo vào Google Search được hỗ trợ trên cả hai tầng, với 5.000 yêu cầu tìm kiếm miễn phí mỗi tháng dùng chung cho tất cả mô hình Gemini 3.x và 14 USD mỗi 1.000 yêu cầu sau đó. Google chưa công bố hạn mức tốc độ riêng cho các mô hình này, vì vậy hãy kiểm tra trang hạn mức Gemini API cho tầng của bạn trước khi lên kế hoạch ra mắt.

Khả dụng chia làm ba nhóm:

  • Nhà phát triển: cả hai mô hình đã khả dụng rộng rãi trong Gemini API và Google AI Studio từ ngày 15/9.
  • Doanh nghiệp: cả hai đang ở giai đoạn thử nghiệm riêng trong Gemini Enterprise và sắp có trên Gemini Enterprise for Customer Experience, với Extended Thinking cũng sẽ có cho khách hàng doanh nghiệp Google Workspace.
  • Người dùng cuối: Gemini 3.8 Live cung cấp Search Live, còn Extended Thinking đang được tung ra cho Gemini Live, cho Docs dành cho thuê bao Google AI Pro và Ultra, và cho Gmail và Keep dành cho mọi thuê bao Google AI.

Mọi âm thanh đầu ra từ cả hai mô hình đều mang watermark SynthID, và thẻ mô hình của Google nêu rõ giới hạn: các mô hình vẫn có thể bịa đặt, khả năng chống jailbreak vẫn đang được cải thiện, và đôi khi có thể chậm hoặc time-out. Những lưu ý này đáng đọc trước khi bạn đưa mô hình nào ra trước khách hàng.

Làm sao để truy cập Gemini 3.8 Live?

ID mô hình là gemini-3.8-livegemini-3.8-live-extended-thinking, đều là chuỗi ổn định không có hậu tố preview.

Bạn có thể truy cập qua Gemini Live API với SDK google-genai cho Python hoặc JavaScript, qua WebSocket thuần, hoặc tương tác trong chế độ Stream của Google AI Studio.  Google cũng liệt kê Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel và Vision Agents là các đối tác tích hợp xử lý lớp truyền phát media, và có lộ trình truyền phát qua Agent Development Kit nếu bạn đã xây dựng trên ADK.

Phiên Python tối thiểu dưới đây mở kết nối, gửi một lượt văn bản, và bật bản chép lời đầu ra để bạn đọc những gì mô hình nói:

import asyncio
from google import genai

client = genai.Client()
config = {"response_modalities": ["AUDIO"], "output_audio_transcription": {}}

async def main():
    async with client.aio.live.connect(model="gemini-3.8-live", config=config) as session:
        await session.send_client_content(
            turns={"role": "user", "parts": [{"text": "Read back the claim number 7Q-4418-B."}]},
            turn_complete=True,
        )
        async for response in session.receive():
            if response.server_content and response.server_content.output_transcription:
                print(response.server_content.output_transcription.text)

asyncio.run(main())

Nếu bạn di trú từ gemini-3.1-flash-live-preview, hãy đổi chuỗi tên mô hình và xóa mọi thinking_level hoặc thinking_config khỏi thiết lập; vòng đời lượt còn lại là giống hệt. Live API mặc định là server-to-server, nên client trình duyệt và di động cần token tạm thời.

Để xem hướng dẫn đầy đủ về thu âm, phát lại và quản lý phiên, hãy xem hướng dẫn Gemini Live API của chúng tôi, và cho phía văn bản cùng họ, hướng dẫn Gemini 3.8 Flash API trình bày mức suy nghĩ và gọi hàm bằng Python.

Kết luận

Google đưa ra thông điệp về giá hơn là về chất lượng thuần. Extended Thinking dẫn trước GPT-Live-1 Astra một hai điểm trên mọi bảng, nhưng Gemini 3.8 Live với 0,84 USD mỗi giờ âm thanh đầu vào rẻ hơn gần 7 lần so với mô hình của OpenAI, và đó là con số quyết định nơi lưu lượng giọng nói sản xuất sẽ đi về.

Quan điểm của tôi: nếu bạn đang chạy bất cứ thứ gì trên Gemini 3.1 Flash Live, hãy nâng cấp trong tuần này, vì giá không đổi và riêng gọi công cụ bất đồng bộ đã đáng. Nếu bạn đang chạy stack realtime của OpenAI, bản nền tảng đáng để thử cho các luồng phân loại và tìm kiếm, và Extended Thinking đáng thử ở nơi công cụ của bạn mất vài giây. Điểm 30,1% của bản nền tảng trên τ-Voice là lý do không dùng nó cho công việc tác tử.

Nếu bạn muốn xây đúng phần gọi công cụ của một tác tử giọng nói, tôi khuyến nghị khóa học Xây dựng Tác tử AI với Google ADK của chúng tôi, khóa này kết nối Gemini vào một tác tử hỗ trợ khách hàng với công cụ, hàng rào an toàn và ủy quyền đa tác tử.

FAQs

Sự khác biệt giữa Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking là gì?

Gemini 3.8 Live là mô hình speech-to-speech độ trễ thấp của Google cho các tác vụ giọng nói trực tiếp, với suy luận đan xen và không có thiết lập mức suy nghĩ. Gemini 3.8 Live Extended Thinking bổ sung suy luận nền có thể cấu hình (thấp, trung bình, cao) và thông báo tiến độ trong khi chạy công cụ bất đồng bộ. Extended Thinking đạt 68,6% trên τ-Voice so với 30,1% của bản nền tảng, nên hãy chọn nó cho công việc tác tử nhiều bước.

Gemini 3.8 Live có giá bao nhiêu?

Cả hai mô hình dùng chung một bảng giá ở tầng trả phí: 3,00 USD mỗi 1 triệu token âm thanh đầu vào (khoảng 0,005 USD mỗi phút) và 12,00 USD mỗi 1 triệu token âm thanh đầu ra bao gồm token suy nghĩ (khoảng 0,018 USD mỗi phút). Văn bản có giá 0,75 USD mỗi 1 triệu token đầu vào và 4,50 USD mỗi 1 triệu token đầu ra. Tầng miễn phí bao phủ cả hai mô hình, với dữ liệu tầng miễn phí được dùng để cải thiện sản phẩm của Google.

Tôi có thể truy cập Gemini 3.8 Live ở đâu?

Nhà phát triển có thể dùng gemini-3.8-livegemini-3.8-live-extended-thinking qua Gemini Live API và trong Google AI Studio, nơi cả hai đã khả dụng rộng rãi. Doanh nghiệp nhận được ở giai đoạn thử nghiệm riêng trong Gemini Enterprise. Người dùng cuối gặp Gemini 3.8 Live trong Search Live và Extended Thinking trong Gemini Live, cùng với Docs, Gmail và Keep cho thuê bao Google AI.

Gemini 3.8 Live so với Gemini 3.1 Flash Live như thế nào?

Có. Gemini 3.8 Live thay thế bản xem trước 3.1 Flash Live với cùng mức giá, bật mặc định gọi hàm bất đồng bộ và có điểm số cao hơn trên các biểu đồ của Google: 76,0 so với 71,5 trên Speech to Speech Index của Artificial Analysis. Di trú nghĩa là đổi chuỗi tên mô hình và bỏ mọi thinking_level hoặc thinking_config khỏi thiết lập phiên. Google khuyến nghị tất cả người dùng 3.1 Flash Live chuyển sang 3.8 Live.

Gemini 3.8 Live có hỗ trợ gọi hàm và đầu vào video không?

Có. Cả hai mô hình hỗ trợ gọi hàm, và lời gọi công cụ chạy ở chế độ nền trong khi mô hình tiếp tục nói. Gemini 3.8 Live cũng chấp nhận khung hình video và hình ảnh cùng với âm thanh và văn bản, để tác tử có thể phản hồi những gì người dùng đang nhìn. Phiên âm thanh kèm video bị giới hạn 2 phút và phiên chỉ âm thanh 15 phút trừ khi bạn dùng quản lý phiên để kéo dài.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.

Chủ đề
AI Agents
Trí tuệ Nhân tạo

Học Agentic AI cùng DataCamp!

Courses

Xây dựng AI Agent với Google ADK

1 giờ
7.5K
Xây dựng trợ lý hỗ trợ khách hàng từng bước với Agent Development Kit (ADK) của Google.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow