Course
Голос — тема месяца. В индексе Speech to Speech от Artificial Analysis модели OpenAI GPT-Live-1 Astra и SpaceXAI Grok Voice Think Fast 2.0 шли с разницей в 0,2 пункта на вершине, а OpenAI выпустила GPT-6 Astra в начале сентября. 15 сентября Google ответила двумя новыми моделями голос-голос: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.
Extended Thinking заняла первое место в этом индексе с оценкой 82,6 и лидирует в агентном бенчмарке τ-Voice с результатом 68,6%. Базовая 3.8 Live — дешёвая: в тесте стоимости Artificial Analysis она обрабатывает час входящего аудио за $0,84 — это минимум среди всех моделей, которые Google указала в диаграмме. Обе уже доступны в Gemini API по цене их предшественницы, Gemini 3.1 Flash Live.
В этой статье рассмотрим всё новое в Gemini 3.8 Live: возможности, бенчмарки, различия между двумя вариантами и стоимость эксплуатации. Также у нас есть руководства по быстрому старту с Gemini Live API и созданию голосового ассистента на GPT-Live-1.
Кратко
- Gemini 3.8 Live и 3.8 Live Extended Thinking — новые модели Google для голосовых агентов с режимом голос-голос, пришедшие на смену Gemini 3.1 Flash Live.
- Extended Thinking рассуждает и вызывает инструменты в фоне, продолжая говорить, и сейчас возглавляет рейтинги Speech to Speech и τ-Voice от Artificial Analysis.
- Базовая модель быстрая и недорогая, но слаба в многошаговой агентной работе, поэтому выбирайте Extended Thinking, как только инструменты отвечают дольше мгновения.
- Цены не изменились относительно прошлого поколения, так что миграция ничего дополнительно не стоит кроме замены строки модели.
- Если вы на Gemini 3.1 Flash Live — обновляйтесь. Если вы на realtime-стеке OpenAI, одного лишь ценового разрыва достаточно, чтобы уделить тесту один день.
Что такое Gemini 3.8 Live?
Gemini 3.8 Live — нативная модель Google для голос-голос в реальном времени для голосовых агентов, выпущенная 15 сентября 2026 года вместе с версией с усиленным рассуждением, Gemini 3.8 Live Extended Thinking. Обе работают через Gemini Live API по WebSocket-соединению, принимают аудио, видео, изображения и текст, а возвращают аудио. Google позиционирует 3.8 Live как вариант по умолчанию для диалогов с низкой задержкой, а Extended Thinking — как выбор для сложных, многошаговых задач.
Поколенческое изменение относительно Gemini 3.1 Flash Live — в том, как модель обрабатывает «неговорящую» работу. Вызовы инструментов и API теперь по умолчанию выполняются в фоне, пока модель продолжает диалог, а Extended Thinking добавляет настраиваемое фоновое рассуждение. Google описывает эту пару как скачок по сравнению с предыдущими live-моделями и как замену каскадных конвейеров, где связаны распознавание речи, LLM и синтез речи.
Ключевые возможности Gemini 3.8 Live
Google выделяет пять способностей новых моделей, и важнее всего для разработчиков голосовых агентов — две, меняющие цикл диалога: асинхронные вызовы инструментов и фоновое рассуждение.
Продолжайте говорить, пока инструменты работают
Обе модели выполняют вызовы функций и запросы к API в фоне, одновременно стримя аудио пользователю. В Gemini 3.8 Live асинхронное выполнение стало режимом вызова функций по умолчанию. Можно по-прежнему принудительно включить старое синхронное поведение, указав behavior: BLOCKING в объявлении инструмента; модель поддерживает планирование функций с опциями SILENT, WHEN_IDLE и INTERRUPTED, которые решают, когда озвучивать результат.
Extended Thinking идёт дальше: она требует неблокирующие инструменты и вернёт жёсткую ошибку, если объявлен блокирующий. На практике это означает, что абонент, попросив изменить бронирование, сразу слышит подтверждение, затем — обновление прогресса, затем — результат, а не тишину, как в каскадном конвейере, пока тот ждёт ответа API. В Gemini 3.1 Flash Live вызовы функций были только последовательными, и модель не начинала отвечать, пока вы не возвращали результат инструмента.
Думать в фоне, не замолкая
Gemini 3.8 Live Extended Thinking может рассуждать и говорить одновременно. В документации Google описывает использование ранних вербальных сигналов вроде «Секунду, проверю», чтобы подтвердить запрос, а затем — озвучивание прогресса по мере завершения многошаговой фоновой работы. Глубина управляется параметром thinking_level со значениями low, medium или high; уровень MINIMAL, который был в 3.1 Flash Live, убран.
Это меняет протокол, и это, пожалуй, важнейшая деталь миграции в релизе. Поскольку модель может говорить несколько раз в рамках одного запроса, turnComplete: true больше не означает, что она бездействует.
Клиенту нужно отслеживать новое поле interaction_status, которое сообщает IN_PROGRESS, пока идёт рассуждение или работают инструменты, и IDLE, когда задача полностью завершена. Если этого не делать, ваш интерфейс вернётся в режим «прослушивания», хотя модель ещё занята.
Видеть то, что видит пользователь
Gemini 3.8 Live привязывает диалог к живому визуальному вводу, обрабатывая видеокадры почти в реальном времени, чтобы агент реагировал не только на то, что говорит пользователь, но и на то, что он видит. В демо Google — живая партия в шахматы и онбординг сотрудника, где модель отвечает на вопросы о том, что на экране.
Но видео не бесплатное. По умолчанию за один ход теперь отправляются аудиоактивность и все видеокадры, поэтому если вашему приложению не нужна зрительная часть, отправляйте кадры только при необходимости — и ради контекстного бюджета, и ради стоимости. Сессии аудио+видео также ограничены 2 минутами, после чего нужна поддержка продления, тогда как чисто аудио сессии — 15 минутами.
Правильно распознавать коды подтверждения и номера заявок
Google называет это «алфанумерической точностью»: корректный разбор строк вроде кодов подтверждения, номеров заявок и технических идентификаторов, продиктованных вслух. Любой, кто строил голосового агента для поддержки или логистики, знает, что на каскадных стэках всё ломается именно здесь: ошибка распознавания речи в начале цепочки необратима далее. Нативная голосовая модель, слышащая всё высказывание в контексте, имеет здесь структурное преимущество.
Переключение языков посреди фразы
Gemini 3.8 Live распознаёт и переключается между 97 поддерживаемыми языками в ходе разговора, сохраняя, как говорит Google, стабильность акцента. Обе модели также поддерживают так называемые инкрементальные обновления контента: вы можете отправлять структурированные данные в сессию в любой момент с явной ролью user или model, и модель сольёт их с живым аудио. Так вы подмешиваете карточку клиента или статус заказа в текущий звонок, не сбивая поток.
Два небольших изменения затрагивают существующий код. Proactive audio — когда модель решает не отвечать на речь, не адресованную ей, — теперь всегда включён, и попытка установить false вернёт ошибку. Affective dialogue полностью удалён из API, так что любую конфигурацию enable_affective_dialog нужно убрать.
Как Gemini 3.8 Live показывает себя в бенчмарках?
Extended Thinking лидирует на всех качественных и агентных досках, опубликованных Google, но с небольшим отрывом от OpenAI GPT-Live-1 Astra, тогда как базовая 3.8 Live выигрывает по стоимости с большим запасом, но проигрывает в агентных задачах.
Индекс, τ-Voice, Big Bench Audio и стоимость ниже — из публичного лидерборда Artificial Analysis, то есть измерены независимо, а не заявлены вендором. Показатели τ³-Banking взяты из стартовой диаграммы Google со ссылкой на Sierra, так что до появления этих же данных у Sierra считайте строку вендорской.
Выполнение агентных задач
Gemini 3.8 Live Extended Thinking лидирует в τ-Voice — бенчмарке Sierra на способность голосового агента выполнять многошаговые задачи с инструментами, по измерениям Artificial Analysis. GPT-Live-1 Astra идёт рядом, остальные отстают:
- Gemini 3.8 Live Extended Thinking: 68,6%
- GPT-Live-1 Astra: 67,9%
- Grok Voice Think Fast 2.0: 56,5%
- Gemini 3.1 Flash Live: 37,7%
- Gemini 3.8 Live (базовая версия): 30,1%
Удивляет то, что балл базовой модели в τ-Voice ниже, чем у её предшественницы. Google прямо говорит, что 3.8 Live создана для масштаба и эффективности по стоимости, а не для сложных процессов, но разрыв более чем в 38 пунктов между вариантами означает, что выбор уровня — это не нюанс. Если ваш агент связывает инструменты в цепочку, базовая модель — неверный вариант по умолчанию.

В таблице Sierra τ³-Banking — более сложном бенчмарке клиентского сервиса вокруг банковских процессов — Extended Thinking набирает 35,1% против 32,0% у GPT-Live-1 Astra, 16,5% у SpaceXAI Grok Voice Think Fast 2.0, 11,3% у Gemini 3.1 Flash Live и 10,3% у GPT-Realtime 2. Все модели в этом списке чаще проваливаются, чем проходят, что показывает, как далеко голосовым агентам до несупервизируемой банковской работы, но трёхкратный рост относительно предыдущего поколения Gemini — это реальный шаг.
Качество речи и рассуждение
В Speech to Speech Index Extended Thinking тоже на полкорпуса впереди конкурентов:
- Gemini 3.8 Live Extended Thinking: 82,6
- GPT-Live-1 Astra: 81,5
- Grok Voice Think Fast 2.0: 81,3
- Gemini 3.8 Live (базовая версия): 76,0
- Gemini 3.1 Flash Live: 71,5
Отрыв в 1,1 пункта от OpenAI — это отрыв, но основывать на нём закупочное решение я бы не стал.
Для чистого рассуждения над устным вводом Google сообщает 97,7% на Big Bench Audio для Extended Thinking. Также сообщается, что обе модели сдвигают границу Парето на EVA-Bench от ServiceNow для голосовых агентов, балансируя точность и качество диалога, хотя этот прогон выполнялся по Live API через Gemini Enterprise Agent Platform, а не публичный API.
Стоимость за час аудио
Это диаграмма, которую Google хочет показать в первую очередь. В тесте стоимости Artificial Analysis на подмножестве Big Bench Audio Gemini 3.8 Live обрабатывает час входящего аудио за $0,84.
Extended Thinking стоит $3,50 за тот же час, Grok Voice Think Fast 2.0 — $4,80, а GPT-Live-1 Astra — $5,83. Gemini 3.1 Flash Live стоила $1,50 и $1,75 в зависимости от уровня рассуждения.
Если смотреть на две полосы Gemini вместе, стратегия продукта очевидна. Базовая модель существенно дешевле всех на диаграмме, а модель с рассуждением, сопоставимая с OpenAI по качеству, всё ещё обходится на 40% дешевле за час входного аудио. Учтите, что модель с рассуждением сжигает больше токенов на высоких уровнях thinking, поэтому она стоит примерно в 4 раза дороже своей «сестры», несмотря на общую таблицу цен.
Какой уровень выбрать?
Gemini 3.8 Live — правильный выбор по умолчанию для большинства голосовых агентов, а Extended Thinking оправдывает повышенное потребление токенов только там, где агенту нужно планировать, сравнивать или ждать медленные инструменты. Рекомендации Google проводят границу по задержке инструментов: если функции возвращают ответ за миллисекунды, оставайтесь на базовой модели.

Обе версии имеют общую таблицу цен (см. ниже), лимиты токенов 131 072 на вход и 65 536 на выход, и один и тот же WebSocket-эндпоинт. Отличаются они архитектурой рассуждения.
Gemini 3.8 Live использует чередующееся рассуждение с фиксированным профилем задержки и без параметра thinking_level. Extended Thinking даёт low, medium и high фоновое рассуждение, стримит разговорные «заполнители», пока работает, и требует асинхронные инструменты. Эти уровни thinking — единственный рычаг управления затратами в релизе.
| Сценарий | Выбор | Почему |
|---|---|---|
| Триаж в поддержке, голосовой поиск, языковая практика | Gemini 3.8 Live | Моментальная смена реплик важнее глубины, и на ход пользователя приходится один ответ |
| Управление умными устройствами, чтение датчиков | Gemini 3.8 Live | Инструменты отвечают за миллисекунды, нечего маскировать |
| Техподдержка: логи, коды ошибок, проверка конфигураций | Extended Thinking | Многошаговая диагностика требует фонового рассуждения между репликами |
| Путешествия и бронирования с параллельными запросами к рейсам и отелям | Extended Thinking | Параллельные асинхронные вызовы с озвучиванием прогресса вместо тишины |
| STEM и обучение программированию | Extended Thinking | Модель проверяет формулы или отлаживает код до того, как объяснять |
Ещё одно соображение: сложность клиента. Переход на Extended Thinking требует переписать управление состояниями вокруг interaction_status, поэтому если у вас работает приложение на 3.1 Flash Live, базовая модель — «втыкаемое» обновление, а модель с рассуждением — небольшой рефакторинг.
Цены и доступность Gemini 3.8 Live
Обе модели используют таблицу цен Gemini 3.1 Flash Live Preview, так что обновление бесплатное. В платном тарифе входящее аудио стоит $3,00 за 1 млн токенов (по оценке Google — $0,005 в минуту), а исходящее аудио — $12,00 за 1 млн токенов (около $0,018 в минуту). Токены «thinking» тарифицируются по ставке исходящих токенов — отсюда более высокая стоимость Extended Thinking при работе.
| Модальность | Платный тариф, за 1 млн токенов | Оценка за минуту |
|---|---|---|
| Текст на вход | $0,75 | n/a |
| Аудио на вход | $3,00 | $0,005/мин |
| Изображения и видео на вход | $1,00 | $0,002/мин |
| Текст на выход | $4,50 | n/a |
| Аудио на выход (включая thinking-токены) | $12,00 | $0,018/мин |
Бесплатный тариф покрывает обе модели без оплаты за вход и выход, с обычной оговоркой: данные бесплатного тарифа используются Google для улучшения продуктов; данные платного тарифа так не используются.
Граундирование через Google Search поддерживается на обоих тарифах: 5 000 бесплатных поисковых запросов в месяц на все модели Gemini 3.x и затем $14 за 1 000 запросов. Отдельные лимиты частоты для этих моделей Google не опубликовала, поэтому перед запуском проверьте страницу лимитов Gemini API для вашего тарифа.
Доступность разделена на три направления:
- Разработчики: обе модели общедоступны в Gemini API и Google AI Studio с 15 сентября.
- Корпоративные клиенты: обе в приватном превью в Gemini Enterprise и скоро в Gemini Enterprise for Customer Experience; Extended Thinking также появится у бизнес-пользователей Google Workspace.
- Потребители: Gemini 3.8 Live лежит в основе Search Live, а Extended Thinking разворачивается в Gemini Live, в Docs для подписчиков Google AI Pro и Ultra, а также в Gmail и Keep для всех подписчиков Google AI.
Каждый аудиоответ обеих моделей помечен водяным знаком SynthID, и паспорт модели от Google честно говорит об ограничениях: модели всё ещё могут галлюцинировать, устойчивость к джейлбрейкам продолжает улучшаться, могут случаться задержки или таймауты. Эти оговорки стоит прочитать до вывода модели к клиентам.
Как получить доступ к Gemini 3.8 Live?
ID моделей — gemini-3.8-live и gemini-3.8-live-extended-thinking, обе — стабильные строки без суффикса preview.
Доступ — через Gemini Live API с SDK google-genai для Python или JavaScript, через «сырые» WebSocket-ы или интерактивно в режиме Stream Google AI Studio. Google также указывает Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel и Vision Agents как партнёров интеграции, которые берут на себя слой медиастриминга, а для тех, кто уже на ADK, есть поток через Agent Development Kit.
Минимальная Python-сессия ниже открывает соединение, отправляет текстовый ход и включает транскрипт вывода, чтобы вы могли прочитать, что сказала модель:
import asyncio
from google import genai
client = genai.Client()
config = {"response_modalities": ["AUDIO"], "output_audio_transcription": {}}
async def main():
async with client.aio.live.connect(model="gemini-3.8-live", config=config) as session:
await session.send_client_content(
turns={"role": "user", "parts": [{"text": "Read back the claim number 7Q-4418-B."}]},
turn_complete=True,
)
async for response in session.receive():
if response.server_content and response.server_content.output_transcription:
print(response.server_content.output_transcription.text)
asyncio.run(main())
Если вы мигрируете с gemini-3.1-flash-live-preview, замените строку модели и удалите любые thinking_level или thinking_config из настройки; жизненный цикл хода в остальном идентичен. Live API по умолчанию сервер-сервер, так что браузерным и мобильным клиентам нужны эфемерные токены.
Полный разбор записи аудио, воспроизведения и управления сессиями — в нашем руководстве по Gemini Live API, а текстовую сторону того же семейства покрывает руководство по Gemini 3.8 Flash API с уровнями thinking и вызовом функций в Python.
Итоги
Google делает ставку на цену, а не на «голое» качество. Преимущество Extended Thinking над GPT-Live-1 Astra — один-два пункта в каждом рейтинге, но Gemini 3.8 Live с $0,84 за час входного аудио дешевле модели OpenAI почти в 7 раз — и именно это решает, куда пойдёт продакшн-трафик.
Моё мнение: если вы используете Gemini 3.1 Flash Live, обновляйтесь на этой неделе — цена та же, а один только асинхронный вызов инструментов того стоит. Если вы на realtime-стеке OpenAI, базовая модель стоит испытания для триажа и поиска, а Extended Thinking — там, где ваши инструменты отвечают секундами. Показатель 30,1% у базовой модели в τ-Voice — причина не брать её для агентных задач.
Если хотите правильно построить инструментальную часть голосового агента, рекомендуем наш курс Building AI Agents with Google ADK, где Gemini подключается к агенту поддержки с инструментами, ограждениями и делегированием.
FAQs
В чём разница между Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking?
Gemini 3.8 Live — это низкозадержечная модель голос-голос от Google для прямых голосовых задач, с чередующимся рассуждением и без настройки уровня thinking. Gemini 3.8 Live Extended Thinking добавляет настраиваемое фоновое рассуждение (низкое, среднее или высокое) и озвучивает прогресс, пока запускает асинхронные инструменты. Extended Thinking даёт 68,6% в τ-Voice против 30,1% у базовой, так что выбирайте её для многошаговой агентной работы.
Сколько стоит Gemini 3.8 Live?
Обе модели делят одну таблицу цен на платном тарифе: $3,00 за 1 млн токенов входящего аудио (около $0,005 за минуту) и $12,00 за 1 млн токенов исходящего аудио, включая thinking-токены (около $0,018 за минуту). Текст стоит $0,75 за 1 млн входящих токенов и $4,50 за 1 млн исходящих. Бесплатный тариф покрывает обе модели, причём данные бесплатного тарифа используются для улучшения продуктов Google.
Где можно получить доступ к Gemini 3.8 Live?
Разработчики могут использовать gemini-3.8-live и gemini-3.8-live-extended-thinking через Gemini Live API и в Google AI Studio — обе модели общедоступны. Корпоративным клиентам они доступны в приватном превью в Gemini Enterprise. Потребители встречают Gemini 3.8 Live в Search Live, а Extended Thinking — в Gemini Live, а также в Docs, Gmail и Keep для подписчиков Google AI.
Как Gemini 3.8 Live сравнивается с Gemini 3.1 Flash Live?
Gemini 3.8 Live заменяет превью 3.1 Flash Live по той же цене, с асинхронным вызовом функций по умолчанию и более высокими показателями в таблицах Google: 76,0 против 71,5 в Speech to Speech Index от Artificial Analysis. Для миграции смените строку модели и уберите любые thinking_level или thinking_config из настройки сессии. Google рекомендует всем пользователям 3.1 Flash Live перейти на 3.8 Live.
Поддерживает ли Gemini 3.8 Live вызов функций и видеоввод?
Да. Обе модели поддерживают вызов функций, и вызовы инструментов работают в фоне, пока модель продолжает говорить. Gemini 3.8 Live также принимает видеокадры и изображения вместе с аудио и текстом, чтобы агент мог реагировать на то, что видит пользователь. Сессии аудио+видео ограничены 2 минутами, а чисто аудио — 15 минутами, если не используете управление сессиями для продления.