15 сентября 2026 года Google в посте Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking открыла две live-модели для голоса: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Если у вас голосовой бот, Live-сессия в приложении или ключ Gemini API, это смена id в Live API и другой жизненный цикл сессии, а не очередной текстовый Flash в чате.
Авторы поста, Tom Ouyang и Malini Jaganathan из Gemini Audio Team, делят линейку по задаче. 3.8 Live собирают под масштаб и цену: быстрый диалог, визуальный контекст, без паузы на «подумать». Extended Thinking – под сложные многошаговые сценарии, когда модель должна рассуждать и говорить одновременно. Оба id уже в Gemini Live API и в Google AI Studio.
gemini-3.8-live и gemini-3.8-live-extended-thinking
В карточках API это не одно имя с суффиксом. Стабильные строки: gemini-3.8-live и gemini-3.8-live-extended-thinking. Документация прямо пишет, что 3.8 Live – дефолт для low-latency голосового агента, без задержки на reasoning. Extended Thinking – audio-to-audio с фоновым рассуждением и асинхронными tool call, пока в наушник всё ещё идёт речь.
gemini-3.8-live gemini-3.8-live-extended-thinking
Оба принимают текст, картинку, аудио и видео. Отдают текст и аудио. Лимиты в карточках одинаковые: вход 131 072 токена, выход 65 536. В model card Gemini 3.8 Audio то же окно формулируют как 128K на вход и 64K на выход; для кода смотрите карточку API, не абзац карточки модели. Обе модели опираются на Gemini 3 Pro. Knowledge cutoff в карточке: январь 2025.
Что включено: генерация аудио, function calling, Live API, Search grounding, thinking. Что выключено у обеих: caching, code execution, file search, grounding по Google Maps, генерация картинок, structured outputs, URL context, Batch API. Для Extended Thinking function calling только асинхронный. Цены за минуту и за токен Google в этом посте не публикует, только «competitive» на фоне чужих frontier-моделей. Весов и self-host нет.
97 языков, картинка в сессии и вызов в фоне
3.8 Live обрабатывает визуальный вход почти в реальном времени и сама переключает язык: в посте 97 поддерживаемых языков, смена посреди разговора. Инструменты и API-вызовы уходят в фон, модель может подтвердить запрос и продолжить болтать, пока задача ещё крутится. В демо Google показывает онбординг сотрудника по картинке с камеры, шахматы с визуальным контекстом, набросок в React-компоненты голосом и многошаговое бронирование без паузы «подождите, сейчас вызову функцию».
Extended Thinking в том же посте держит речь, пока думает. Ранние реплики вроде «Let me check that…» и живой рассказ, на каком шаге фоновая задача. На бумаге Google ставит его на первое место Artificial Analysis Speech to Speech Quality Index с 82.6, 68.6% на τ-Voice, 35.1% на Sierra τ-Voice-banking и 97.7% на Big Bench Audio. 3.8 Live – второе место в Speech Agent Arena. Это их таблица, не ваш p95 на боте. На EVA-Bench от ServiceNow обе модели крутили через Live API на Gemini Enterprise Agent Platform.
Если мигрируете с gemini-3.1-flash-live-preview, карточка 3.8 Live просит просто сменить строку модели на gemini-3.8-live. thinking_level у этой модели нет: параметр из setup надо убрать, иначе это уже не тот контракт. Асинхронные вызовы (behavior: NON_BLOCKING) теперь дефолт, синхронный BLOCKING ещё можно оставить для совместимости. Proactive audio включён навсегда: proactive_audio: false вернёт ошибку. Affective dialogue из API сняли, enable_affective_dialog больше не жилец. По умолчанию в ход идут и аудио, и видеокадры (TURN_INCLUDES_AUDIO_ACTIVITY_AND_ALL_VIDEO): кадры лучше слать только когда они нужны, иначе контекст и счёт раздуются зря.
thinking_level, turnComplete и interaction_status
Вот здесь две модели расходятся так, что клиент, написанный под старый Live, начнёт врать про «модель уже молчит». У Extended Thinking turnComplete: true больше не значит, что сервер idle. Он может дальше крутить фоновое reasoning или ждать ответ tool. Клиент обязан слушать следующие сообщения: tool call, аудиофреймы, статусы. Смотреть нужно поле interaction_status: IN_PROGRESS – ещё думает, вызывает инструменты или обрабатывает вход; IDLE – всё докрутил, ждёт человека.
Function calling у Extended Thinking только NON_BLOCKING. Синхронный режим даёт жёсткую ошибку, scheduling конфигурации не поддерживаются. Фоновое reasoning настраивается через thinking_config: thinking_level равен low, medium или high. MINIMAL нет. send_client_content можно слать всю сессию, роли user или model. turn_complete=true сразу рвёт текущую генерацию. Proactive audio, как и у соседней модели, выключить нельзя.
На практике это ломает наивный цикл «дождался turnComplete – закрыл сокет / показал спиннер / пошёл в следующий шаг». Голосовой бот на сайте или в телефоне, который по старому флагу считал ход законченным, начнёт перебивать модель посреди tool call. Сначала меняете id, потом проверяете, что клиент живёт на interaction_status, а не на одном boolean. В прод с новым протоколом я бы не скакал в тот же вечер: сначала Studio, потом стейджинг, и только потом ключ, которым говорят клиенты.
Search Live, Workspace и Gemini Enterprise
Раскатка с сегодняшнего дня, но контуры разные. 3.8 Live: Gemini API и AI Studio для разработчиков, private preview в Gemini Enterprise, позже Gemini Enterprise for Customer Experience, для всех – Search Live. Extended Thinking: те же API и Studio, тот же private preview в Enterprise, позже ещё Workspace для бизнес-клиентов. В потребительских продуктах Extended Thinking обещают в Gemini Live; подписчикам Google AI Pro и Ultra – в Docs; всем подписчикам Google AI – в Gmail и Keep.
Платформы вроде LiveKit, Pipecat, LangChain, Vercel AI Gateway, Agora уже торчат как готовые трубы под Live API. Это не новые пакеты в apt и не плагин WordPress: ваш голосовой контур либо уже сидит на одной из этих шин, либо вам всё равно придётся писать WebSocket-клиент Live API. Доступ из России в посте не описан, гадать не буду.
Аудио с этих моделей Google помечает SynthID: водяной знак встроен в сам звук, без отдельной плашки в плеере. Для голосового бота на сайте это значит, что сгенерированная речь технически детектируема, но пользователь этого не увидит, пока вы сами не решите писать в UI, что говорит модель. Ограничения в карточке обычные для фундамент-модели: галлюцинации, иногда тормоза и таймауты, плюс обещание подкручивать jailbreak-защиты. Frontier Safety для этой линейки Google выводит из оценки Gemini 3.7 Flash: отдельных новых Tracked/Critical Capability Levels они за 3.8 Audio не ставят.
Если коротко для человека с ключом: два новых id в Live API уже можно тыкать в Studio. 3.8 Live – быстрый голос без thinking_level. Extended Thinking – тот же Live, но клиент обязан переехать на interaction_status и только async-инструменты. Сайт на WordPress от этого не заговорит сам, а голосовой агент, который вы уже держите на Gemini, получит другой контракт сессии. Цену смотрите в биллинге API, не в баннере The Keyword.