Google выпустила голосовые модели Gemini 3.8 Live и Live Extended Thinking

Google открыла разработчикам две модели для голосовых агентов реального времени через Gemini API и Google AI Studio. Gemini 3.8 Live ориентирована на низкую задержку, а версия Extended Thinking выполняет многоэтапные рассуждения и вызовы внешних инструментов параллельно с голосовым диалогом.

Google представила модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для создания голосовых агентов. Они принимают аудио, текст, изображения и видео, а результат могут выдавать в виде речи или текста. Контекстное окно составляет 131 072 входных токена, максимальный объём вывода — 65 536 токенов.

Gemini 3.8 Live поддерживает 97 языков и может переключаться между ними во время разговора. Модель способна обрабатывать визуальные данные и асинхронно вызывать API и другие инструменты, не прерывая общение с пользователем.

Gemini 3.8 Live Extended Thinking предназначена для сложных многоэтапных задач: фоновое рассуждение и обращения к инструментам продолжаются одновременно с передачей голосового ответа. Разработчикам необходимо учитывать, что сигнал завершения реплики больше не обязательно означает окончание обработки — после него сервер может отправлять дополнительные аудиоданные или запросы к инструментам.

Обе модели основаны на Gemini 3 Pro. По оценке Artificial Analysis, которую приводит Google, Extended Thinking получила 82,6 балла и заняла первое место в Speech-to-Speech Quality Index. С 15 сентября 2026 года модели доступны разработчикам через Gemini API и Google AI Studio; корпоративным заказчикам они предлагаются в режиме закрытого предварительного тестирования. Сгенерированное моделями аудио маркируется водяным знаком SynthID.

Источник: blog.google

Связь с редакцией