Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями
У голосового ассистента обычно есть неприятная развилка: либо он поддерживает разговор, либо уходит выполнять действие и замолкает. Google пытается убрать её в Gemini 3.8 Live. Новая линейка должна продолжать диалог, пока в фоне идут вызовы инструментов и API.
Компания представила две версии — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая рассчитана на естественный быстрый разговор; вторая — на задачи, где требуется больше многошагового рассуждения. Google заявляет, что модели уже можно использовать через Gemini API, приложение Gemini, Google Workspace и Search.
Не только голос, но и контекст
По описанию Google, Gemini 3.8 Live принимает визуальный контекст почти в реальном времени. Это полезно для сценариев, где человек показывает камеру, экран или объект и ждёт не расшифровку команды, а ответ по ситуации. Модель также, по заявлению компании, умеет автоматически распознавать и менять 97 языков в ходе одного разговора.
Главная практическая деталь — фоновое выполнение действий. Ассистент может подтвердить запрос, продолжить беседу и параллельно обратиться к внешнему инструменту. Для разработчиков это означает, что голосовой интерфейс не обязан превращаться в длинную паузу после каждого запроса к API.
Google приводит примеры для рабочих голосовых агентов: консультаций, интерфейсов с потоковым аудио и задач с визуальным вводом. Компания также называет партнёров среди платформ для таких приложений, включая Agora, LiveKit, Pipecat и Vercel.

Кадр: официальная демонстрация Google.
Ограничение — не путать демонстрацию с гарантией
Google приводит собственные бенчмарки и оценки пользователей, но это не независимое сравнение всех голосовых моделей. Для продукта важнее проверить задержку, качество распознавания конкретных языков, стоимость цепочки вызовов и то, какие действия разрешено отдавать в фон.
Однако сама модель взаимодействия заметна: голосовой ИИ всё больше становится не диктовкой для чат-бота, а интерфейсом к агенту. Если фоновая работа действительно не ломает разговор, разработчики смогут проектировать сценарии, где помощник не исчезает именно в тот момент, когда начал что-то делать.













