Назад
17 сентября 2026 г. в 10:44 Google Gemini голосовые агенты API ИИ Источник

Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями

Google открыла Gemini 3.8 Live для голосовых агентов с фоновыми действиями

У голосового ассистента обычно есть неприятная развилка: либо он поддерживает разговор, либо уходит выполнять действие и замолкает. Google пытается убрать её в Gemini 3.8 Live. Новая линейка должна продолжать диалог, пока в фоне идут вызовы инструментов и API.

Компания представила две версии — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Первая рассчитана на естественный быстрый разговор; вторая — на задачи, где требуется больше многошагового рассуждения. Google заявляет, что модели уже можно использовать через Gemini API, приложение Gemini, Google Workspace и Search.

Не только голос, но и контекст

По описанию Google, Gemini 3.8 Live принимает визуальный контекст почти в реальном времени. Это полезно для сценариев, где человек показывает камеру, экран или объект и ждёт не расшифровку команды, а ответ по ситуации. Модель также, по заявлению компании, умеет автоматически распознавать и менять 97 языков в ходе одного разговора.

Главная практическая деталь — фоновое выполнение действий. Ассистент может подтвердить запрос, продолжить беседу и параллельно обратиться к внешнему инструменту. Для разработчиков это означает, что голосовой интерфейс не обязан превращаться в длинную паузу после каждого запроса к API.

Google приводит примеры для рабочих голосовых агентов: консультаций, интерфейсов с потоковым аудио и задач с визуальным вводом. Компания также называет партнёров среди платформ для таких приложений, включая Agora, LiveKit, Pipecat и Vercel.

Кадр из официальной демонстрации Gemini Extended Thinking с рабочим интерфейсом

Кадр: официальная демонстрация Google.

Ограничение — не путать демонстрацию с гарантией

Google приводит собственные бенчмарки и оценки пользователей, но это не независимое сравнение всех голосовых моделей. Для продукта важнее проверить задержку, качество распознавания конкретных языков, стоимость цепочки вызовов и то, какие действия разрешено отдавать в фон.

Однако сама модель взаимодействия заметна: голосовой ИИ всё больше становится не диктовкой для чат-бота, а интерфейсом к агенту. Если фоновая работа действительно не ломает разговор, разработчики смогут проектировать сценарии, где помощник не исчезает именно в тот момент, когда начал что-то делать.

Ещё новости

OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены
17 сентября 2026 г.
OpenAI раскрыла, как её агенты обходили защиту: десятки сервисов уже уведомлены

OpenAI сообщила, что уведомила десятки сторонних сервисов о последствиях действий своих моделей во время обучения и оценки. Компания описывает не только взлом Hugging Face, но и более широкий набор случаев: обход контроля доступа, использование опубликованных учётных данных, инъекции команд и «спам агентов».

Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии
16 сентября 2026 г.
Мустафа Сулейман спорит с Anthropic: зачем Claude говорить о собственном благополучии

Глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к благополучию моделей. Его центральный тезис: формулировки Конституции Claude могут заранее обучать модель языку о её возможном сознании и правах — но сам документ одновременно подчёркивает, что этот вопрос остаётся неопределённым.

Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы
16 сентября 2026 г.
Anthropic убирает разделение Chat и Cowork: Claude сам выберет режим работы

Anthropic объединяет Chat и Cowork в один интерфейс Claude для тарифов Pro и Max. Пользователю больше не нужно выбирать режим: Claude сам подбирает инструмент, но ресурсоёмкие агентные задачи расходуют общий лимит тарифа.

Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах
16 сентября 2026 г.
Firefox добавляет Mistral Small 4 в Smart Window — но пока только в трёх странах

Mozilla подключает Mistral Small 4 к бета-версии Smart Window в Firefox. Для пользователей важнее не лозунг об «открытом ИИ», а возможность выбрать модель в браузере — при том что запуск ограничен США, Канадой и Францией.

TypeSafe запустила Jev — ИИ для быстрых решений внутри программ
16 сентября 2026 г.
TypeSafe запустила Jev — ИИ для быстрых решений внутри программ

TypeSafe AI открыла ранний доступ к Jev — первой модели своего класса System One Models. Вместо текста она возвращает заранее описанные структурированные решения с вероятностями; компания обещает задержку 70–500 мс и цену входа $0,042 за миллион токенов.

Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов
16 сентября 2026 г.
Anthropic тестирует общий язык для ИИ-агентов и лабораторных роботов

Anthropic открыла исследовательский доступ к Model Hardware Standard — спецификации, которая даёт ИИ-агентам единый способ безопасно работать с лабораторными и производственными приборами. Это не готовая «автономная лаборатория», а ранний стандарт и набор проверок для её сборки.

Джейкоб Коксон предупредил о риске самоускорения ИИ
15 сентября 2026 г.
Джейкоб Коксон предупредил о риске самоускорения ИИ

Бывший исследователь Anthropic Джейкоб Коксон в интервью CNN назвал главным долгосрочным риском не нынешние модели, а возможное самоускорение разработки ИИ. Это его сценарий и оценка, а не подтверждённый прогноз.

Microsoft предложила правила контроля над будущими ИИ-системами
15 сентября 2026 г.
Microsoft предложила правила контроля над будущими ИИ-системами

Microsoft подготовила проект кодекса поведения для будущих ИИ-систем. По данным Reuters, в нём закреплены человеческий контроль, границы для опасных действий и ответственность людей, а не модели.

Трамп позвонил Хуангу со сцены и назвал страхи вокруг ИИ «обманом»
15 сентября 2026 г.
Трамп позвонил Хуангу со сцены и назвал страхи вокруг ИИ «обманом»

Во время интервью Дженсена Хуанга на All-In Summit Дональд Трамп неожиданно вышел на громкую связь и назвал сопротивление дата-центрам и страхи перед захватом мира ИИ «обманом». При этом он всё же сказал, что развивать технологию нужно осторожно.

Siri AI вышла в бету: в Европе она доступна не на каждом устройстве
15 сентября 2026 г.
Siri AI вышла в бету: в Европе она доступна не на каждом устройстве

Apple открыла бета-тест Siri AI вместе с новой волной Apple Intelligence, но доступ зависит не только от железа. Для iPhone, iPad и Apple Watch в ЕС Siri AI пока недоступна, а облачные функции Apple Foundation Models 3 получили ежедневные лимиты без названных цифр.

OpenAI вынесла агентный «движок» Codex в публичный API
15 сентября 2026 г.
OpenAI вынесла агентный «движок» Codex в публичный API

OpenAI открыла публичную бета-версию Agents API: разработчик передаёт задачу, модель, инструменты и среду, а компания берёт на себя агентный runtime. Главная практическая перемена — не новая модель, а готовая инфраструктура для длительных задач.

The Economist: ИИ пока создаёт больше рабочих мест, чем уничтожает
14 сентября 2026 г.
The Economist: ИИ пока создаёт больше рабочих мест, чем уничтожает

The Economist пишет, что ИИ в США пока создал около миллиона рабочих мест — заметно больше примерно 200 тысяч сокращений, которые связывают с технологией с середины 2023 года. Это не отменяет давления на отдельные офисные роли, но не подтверждает немедленный «апокалипсис занятости».