Назад
12 мая 2026 г. в 09:07 AI Thinking Machines Mira Murati Multimodal AI Agents Voice AI Enterprise AI Thinking Machines Lab; The Verge; VentureBeat; Techmeme

Thinking Machines показала ИИ, который слушает и отвечает одновременно

Thinking Machines показала ИИ, который слушает и отвечает одновременно

Thinking Machines показала ИИ, который слушает и отвечает одновременно

Thinking Machines Lab, стартап бывшего технического директора OpenAI Миры Мурати, представил research preview «interaction models» — моделей, которые должны работать не как привычный чат с очередью реплик, а как собеседник в живом процессе. Они одновременно принимают аудио, видео и текст, реагируют в реальном времени, могут перебивать, уточнять, поддерживать разговор и параллельно запускать более долгие рассуждения или инструменты.

Главная новость здесь не в том, что ещё одна лаборатория показала голосового ассистента. Thinking Machines пытается поменять базовую механику взаимодействия с ИИ: от «человек написал запрос → модель подумала → модель ответила» к постоянному совместному каналу, где обе стороны могут видеть, слышать, говорить и действовать одновременно.

Что именно показала Thinking Machines

В своём блоге компания пишет, что сегодняшние модели «живут в одном потоке». Пока человек говорит или печатает, модель ждёт. Пока модель генерирует ответ, её восприятие фактически заморожено: она не получает новые сигналы, пока не закончит или пока пользователь не прервёт генерацию. Для простого вопроса это терпимо. Для реальной работы — обсуждения кода, перевода, обучения, проектирования интерфейса, помощи в лаборатории или производстве — это узкое горлышко.

Interaction models устроены иначе. Thinking Machines описывает многостримовый подход с «микроходами»: модель обрабатывает примерно 200 миллисекунд входа и примерно 200 миллисекунд выхода как непрерывный поток. Это позволяет ей не ждать идеальной границы между репликами. Она может слушать и говорить одновременно, замечать визуальные подсказки, реагировать на паузы, самоисправления и жесты, а не только на финальный текстовый запрос.

Компания приводит примеры: модель слушает историю и отмечает упоминания животных, переводит речь в реальном времени, подсказывает человеку, что он сутулится, или реагирует на происходящее в кадре. Всё это звучит как мелкие UX-детали, но именно из таких деталей складывается ощущение, что ИИ не просто «отвечает», а присутствует в задаче вместе с человеком.

Почему это отличается от обычных голосовых ботов

Современные voice- и realtime-системы часто выглядят интерактивными за счёт обвязки: распознавание речи, детектор конца фразы, отдельная языковая модель, синтез речи, прерывания, правила диалога. Это работает, но система остаётся набором склеенных компонентов. Thinking Machines утверждает, что interactivity нужно встраивать в саму архитектуру модели, а не добавлять поверх неё.

Отсюда важная формулировка: модель должна понимать время, паузы, наложение речи и визуальные события как часть контекста. Для человека это естественно. В разговоре мы слышим «мм», видим выражение лица, успеваем перебить до того, как собеседник уйдёт не туда, и можем одновременно смотреть на экран. Для ИИ это пока чаще имитация через интерфейсные костыли.

Thinking Machines также описывает двухслойную систему. Быстрая interaction-модель остаётся рядом с пользователем и держит живой контакт. Если нужна тяжёлая работа — поиск, браузинг, построение интерфейса, длинное рассуждение, агентный workflow, — она делегирует задачу фоновому модели-агенту и затем вплетает результат обратно в разговор. Идея понятна: пользователь не должен выбирать между мгновенной реакцией и глубоким мышлением модели.

Что известно о производительности

По данным Thinking Machines и пересказу VentureBeat, демонстрируемая модель TML-Interaction-Small — это MoE-модель на 276 млрд параметров с 12 млрд активных параметров. Компания заявляет задержку turn-taking около 0,40 секунды против 0,57 секунды у Gemini-3.1-flash-live и 1,18 секунды у GPT-realtime-2.0 в сравнимом режиме. На FD-bench V1.5, который измеряет качество интерактивного взаимодействия, Thinking Machines указывает 77,8 балла против 54,3 у Gemini-3.1-flash-live и 46,8 у GPT-realtime-2.0.

К этим цифрам стоит относиться аккуратно: это research preview, а не независимый массовый продукт, который уже можно нагрузить реальными пользователями. Но направление важно. Бенчмарки ИИ долго измеряли в основном «умность ответа» — математику, код, рассуждение, знания. Теперь появляется отдельная гонка за качество совместного процесса: насколько быстро модель понимает ситуацию, не мешает человеку, вовремя вмешивается и не теряет нить, пока параллельно работает фоновый агент.

Почему это важно для обычных пользователей

Большинство людей не хочет «промптить» ИИ как машину с формуляром. Они хотят показать экран, начать объяснять, поправить себя на полуслове, услышать короткое уточнение, попросить не перебивать, перейти с голоса на текст и обратно. Чем больше ИИ становится рабочим партнёром, тем хуже подходит модель «напиши идеальный запрос и жди готовый результат».

Если interaction models дойдут до продукта, они могут изменить голосовых ассистентов, обучение, поддержку клиентов, совместное программирование, медицинские и лабораторные рабочие процессы, производственный контроль и дизайн-инструменты. Например, модель сможет смотреть на экран разработчика, слышать его объяснение, замечать ошибку в коде до запуска тестов и параллельно собирать справку. Или помогать оператору на производстве, не дожидаясь, пока тот сформулирует проблему словами.

Это не значит, что человек исчезает из процесса. Наоборот, Thinking Machines явно спорит с идеей, что лучший ИИ — это автономный агент, которому дали задачу и ушли пить кофе. В реальной работе требования часто уточняются по ходу дела. Хороший результат возникает не из одного промпта, а из серии быстрых поправок, контекста, опыта и человеческого суждения. Новая архитектура пытается вернуть человека в цикл не как помеху, а как источник информации.

Почему это важно для рынка ИИ

Для самой Thinking Machines этот анонс — способ показать, чем компания Миры Мурати отличается от десятков новых AI-лабораторий. Стартап уже выпустил Tinker, API для тонкой настройки моделей, но interaction models дают более ясную стратегическую ставку: будущее не только в более сильных reasoning-моделях, но и в более естественных интерфейсах для совместной работы.

Это также давление на OpenAI, Google, Anthropic и другие лаборатории. Если пользователь привыкает к ИИ, который видит, слышит, отвечает почти без задержки и не теряет контекст при прерывании, обычный чат начинает казаться не «классикой», а ограничением. Как только такие системы станут стабильными, интерфейсная планка для всех ассистентов резко вырастет.

Для бизнеса вопрос ещё практичнее. Многие корпоративные процессы нельзя полностью отдать автономному агенту: слишком много нюансов, ответственности, доступа к системам и неформального знания. Но их можно ускорить, если ИИ будет рядом в реальном времени — наблюдать, подсказывать, оформлять, проверять и звать фоновый агент там, где нужна тяжёлая работа.

Где ограничения и риски

Пока interaction models нельзя просто открыть и попробовать. Thinking Machines обещает ограниченный research preview в ближайшие месяцы и более широкий релиз позже в этом году. Значит, перед нами скорее заявка на архитектурное направление, чем готовая замена ChatGPT или Gemini Live.

Есть и очевидные риски. Постоянно слушающая и смотрящая модель поднимает вопросы приватности сильнее, чем текстовый чат. Если такой ИИ работает на совещании, в классе, в больнице или у станка, нужно понимать, что записывается, где хранится, кто видит поток, как отключается наблюдение и какие действия модель может выполнять без подтверждения.

Второй риск — чрезмерная уверенность. Модель, которая перебивает и активно вмешивается, может быть полезной, но может и раздражать, отвлекать или подталкивать человека к ошибочным решениям. Хорошее интерактивное поведение — это не только низкая задержка, но и социальная уместность: когда молчать, когда уточнить, когда остановиться и когда честно сказать «я не уверен».

Главный вывод

Анонс Thinking Machines показывает, что следующая стадия ИИ-гонки будет идти не только вокруг размера моделей и результатов на тестах. Всё важнее становится вопрос: насколько естественно модель может работать вместе с человеком в живом потоке.

Если чат-боты первого поколения отвечали на запросы, то interaction models претендуют на роль постоянного участника задачи. Они слушают, смотрят, реагируют, держат контекст и вызывают фоновых агентов, пока разговор продолжается. Это пока не массовый продукт, но важная карта местности: ИИ постепенно переходит от умного окна ввода к совместной рабочей среде.

💬 Мнение редакции Neuro.ee

В этой новости мало дешёвой драмы, зато много будущей практики. Самая ценная часть ИИ может оказаться не в том, что он «сам всё сделает», а в том, что он наконец перестанет заставлять человека общаться с ним как с бюрократической формой. Если Thinking Machines права, интерфейс будущего — это не идеальный промпт, а нормальный рабочий разговор, где модель успевает думать, слушать и не выпадать из процесса.

Ещё новости

Google добавила говорящие аватары в Gemini Enterprise
26 сентября 2026 г.
Google добавила говорящие аватары в Gemini Enterprise

Google открыла для Gemini Enterprise Live Avatar: корпоративный голосовой агент теперь может отвечать с синхронизированным видеоаватаром. Функция полезна для сервисных сценариев, но создание собственных персонажей пока требует allowlist.

Google Beam выходит в шесть стран: 3D-видеосвязь становится ближе к офисам
26 сентября 2026 г.
Google Beam выходит в шесть стран: 3D-видеосвязь становится ближе к офисам

Google расширяет поставки Beam — системы видеосвязи с эффектом присутствия — на шесть стран и запускает сеть демонстрационных переговорных. Важно не само обещание «как в одной комнате», а то, что устройство начинает появляться там, где его можно испытать до покупки.

Microsoft встраивает Word, Excel и PowerPoint в новый Copilot
26 сентября 2026 г.
Microsoft встраивает Word, Excel и PowerPoint в новый Copilot

Microsoft представила новый интерфейс Copilot: в нём объединяются чат и агентный режим, а документы Word, таблицы Excel и презентации PowerPoint можно создавать и править прямо из разговора. Первые функции доступны не всем: Home и Code начинают раскатывать в программе Frontier, а Autopilot пока идёт в закрытый предварительный доступ.

Gemini подключает Adobe, Airtable и Linear: ИИ добирается до списка дел
23 сентября 2026 г.
Gemini подключает Adobe, Airtable и Linear: ИИ добирается до списка дел

Google расширяет Connected Apps в Gemini: ассистент получает новые связки с Adobe, Airtable, Linear, Peloton и другими сервисами. Главный вопрос теперь не в количестве подключений, а в том, какие действия и данные пользователь готов отдать в один чат.

AWS запустила CloudWatch Omni для отладки ИИ-агентов
23 сентября 2026 г.
AWS запустила CloudWatch Omni для отладки ИИ-агентов

AWS представила CloudWatch Omni — отдельную среду наблюдаемости для приложений и ИИ-агентов. Сервис собирает трассы, метрики и логи в одном интерфейсе и позволяет расследовать сбои через чат или IDE.

Meta представила Muse — агента, который работает после закрытия приложения
23 сентября 2026 г.
Meta представила Muse — агента, который работает после закрытия приложения

Meta запускает Muse — персонального ИИ-агента для поручений в браузере, почте и покупках. Главный вопрос не в обещанной автономности, а в том, как пользователь ограничит доступ к своим данным и деньгам.

OpenAI создала совет математиков после спора о доказательствах ИИ
22 сентября 2026 г.
OpenAI создала совет математиков после спора о доказательствах ИИ

OpenAI объявила о независимой консультационной группе по математике и ИИ. Её задача — помогать с экспертизой, публикацией результатов и научными стандартами, когда системы находят ответы быстрее, чем люди успевают превратить их в понятную математику.

Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним
22 сентября 2026 г.
Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним

Anthropic представила Claude Opus 5.5 — первую модель семейства 5.5. Компания снизила API-цены, ускорила генерацию и увеличила пятитичасовые лимиты подписок, но сохранила строгие ограничения для чувствительных задач.

OpenAI урезала цены и выпустила GPT-6 Sol и Luna
22 сентября 2026 г.
OpenAI урезала цены и выпустила GPT-6 Sol и Luna

OpenAI представила GPT-6 Sol и GPT-6 Luna — более дешёвые модели семейства GPT-6 для повседневной агентной, программной и офисной работы. Sol и Luna не претендуют на место Astra: ставка релиза — сохранить заметную часть её возможностей при меньшей цене и с более выгодным кэшированием контекста.

Anthropic: Claude ведёт 26% исследований моделей
20 сентября 2026 г.
Anthropic: Claude ведёт 26% исследований моделей

Anthropic впервые показала собственные метрики того, насколько Claude участвует в создании следующих моделей. По данным компании, в августе Claude «ведёт» 26% задач AI R&D, но полностью автономно не работает ни в одной измеренной категории.

Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture
20 сентября 2026 г.
Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture

Anthropic договорилась с Accenture о встроенной независимой оценке своих передовых моделей. Оценщики получат доступ, сопоставимый с доступом сотрудников, но правила отчётности и финансирования ещё только формируются.

Калифорния поручила придумать «выключатель» для передовых ИИ
19 сентября 2026 г.
Калифорния поручила придумать «выключатель» для передовых ИИ

Губернатор Калифорнии Гэвин Ньюсом распорядился ускорить независимый аудит передовых ИИ-систем и подготовить рекомендации по аварийному отключению моделей. Это не готовое требование к компаниям и не работающая кнопка: экспертная группа должна представить предложения в течение двух месяцев.