Thinking Machines показала ИИ, который слушает и отвечает одновременно
Thinking Machines показала ИИ, который слушает и отвечает одновременно
Thinking Machines Lab, стартап бывшего технического директора OpenAI Миры Мурати, представил research preview «interaction models» — моделей, которые должны работать не как привычный чат с очередью реплик, а как собеседник в живом процессе. Они одновременно принимают аудио, видео и текст, реагируют в реальном времени, могут перебивать, уточнять, поддерживать разговор и параллельно запускать более долгие рассуждения или инструменты.
Главная новость здесь не в том, что ещё одна лаборатория показала голосового ассистента. Thinking Machines пытается поменять базовую механику взаимодействия с ИИ: от «человек написал запрос → модель подумала → модель ответила» к постоянному совместному каналу, где обе стороны могут видеть, слышать, говорить и действовать одновременно.
Что именно показала Thinking Machines
В своём блоге компания пишет, что сегодняшние модели «живут в одном потоке». Пока человек говорит или печатает, модель ждёт. Пока модель генерирует ответ, её восприятие фактически заморожено: она не получает новые сигналы, пока не закончит или пока пользователь не прервёт генерацию. Для простого вопроса это терпимо. Для реальной работы — обсуждения кода, перевода, обучения, проектирования интерфейса, помощи в лаборатории или производстве — это узкое горлышко.
Interaction models устроены иначе. Thinking Machines описывает многостримовый подход с «микроходами»: модель обрабатывает примерно 200 миллисекунд входа и примерно 200 миллисекунд выхода как непрерывный поток. Это позволяет ей не ждать идеальной границы между репликами. Она может слушать и говорить одновременно, замечать визуальные подсказки, реагировать на паузы, самоисправления и жесты, а не только на финальный текстовый запрос.
Компания приводит примеры: модель слушает историю и отмечает упоминания животных, переводит речь в реальном времени, подсказывает человеку, что он сутулится, или реагирует на происходящее в кадре. Всё это звучит как мелкие UX-детали, но именно из таких деталей складывается ощущение, что ИИ не просто «отвечает», а присутствует в задаче вместе с человеком.
Почему это отличается от обычных голосовых ботов
Современные voice- и realtime-системы часто выглядят интерактивными за счёт обвязки: распознавание речи, детектор конца фразы, отдельная языковая модель, синтез речи, прерывания, правила диалога. Это работает, но система остаётся набором склеенных компонентов. Thinking Machines утверждает, что interactivity нужно встраивать в саму архитектуру модели, а не добавлять поверх неё.
Отсюда важная формулировка: модель должна понимать время, паузы, наложение речи и визуальные события как часть контекста. Для человека это естественно. В разговоре мы слышим «мм», видим выражение лица, успеваем перебить до того, как собеседник уйдёт не туда, и можем одновременно смотреть на экран. Для ИИ это пока чаще имитация через интерфейсные костыли.
Thinking Machines также описывает двухслойную систему. Быстрая interaction-модель остаётся рядом с пользователем и держит живой контакт. Если нужна тяжёлая работа — поиск, браузинг, построение интерфейса, длинное рассуждение, агентный workflow, — она делегирует задачу фоновому модели-агенту и затем вплетает результат обратно в разговор. Идея понятна: пользователь не должен выбирать между мгновенной реакцией и глубоким мышлением модели.
Что известно о производительности
По данным Thinking Machines и пересказу VentureBeat, демонстрируемая модель TML-Interaction-Small — это MoE-модель на 276 млрд параметров с 12 млрд активных параметров. Компания заявляет задержку turn-taking около 0,40 секунды против 0,57 секунды у Gemini-3.1-flash-live и 1,18 секунды у GPT-realtime-2.0 в сравнимом режиме. На FD-bench V1.5, который измеряет качество интерактивного взаимодействия, Thinking Machines указывает 77,8 балла против 54,3 у Gemini-3.1-flash-live и 46,8 у GPT-realtime-2.0.
К этим цифрам стоит относиться аккуратно: это research preview, а не независимый массовый продукт, который уже можно нагрузить реальными пользователями. Но направление важно. Бенчмарки ИИ долго измеряли в основном «умность ответа» — математику, код, рассуждение, знания. Теперь появляется отдельная гонка за качество совместного процесса: насколько быстро модель понимает ситуацию, не мешает человеку, вовремя вмешивается и не теряет нить, пока параллельно работает фоновый агент.
Почему это важно для обычных пользователей
Большинство людей не хочет «промптить» ИИ как машину с формуляром. Они хотят показать экран, начать объяснять, поправить себя на полуслове, услышать короткое уточнение, попросить не перебивать, перейти с голоса на текст и обратно. Чем больше ИИ становится рабочим партнёром, тем хуже подходит модель «напиши идеальный запрос и жди готовый результат».
Если interaction models дойдут до продукта, они могут изменить голосовых ассистентов, обучение, поддержку клиентов, совместное программирование, медицинские и лабораторные рабочие процессы, производственный контроль и дизайн-инструменты. Например, модель сможет смотреть на экран разработчика, слышать его объяснение, замечать ошибку в коде до запуска тестов и параллельно собирать справку. Или помогать оператору на производстве, не дожидаясь, пока тот сформулирует проблему словами.
Это не значит, что человек исчезает из процесса. Наоборот, Thinking Machines явно спорит с идеей, что лучший ИИ — это автономный агент, которому дали задачу и ушли пить кофе. В реальной работе требования часто уточняются по ходу дела. Хороший результат возникает не из одного промпта, а из серии быстрых поправок, контекста, опыта и человеческого суждения. Новая архитектура пытается вернуть человека в цикл не как помеху, а как источник информации.
Почему это важно для рынка ИИ
Для самой Thinking Machines этот анонс — способ показать, чем компания Миры Мурати отличается от десятков новых AI-лабораторий. Стартап уже выпустил Tinker, API для тонкой настройки моделей, но interaction models дают более ясную стратегическую ставку: будущее не только в более сильных reasoning-моделях, но и в более естественных интерфейсах для совместной работы.
Это также давление на OpenAI, Google, Anthropic и другие лаборатории. Если пользователь привыкает к ИИ, который видит, слышит, отвечает почти без задержки и не теряет контекст при прерывании, обычный чат начинает казаться не «классикой», а ограничением. Как только такие системы станут стабильными, интерфейсная планка для всех ассистентов резко вырастет.
Для бизнеса вопрос ещё практичнее. Многие корпоративные процессы нельзя полностью отдать автономному агенту: слишком много нюансов, ответственности, доступа к системам и неформального знания. Но их можно ускорить, если ИИ будет рядом в реальном времени — наблюдать, подсказывать, оформлять, проверять и звать фоновый агент там, где нужна тяжёлая работа.
Где ограничения и риски
Пока interaction models нельзя просто открыть и попробовать. Thinking Machines обещает ограниченный research preview в ближайшие месяцы и более широкий релиз позже в этом году. Значит, перед нами скорее заявка на архитектурное направление, чем готовая замена ChatGPT или Gemini Live.
Есть и очевидные риски. Постоянно слушающая и смотрящая модель поднимает вопросы приватности сильнее, чем текстовый чат. Если такой ИИ работает на совещании, в классе, в больнице или у станка, нужно понимать, что записывается, где хранится, кто видит поток, как отключается наблюдение и какие действия модель может выполнять без подтверждения.
Второй риск — чрезмерная уверенность. Модель, которая перебивает и активно вмешивается, может быть полезной, но может и раздражать, отвлекать или подталкивать человека к ошибочным решениям. Хорошее интерактивное поведение — это не только низкая задержка, но и социальная уместность: когда молчать, когда уточнить, когда остановиться и когда честно сказать «я не уверен».
Главный вывод
Анонс Thinking Machines показывает, что следующая стадия ИИ-гонки будет идти не только вокруг размера моделей и результатов на тестах. Всё важнее становится вопрос: насколько естественно модель может работать вместе с человеком в живом потоке.
Если чат-боты первого поколения отвечали на запросы, то interaction models претендуют на роль постоянного участника задачи. Они слушают, смотрят, реагируют, держат контекст и вызывают фоновых агентов, пока разговор продолжается. Это пока не массовый продукт, но важная карта местности: ИИ постепенно переходит от умного окна ввода к совместной рабочей среде.
💬 Мнение редакции Neuro.ee
В этой новости мало дешёвой драмы, зато много будущей практики. Самая ценная часть ИИ может оказаться не в том, что он «сам всё сделает», а в том, что он наконец перестанет заставлять человека общаться с ним как с бюрократической формой. Если Thinking Machines права, интерфейс будущего — это не идеальный промпт, а нормальный рабочий разговор, где модель успевает думать, слушать и не выпадать из процесса.
- thinkingmachines.aiInteraction Models: A Scalable Approach to Human-AI Collaboration
- theverge.comHere’s what Mira Murati’s AI company is up to
- venturebeat.comThinking Machines shows off preview of near-realtime AI voice and video conversation with new 'interaction models'
- techmeme.comThinking Machines Lab details interaction models, which can think and respond in real time, letting users and AI interact continuously for better collaboration
- flickr.comMira Murati Th′12: Honorary Degree












