Microsoft выпустила расшифровку, которая начинает работать до конца фразы
Microsoft AI представила MAI-Transcribe-2-Streaming — модель распознавания речи, которая не ждёт конца реплики. По заявлению компании, первые варианты текста появляются чуть более чем через 100 миллисекунд после поступления аудио; по мере фразы система их исправляет и закрепляет итоговую расшифровку.
Это важнее, чем очередной рекорд в таблице: голосовой помощник может начать искать данные или вызывать инструмент, пока человек ещё договаривает запрос. Для субтитров и диктовки Microsoft обещает, что слова появляются в тексте вдвое быстрее, чем у ближайшего конкурента по её внутренним тестам. Это именно заявление разработчика, а не независимое сравнение всех сервисов.

Источник: Microsoft AI.
Не «мгновенный текст», а текст, который меняет себя
Потоковая расшифровка всегда работает с неполной фразой. Поэтому ранняя гипотеза может оказаться неверной, когда появится контекст. Microsoft прямо описывает этот механизм: модель выдаёт промежуточные варианты, пересматривает их и быстро фиксирует стабильный текст. Для голосового агента это компромисс между скоростью реакции и риском действовать по ещё неокончательным словам.
MAI-Transcribe-2-Streaming поддерживает 60 языков и автоматическое непрерывное определение языка. Microsoft называет модель первой по точности финальных и промежуточных расшифровок в рейтинге Artificial Analysis, а цену до конца года — $0,54 за час аудио. Перед внедрением командам стоит отдельно проверить качество на своих акцентах, шумных звонках и профессиональной лексике: общая позиция в бенчмарке не заменяет такой тест.
Голосу дают ответную часть
Одновременно Microsoft выпустила MAI-Voice-2.1 и более быструю MAI-Voice-2.1-Flash — модели синтеза речи. Они поддерживают 23 языка и 26 локалей; компания обещает сохранить один голос при переключении языков. Flash заявлена для задач с низкой задержкой: до 45 секунд аудио при задержке от конца до конца в 150 мс.
Вместе эти релизы превращают разговорный интерфейс в конвейер: речь поступает, текст появляется, агент успевает рассуждать, а ответ синтезируется. Но реальная «живость» такого диалога зависит не только от двух аудиомоделей — задержку добавляют поиск, инструменты, правила безопасности и проверка результата. Быстрый голос не должен становиться поводом отвечать раньше, чем система действительно поняла запрос.













