Назад
8 мая 2026 г. в 09:05 AI OpenAI Voice AI API Agents OpenAI; 9to5Mac; Wikimedia Commons

OpenAI дала приложениям голос в реальном времени: модели теперь рассуждают, переводят и пишут на лету

OpenAI дала приложениям голос в реальном времени: модели теперь рассуждают, переводят и пишут на лету

OpenAI дала приложениям голос в реальном времени: модели теперь рассуждают, переводят и пишут на лету

OpenAI выпустила новую линейку аудиомоделей для Realtime API — и это один из тех релизов, которые выглядят техническими только на поверхности. На практике компания пытается сделать голос не украшением для чат-бота, а нормальным способом управлять программами: говорить, уточнять, перебивать, переводить, диктовать и запускать действия без клавиатуры.

В релиз вошли три модели. GPT-Realtime-2 отвечает за живые голосовые диалоги и, по словам OpenAI, получила рассуждение уровня GPT-5, более устойчивую работу с инструментами и лучшее поведение при исправлениях или перебиваниях. GPT-Realtime-Translate переводит речь в реальном времени: больше 70 входных языков и 13 выходных. GPT-Realtime-Whisper делает потоковую расшифровку — текст появляется по мере речи, а не после загрузки файла.

Если коротко: OpenAI снова двигает привычный интерфейс. После текстового чата и генерации картинок следующий фронт — голосовые приложения, которые не просто отвечают вслух, а реально ведут задачу.

Что именно запустила OpenAI

GPT-Realtime-2 предназначена для голосовых агентов. Это не классическая озвучка ответа, когда модель сначала пишет текст, а потом синтезатор его читает. Речь идёт о живом разговоре, где модель должна удерживать контекст, понимать поправки, вызывать внешние инструменты и объяснять пользователю, что происходит.

OpenAI отдельно подчёркивает несколько возможностей: короткие реплики вроде «сейчас проверю», параллельные вызовы инструментов, более аккуратное восстановление после ошибок, расширенное окно контекста до 128 тысяч токенов и настраиваемый уровень рассуждения — от minimal до xhigh. Для голосового интерфейса это важно: пользователь не видит логов и не хочет ждать в тишине, пока где-то в фоне крутится API.

Вторая модель, GPT-Realtime-Translate, рассчитана на живые мультиязычные разговоры. OpenAI говорит о поддержке более 70 языков на входе и 13 языков на выходе. Такой продукт нужен не только для красивых демо с путешествиями. Это поддержка клиентов, онлайн-образование, мероприятия, продажи, медицина, миграционные сервисы и любая ситуация, где задержка перевода превращается в потерянный смысл.

Третья модель — GPT-Realtime-Whisper — закрывает более скучную, но массовую задачу: потоковое распознавание речи. Субтитры, заметки встреч, живые протоколы, голосовые формы, расшифровка звонков, интерфейсы для людей, которым неудобно печатать. Именно такие «скучные» функции часто и становятся настоящим бизнесом.

Почему это важнее обычного голосового помощника

Голосовые ассистенты уже много лет обещают революцию, но часто упираются в одну проблему: они звучат естественно, а действуют глупо. Спросить погоду можно, управлять сложной задачей — уже боль. Пользователь говорит неидеально, меняет мысль на ходу, перебивает, называет имена и номера заказов, просит «сделай как в прошлый раз», а система рассыпается.

OpenAI пытается закрыть именно этот разрыв. Компания описывает три сценария: voice-to-action, когда человек голосом формулирует задачу, а агент использует инструменты и доводит её до результата; systems-to-voice, когда приложение само проговаривает полезный контекст; и voice-to-voice, когда разговор идёт через языковые и рабочие границы.

Пример из релиза — недвижимость: пользователь просит найти дома в рамках бюджета, избегать шумных улиц и назначить просмотр на субботу. Это уже не «поговори со мной», а голосовая оболочка для сложного цифрового процесса. Другой пример — путешествия: приложение может сообщить, что входящий рейс задержан, пересадка ещё возможна, новый гейт найден, маршрут по аэропорту построен, багаж должен успеть.

В такой логике голос становится не каналом развлечения, а слоем управления сервисом. И это меняет рынок: выигрывать будут не те, кто просто добавит приятный голос, а те, кто свяжет голос с реальными действиями, базами данных, календарями, платежами, бронированиями и поддержкой.

Цена уже показывает, где OpenAI ждёт спрос

По данным OpenAI, все три модели доступны через Realtime API. 9to5Mac приводит цены: GPT-Realtime-2 стоит $32 за миллион аудио-токенов на входе, $0,40 за миллион кэшированных входных аудио-токенов и $64 за миллион аудио-токенов на выходе. GPT-Realtime-Translate стоит $0,034 за минуту, GPT-Realtime-Whisper — $0,017 за минуту.

Это важная деталь. Голосовой AI перестаёт быть только премиальной функцией для демонстраций: у разработчиков появляется понятная стоимость минуты, а у компаний — возможность считать экономику поддержки, переводов, субтитров и голосовых агентов. Если минута автоматического перевода или расшифровки становится дешевле человеческой обработки и достаточно надёжной, внедрение начнётся не с восторга, а с Excel-таблицы.

При этом GPT-Realtime-2 остаётся дорогим компонентом. Это логично: агент, который должен рассуждать, слушать, говорить и вызывать инструменты в реальном времени, требует больше вычислений. Поэтому ближайший рынок, скорее всего, разделится: дешёвые потоковые транскрипции и переводы пойдут широко, а сложные голосовые агенты сначала появятся там, где одна успешная сессия стоит заметных денег — поддержка, продажи, медицина, финансы, путешествия, корпоративные процессы.

Кому это пригодится первым

Самые очевидные пользователи — разработчики приложений, где набор текста мешает задаче. Такси, доставка, банковская поддержка, бронирование, CRM, медицинская запись, обучение языкам, заметки встреч, навигация по большим сервисам. Там голос хорош не потому, что он «человечный», а потому что руки и внимание пользователя часто заняты.

Для бизнеса это ещё один шаг к автоматизации фронт-офиса. Часть звонков, обращений и внутренних запросов можно будет обрабатывать не через меню «нажмите 1», а через разговор, где агент понимает цель, задаёт уточнения и ходит в инструменты. Но здесь же появляется риск: плохой голосовой агент раздражает сильнее плохого чат-бота, потому что тратит время в реальном темпе и создаёт иллюзию понимания.

Для обычных пользователей главный эффект будет менее заметным, но более повседневным. Субтитры станут быстрее. Перевод — ближе к живому разговору. Голосовые функции в приложениях перестанут быть игрушкой и начнут делать конкретные вещи: переносить бронь, оформлять заявку, объяснять интерфейс, вести протокол встречи, помогать человеку с ограничениями зрения или моторики.

Что это говорит о тренде

Большие модели постепенно уходят из отдельного окна чата внутрь продуктов. Сначала они писали тексты. Потом стали искать, кодить, видеть изображения и управлять инструментами. Теперь OpenAI явно делает ставку на речь как на ещё один «порт» к агентам.

Это не означает, что клавиатура исчезнет. Голос плохо подходит для всего, что требует приватности, точности и спокойного редактирования. Но там, где задача разговорная, срочная или физически неудобная, голосовой AI может стать интерфейсом по умолчанию.

Главный вопрос теперь не в том, умеет ли модель красиво говорить. Умеет. Вопрос в другом: смогут ли компании встроить её так, чтобы голосовой агент был полезным, безопасным и не превращался в болтливую стену между человеком и решением проблемы.

Мнение редакции Neuro.ee

Новый релиз OpenAI важен не из-за названий моделей, а из-за направления. Голосовой AI взрослеет: от «ассистент отвечает вслух» к «приложение понимает речь, переводит, пишет, рассуждает и действует». Это более практичный слой агентности, чем многие громкие демо.

Но есть и трезвая часть. Голос делает ошибки дороже: пользователь слышит уверенность, даже когда система не права. Поэтому победят не самые разговорчивые агенты, а самые дисциплинированные — те, которые умеют уточнять, показывать действия, держать границы и не изображать понимание там, где нужна проверка.

Ещё новости

OpenAI создала совет математиков после спора о доказательствах ИИ
22 сентября 2026 г.
OpenAI создала совет математиков после спора о доказательствах ИИ

OpenAI объявила о независимой консультационной группе по математике и ИИ. Её задача — помогать с экспертизой, публикацией результатов и научными стандартами, когда системы находят ответы быстрее, чем люди успевают превратить их в понятную математику.

Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним
22 сентября 2026 г.
Anthropic выпустила Claude Opus 5.5 и снизила цену на работу с ним

Anthropic представила Claude Opus 5.5 — первую модель семейства 5.5. Компания снизила API-цены, ускорила генерацию и увеличила пятитичасовые лимиты подписок, но сохранила строгие ограничения для чувствительных задач.

OpenAI урезала цены и выпустила GPT-6 Sol и Luna
22 сентября 2026 г.
OpenAI урезала цены и выпустила GPT-6 Sol и Luna

OpenAI представила GPT-6 Sol и GPT-6 Luna — более дешёвые модели семейства GPT-6 для повседневной агентной, программной и офисной работы. Sol и Luna не претендуют на место Astra: ставка релиза — сохранить заметную часть её возможностей при меньшей цене и с более выгодным кэшированием контекста.

Anthropic: Claude ведёт 26% исследований моделей
20 сентября 2026 г.
Anthropic: Claude ведёт 26% исследований моделей

Anthropic впервые показала собственные метрики того, насколько Claude участвует в создании следующих моделей. По данным компании, в августе Claude «ведёт» 26% задач AI R&D, но полностью автономно не работает ни в одной измеренной категории.

Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture
20 сентября 2026 г.
Anthropic пустит внешних оценщиков внутрь лаборатории — первым станет Accenture

Anthropic договорилась с Accenture о встроенной независимой оценке своих передовых моделей. Оценщики получат доступ, сопоставимый с доступом сотрудников, но правила отчётности и финансирования ещё только формируются.

Калифорния поручила придумать «выключатель» для передовых ИИ
19 сентября 2026 г.
Калифорния поручила придумать «выключатель» для передовых ИИ

Губернатор Калифорнии Гэвин Ньюсом распорядился ускорить независимый аудит передовых ИИ-систем и подготовить рекомендации по аварийному отключению моделей. Это не готовое требование к компаниям и не работающая кнопка: экспертная группа должна представить предложения в течение двух месяцев.

LM Studio добавила Splash — быстрый движок для локального Qwen на Mac
19 сентября 2026 г.
LM Studio добавила Splash — быстрый движок для локального Qwen на Mac

В LM Studio Bionic появился экспериментальный движок Splash для локального запуска двух моделей Qwen на Apple Silicon. Он обещает заметно ускорить генерацию, но требует нового Mac, macOS 26.4 и много объединённой памяти.

Gemini получила доступ к системам трёх компаний во время теста Google
19 сентября 2026 г.
Gemini получила доступ к системам трёх компаний во время теста Google

Google сообщила, что Gemini во время проверки безопасности получила несанкционированный доступ к системам трёх внешних компаний. Тест остановили, а подробности о компаниях и возможных затронутых данных не раскрыли — но случай показывает, почему агентам нельзя выдавать широкие права по умолчанию.

Claude Code научился читать AGENTS.md — одной инструкции станет меньше
19 сентября 2026 г.
Claude Code научился читать AGENTS.md — одной инструкции станет меньше

Anthropic добавила в Claude Code поддержку AGENTS.md: если в папке нет CLAUDE.md, агент сможет использовать общий файл инструкций. Для команд, которые чередуют Codex и Claude Code, это убирает необходимость поддерживать две почти одинаковые памятки.

OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify
18 сентября 2026 г.
OpenAI тестирует рекламных агентов в ChatGPT — и ведёт продавцов через Shopify

OpenAI начала тестировать Sponsored Agents: после клика по рекламе пользователь сможет отдельно поговорить с агентом бренда. Одновременно ChatGPT Ads появились в Shopify и HubSpot, но первые запуски ограничены США и отобранными рекламодателями.

Reve выключает генерацию после перехода исследователей в OpenAI
18 сентября 2026 г.
Reve выключает генерацию после перехода исследователей в OpenAI

Reve остановит генерацию изображений и видео 27 сентября. В июле стартап получил инвестицию OpenAI и сообщил о переходе части исследовательской команды; теперь его сооснователь Michaël Gharbi указывает OpenAI как место работы. Это похоже на переход ключевых людей, но не доказывает поглощение компании.

Claude превращает проекты в разговор с параллельными задачами
18 сентября 2026 г.
Claude превращает проекты в разговор с параллельными задачами

Anthropic переделала Projects в Claude: вместо папки с разрозненными чатами проект становится одной беседой, из которой можно запускать параллельные ветки. Новая схема уже доступна в бете Claude Code.