Назад
26 августа 2026 г. в 18:20 ИИ Google Gemini речь API Google

Google выпустила Gemini 3.5 Transcribe: ИИ будет расшифровывать речь без «э-э» и с именами спикеров

Google выпустила Gemini 3.5 Transcribe: ИИ будет расшифровывать речь без «э-э» и с именами спикеров

Google 26 августа представила Gemini 3.5 Transcribe — отдельную модель для перевода речи в текст — и Gemini 3.5 Transcribe Live для потоковой расшифровки. Обе доступны разработчикам через Gemini API. Компания обещает, что они лучше справляются с фоновым шумом, профессиональной лексикой и живой, сбивчивой речью.

Вторая деталь важнее, чем кажется: сервис должен превращать неаккуратное «ну, я хотел сказать…» в пригодную для чтения фразу. Google называет этот режим умной расшифровкой. Его задача — понимать самокоррекцию говорящего, распознавать названия, номера заказов и другую буквенно-цифровую информацию, а не просто посимвольно воспроизводить звук в разговоре, где человек обычно перебивает сам себя.

Не только диктовка

Для записей встреч, звонков и интервью обычная Transcribe добавляет временные метки для отдельных слов и определение спикеров. Официально заявлена разметка до трёх человек; поддержка большего количества участников пока имеет экспериментальный статус. Можно передать собственный словарь — полезно для медицины, юриспруденции, названий продуктов и внутренних сокращений.

Модель автоматически распознаёт и расшифровывает более 85 языков. Это не означает безошибочность во всех акцентах и условиях: заявление о качестве исходит от Google, а реальные сценарии с плохой связью и смешением языков ещё предстоит проверить разработчикам.

Голосовой интерфейс без ожидания

Gemini 3.5 Transcribe Live предназначена для приложений, которым текст нужен прямо во время разговора. Она работает по двустороннему соединению WebSocket в Live API и отдаёт как промежуточные, так и окончательные фрагменты. Google заявляет задержку менее секунды.

Практическое последствие — голосовой помощник, операторская панель или заметки по встрече могут получать структурированную речь без отдельной цепочки из распознавания, очистки текста и определения говорящих. Но у такого удобства есть цена: разговоры и записи становятся ещё одним чувствительным типом данных, поэтому компаниям придётся отдельно решать, какие аудио можно отправлять во внешний API и как долго хранить результат.

Ещё новости

Cloudflare выпустила Clef-omni: модель решений с аудио и видео
10 октября 2026 г.
Cloudflare выпустила Clef-omni: модель решений с аудио и видео

Cloudflare представила открытую модель решений Clef-omni: она принимает текст, изображения, аудио и видео в одном запросе. Для разработчиков это способ строить классификацию и маршрутизацию без отдельной цепочки распознавания речи и кадров.

Falcon ASR: открытая модель для арабской речи и пяти языков
10 октября 2026 г.
Falcon ASR: открытая модель для арабской речи и пяти языков

TII представил Falcon-ASR — открытую модель распознавания речи с акцентом на арабские диалекты. Она также распознаёт английский, французский, испанский и португальский без ручного выбора языка.

ИИ помогает 10 минут — а потом сложнее думать без него
10 октября 2026 г.
ИИ помогает 10 минут — а потом сложнее думать без него

Исследователи проверили, что происходит, когда доступ к ИИ внезапно исчезает во время сложной задачи. В трёх экспериментах участники с помощником быстрее решали первые задания, но затем чаще ошибались и бросали работу без него.

Anthropic запретила «жестокость» к Claude — но границы пока размыты
9 октября 2026 г.
Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic внесла в правила Claude запрет на «длительное и беспричинное» оскорбительное или жестокое поведение по отношению к своим моделям. Компания обещает применять пункт лишь в крайних случаях, но публичного критерия для этой границы пока нет.

GitHub Copilot CLI научился находить локальные модели Ollama
9 октября 2026 г.
GitHub Copilot CLI научился находить локальные модели Ollama

В Copilot CLI появилась команда, которая показывает совместимые модели из уже запущенного Ollama. Но локальная модель сама по себе не делает сессию офлайн и не отменяет телеметрию GitHub.

Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам
9 октября 2026 г.
Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам

Google Cloud представила Gemini agent — корпоративного агента, который получает контекст компании, выбирает модели и выполняет задачи через подключённые системы. Главное для команд — это не новый чат, а ещё одна точка, где придётся заранее определить права, бюджеты и проверку результата.

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
8 октября 2026 г.
Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google DeepMind представила открытую 740-миллионную EmbeddingGemma 2: модель сопоставляет текст, изображения, кадры видео и аудио в одном векторном пространстве. Для разработчиков это путь к локальному поиску по медиатеке без обязательной отправки файлов в облако.

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.