Назад
10 октября 2026 г. в 10:50 Cloudflare Open Source Multimodal AI AI Agents Источник

Cloudflare выпустила Clef-omni: модель решений с аудио и видео

Cloudflare выпустила Clef-omni: модель решений с аудио и видео

Cloudflare выпустила Clef-omni — открытую модель для задач выбора и классификации, которая принимает в одном запросе текст, изображения, аудио и видео. Это не чат-бот: модель должна вернуть структурированное решение по заданной схеме — например, определить, видна ли на фотографии табличка устройства, нормально ли оно звучит на записи и работает ли вентилятор в ролике.

Главная практическая разница — меньше склеек между моделями. Обычно такой сценарий требует отдельно распознать речь, извлечь кадры из видео и затем собрать ответы. Clef-omni принимает WAV или MP3, MP4 или WebM, изображения и текст напрямую. Cloudflare заявляет, что 21-секундный ролик со звуком модель оценивает примерно за 1,5 секунды в одном API-вызове.

Не универсальный собеседник, а слой решений

Clef-omni построена на Qwen3-Omni-30B-A3B-Instruct, но Cloudflare использует её как «модель решений»: вместо генерации длинного ответа она оценивает варианты и выдаёт результат, ограниченный схемой. Компания также опубликовала веса на Hugging Face и сделала модель доступной в Workers AI.

Такой формат полезен агентам и бэкенд-процессам: модерации, маршрутизации заявок, проверке медиа или выбору следующего действия. Но слово «решение» не означает, что модель можно без проверки выпускать в критический процесс. Для конкретного набора данных всё равно нужны тесты на ошибки, пороги уверенности и человеческое подтверждение там, где цена ложного срабатывания высока.

Дешевле — с меньшим контекстом

Вместе с Clef-omni компания снизила цену Clef-flash с $0,09 до $0,038 за миллион входных токенов. Компромисс: облачная версия Clef-flash теперь имеет контекст 24 тыс. токенов вместо 64 тыс.; веса на Hugging Face, по словам Cloudflare, сохраняют поддержку 256 тыс. токенов при самостоятельном хостинге.

Clef-omni стоит $0,15 за миллион входных токенов. Для разработчика важнее не только цена модели, но и то, исчезают ли отдельные вызовы распознавания речи и обработки кадров. Если да, мультимодальный вход может упростить архитектуру — но качество решения по-прежнему надо проверять на реальных аудио и видео, а не на промо-демо.

Официальный анонс Cloudflare

Ещё новости

Falcon ASR: открытая модель для арабской речи и пяти языков
10 октября 2026 г.
Falcon ASR: открытая модель для арабской речи и пяти языков

TII представил Falcon-ASR — открытую модель распознавания речи с акцентом на арабские диалекты. Она также распознаёт английский, французский, испанский и португальский без ручного выбора языка.

ИИ помогает 10 минут — а потом сложнее думать без него
10 октября 2026 г.
ИИ помогает 10 минут — а потом сложнее думать без него

Исследователи проверили, что происходит, когда доступ к ИИ внезапно исчезает во время сложной задачи. В трёх экспериментах участники с помощником быстрее решали первые задания, но затем чаще ошибались и бросали работу без него.

ИИ уже режет занятость в колл-центрах: мировой спад дошёл до бедных стран
9 октября 2026 г.
ИИ уже режет занятость в колл-центрах: мировой спад дошёл до бедных стран

По данным Revelio Labs, которые опубликовал a16z, мировая занятость в колл-центрах перешла от многолетнего роста примерно на 4% в год к сопоставимому снижению. Это не доказательство, что каждое сокращение вызвано ИИ, но спад теперь заметен и в странах с дешёвой рабочей силой.

Anthropic запретила «жестокость» к Claude — но границы пока размыты
9 октября 2026 г.
Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic внесла в правила Claude запрет на «длительное и беспричинное» оскорбительное или жестокое поведение по отношению к своим моделям. Компания обещает применять пункт лишь в крайних случаях, но публичного критерия для этой границы пока нет.

GitHub Copilot CLI научился находить локальные модели Ollama
9 октября 2026 г.
GitHub Copilot CLI научился находить локальные модели Ollama

В Copilot CLI появилась команда, которая показывает совместимые модели из уже запущенного Ollama. Но локальная модель сама по себе не делает сессию офлайн и не отменяет телеметрию GitHub.

Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам
9 октября 2026 г.
Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам

Google Cloud представила Gemini agent — корпоративного агента, который получает контекст компании, выбирает модели и выполняет задачи через подключённые системы. Главное для команд — это не новый чат, а ещё одна точка, где придётся заранее определить права, бюджеты и проверку результата.

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
8 октября 2026 г.
Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google DeepMind представила открытую 740-миллионную EmbeddingGemma 2: модель сопоставляет текст, изображения, кадры видео и аудио в одном векторном пространстве. Для разработчиков это путь к локальному поиску по медиатеке без обязательной отправки файлов в облако.

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.