Cloudflare выпустила Clef-omni: модель решений с аудио и видео
Cloudflare выпустила Clef-omni — открытую модель для задач выбора и классификации, которая принимает в одном запросе текст, изображения, аудио и видео. Это не чат-бот: модель должна вернуть структурированное решение по заданной схеме — например, определить, видна ли на фотографии табличка устройства, нормально ли оно звучит на записи и работает ли вентилятор в ролике.
Главная практическая разница — меньше склеек между моделями. Обычно такой сценарий требует отдельно распознать речь, извлечь кадры из видео и затем собрать ответы. Clef-omni принимает WAV или MP3, MP4 или WebM, изображения и текст напрямую. Cloudflare заявляет, что 21-секундный ролик со звуком модель оценивает примерно за 1,5 секунды в одном API-вызове.
Не универсальный собеседник, а слой решений
Clef-omni построена на Qwen3-Omni-30B-A3B-Instruct, но Cloudflare использует её как «модель решений»: вместо генерации длинного ответа она оценивает варианты и выдаёт результат, ограниченный схемой. Компания также опубликовала веса на Hugging Face и сделала модель доступной в Workers AI.
Такой формат полезен агентам и бэкенд-процессам: модерации, маршрутизации заявок, проверке медиа или выбору следующего действия. Но слово «решение» не означает, что модель можно без проверки выпускать в критический процесс. Для конкретного набора данных всё равно нужны тесты на ошибки, пороги уверенности и человеческое подтверждение там, где цена ложного срабатывания высока.
Дешевле — с меньшим контекстом
Вместе с Clef-omni компания снизила цену Clef-flash с $0,09 до $0,038 за миллион входных токенов. Компромисс: облачная версия Clef-flash теперь имеет контекст 24 тыс. токенов вместо 64 тыс.; веса на Hugging Face, по словам Cloudflare, сохраняют поддержку 256 тыс. токенов при самостоятельном хостинге.
Clef-omni стоит $0,15 за миллион входных токенов. Для разработчика важнее не только цена модели, но и то, исчезают ли отдельные вызовы распознавания речи и обработки кадров. Если да, мультимодальный вход может упростить архитектуру — но качество решения по-прежнему надо проверять на реальных аудио и видео, а не на промо-демо.













