Назад
5 июля 2026 г. в 06:09 AI Agents Qwen Alibaba Open Source Benchmarks Qwen / arXiv / GitHub

Qwen учит ИИ-агентов тренироваться в симулированном мире, а не только в живом вебе

Qwen учит ИИ-агентов тренироваться в симулированном мире, а не только в живом вебе

Qwen учит ИИ-агентов тренироваться в симулированном мире, а не только в живом вебе

Команда Alibaba Qwen открыла Qwen-AgentWorld-35B-A3B и AgentWorldBench — модель и бенчмарк для нового типа агентной инфраструктуры. Идея не в том, чтобы дать пользователю еще один чат-бот. Qwen-AgentWorld пытается моделировать среды, где агент действует: терминал, поиск, веб, Android, OS, SWE-задачи и MCP-инструменты.

Если обычная языковая модель предсказывает следующий текст, такая “модель мира” предсказывает, что произойдет после действия агента. Например: какую выдачу вернет поиск, что покажет терминал после команды, как изменится состояние интерфейса или где агент ошибется в последовательности шагов.

Зачем агентам симулятор

Сегодня сильные агенты часто учатся и проверяются в живых средах: реальных сайтах, репозиториях, терминалах и API. Это дорого, шумно и плохо контролируется. Среда меняется, сервисы блокируют автоматизацию, а ошибка агента может испортить файл, потратить деньги или увести процесс в сторону.

Qwen предлагает другой слой: сначала научить модель правдоподобно симулировать окружение, а затем использовать эту симуляцию как полигон для обучения и оценки агентов. По данным команды, Qwen-AgentWorld обучалась на более чем 10 млн траекторий взаимодействия с реальными средами. Открытая версия — MoE-модель 35B с 3B активных параметров и контекстом 256K.

Что показали тесты

В AgentWorldBench большая версия Qwen-AgentWorld-397B-A17B набрала 58,71 балла и, по данным авторов, обошла GPT-5.4 с 58,25. Открытая 35B-версия подняла результат базовой Qwen3.5-35B-A3B на 8,66 пункта. Эти цифры стоит читать осторожно: это бенчмарк от самих разработчиков, а не независимый стандарт.

Но направление важнее таблицы. Агентный ИИ упирается не только в “умную модель”, а в среду тренировки: где безопасно ошибаться, как воспроизводить сценарии, как проверять результат и как учить агента не ломать внешний мир. Если симуляторы станут достаточно надежными, разработчики смогут быстрее готовить агентов для рабочих интерфейсов, не превращая каждый эксперимент в поход по живым системам.

Ещё новости

За ИИ платят лишь 2,2% домохозяйств США — но чек растёт
3 октября 2026 г.
За ИИ платят лишь 2,2% домохозяйств США — но чек растёт

В отчёте a16z State of Markets II доля американских домохозяйств с платной AI-подпиской достигла 2,2% к весне 2026 года. Это не оценка всего рынка ИИ и не число пользователей: график фиксирует только оплачиваемые подписки домохозяйств, зато показывает одновременно рост проникновения и среднего ежемесячного чека.

NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999
3 октября 2026 г.
NVIDIA выпустит DGX Spark с 64 ГБ памяти за $4 999

NVIDIA добавляет более доступную версию DGX Spark с 64 ГБ объединённой памяти. Один компьютер рассчитан на локальные модели до 100 млрд параметров, а пара устройств может объединять память до 128 ГБ.

Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi
3 октября 2026 г.
Meta открыла SDK для устройств Muse: агент можно подключить к ESP32 и Raspberry Pi

Meta опубликовала открытые SDK и прошивки для самодельных устройств, подключаемых к персональному агенту Muse. Практический смысл — вывести агента из приложения на кнопки, дисплеи, датчики и домашние сценарии, но для сопряжения всё равно нужен токен и режим разработчика.

ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет
2 октября 2026 г.
ИИ помог прочитать шифр Наполеоновской войны, молчавший 217 лет

ИИ-инженер Картер Чёрч с помощью GPT-6 Astra расшифровал письмо для генерала Огюста де Мармона, известное лишь по скану 1969 года. Важен не только результат, но и рабочий процесс: модель одновременно читала рукописные знаки, строила ключ гомофонического шифра и проверяла гипотезы по исходному изображению.

Microsoft выпустила расшифровку, которая начинает работать до конца фразы
2 октября 2026 г.
Microsoft выпустила расшифровку, которая начинает работать до конца фразы

Microsoft AI представила потоковую модель MAI-Transcribe-2-Streaming и две голосовые модели. Главная ставка — голосовые агенты, которые могут начать обработку запроса ещё во время речи.

Калифорния запретила увольнять людей по решению одного ИИ
2 октября 2026 г.
Калифорния запретила увольнять людей по решению одного ИИ

Губернатор Калифорнии Гэвин Ньюсом подписал пакет законов о применении ИИ на работе. Работодатель больше не может опираться только на автоматизированную систему при дисциплинарном взыскании или увольнении.

Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе
2 октября 2026 г.
Google вывел на орбиту спутник для проверки ИИ-инфраструктуры в космосе

Google подтвердил работу первого спутника Project Suncatcher. Эксперимент должен показать, выдержат ли TPU физические условия космоса — это ранняя проверка идеи орбитальной инфраструктуры для машинного обучения.

OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов
1 октября 2026 г.
OpenClaw представил Enterprise для пилотов корпоративных ИИ-агентов

OpenClaw открыл разработку Enterprise — платформы управления постоянными ИИ-агентами в корпоративной инфраструктуре. Проект пока предназначен для внутренних пилотов, но уже заявляет изоляцию задач, аудит и гибкую замену компонентов агента.

HydraFusion появился в VS Code и приложении GitHub Copilot
1 октября 2026 г.
HydraFusion появился в VS Code и приложении GitHub Copilot

GitHub расширил исследовательский предварительный доступ к HydraFusion: режим выбора нескольких моделей теперь доступен не только в Copilot CLI. Для команд это означает больше контроля над сложными задачами, но пока с условиями предварительного доступа.

IBM Bob разрешили запускать внутри закрытой инфраструктуры
1 октября 2026 г.
IBM Bob разрешили запускать внутри закрытой инфраструктуры

IBM добавила для своего агентного инструмента разработки Bob self-hosted-развёртывание. Компания позиционирует его для команд, которым нельзя отправлять код и контекст приложений во внешний облачный сервис.

Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам
1 октября 2026 г.
Google показала Gemini 4 Argon, но пока не отдаёт её разработчикам

Google представила Gemini 4 Argon — новую флагманскую модель для программирования, корпоративных задач и киберзащиты. Но первый доступ получили только доверенные защитники в программе Fairwind: публичный API и приложение Gemini пока не открыты.

Airbnb добавляет ИИ-поиск: голосом, своими словами и с сравнением жилья
30 сентября 2026 г.
Airbnb добавляет ИИ-поиск: голосом, своими словами и с сравнением жилья

Airbnb запустила в США ИИ-инструменты для планирования поездки: поиск и фильтры обычным языком, краткие описания объявлений и сравнение сохранённых вариантов. Для европейских пользователей важная оговорка: в анонсе эти функции не обещаны, зато доставка еды и продуктов расширяется в Европе лишь в отдельных городах.