Qwen учит ИИ-агентов тренироваться в симулированном мире, а не только в живом вебе
Qwen учит ИИ-агентов тренироваться в симулированном мире, а не только в живом вебе
Команда Alibaba Qwen открыла Qwen-AgentWorld-35B-A3B и AgentWorldBench — модель и бенчмарк для нового типа агентной инфраструктуры. Идея не в том, чтобы дать пользователю еще один чат-бот. Qwen-AgentWorld пытается моделировать среды, где агент действует: терминал, поиск, веб, Android, OS, SWE-задачи и MCP-инструменты.
Если обычная языковая модель предсказывает следующий текст, такая “модель мира” предсказывает, что произойдет после действия агента. Например: какую выдачу вернет поиск, что покажет терминал после команды, как изменится состояние интерфейса или где агент ошибется в последовательности шагов.
Зачем агентам симулятор
Сегодня сильные агенты часто учатся и проверяются в живых средах: реальных сайтах, репозиториях, терминалах и API. Это дорого, шумно и плохо контролируется. Среда меняется, сервисы блокируют автоматизацию, а ошибка агента может испортить файл, потратить деньги или увести процесс в сторону.
Qwen предлагает другой слой: сначала научить модель правдоподобно симулировать окружение, а затем использовать эту симуляцию как полигон для обучения и оценки агентов. По данным команды, Qwen-AgentWorld обучалась на более чем 10 млн траекторий взаимодействия с реальными средами. Открытая версия — MoE-модель 35B с 3B активных параметров и контекстом 256K.
Что показали тесты
В AgentWorldBench большая версия Qwen-AgentWorld-397B-A17B набрала 58,71 балла и, по данным авторов, обошла GPT-5.4 с 58,25. Открытая 35B-версия подняла результат базовой Qwen3.5-35B-A3B на 8,66 пункта. Эти цифры стоит читать осторожно: это бенчмарк от самих разработчиков, а не независимый стандарт.
Но направление важнее таблицы. Агентный ИИ упирается не только в “умную модель”, а в среду тренировки: где безопасно ошибаться, как воспроизводить сценарии, как проверять результат и как учить агента не ломать внешний мир. Если симуляторы станут достаточно надежными, разработчики смогут быстрее готовить агентов для рабочих интерфейсов, не превращая каждый эксперимент в поход по живым системам.













