Блог AST-SoftPro
Qwen-AgentWorld: Языковые мировые модели для универсальных агентов
23 июня 2026 года команда Qwen (Alibaba) представила Qwen-AgentWorld — первую языковую мировую модель, способную симулировать агентные среды в семи доменах через длинное цепочечное рассуждение (chain-of-thought). Это фундаментальный шаг в развитии ИИ-агентов: от моделей, которые просто отвечают на запросы, к моделям, которые понимают динамику среды и могут предсказывать последствия своих действий.
Что такое мировая модель?
Мировая модель — это модель, которая предсказывает динамику окружающей среды на основе текущих наблюдений и действий. В когнитивной науке и робототехнике это один из ключевых механизмов рассуждения и планирования: агент не просто реагирует на стимул, а строит внутреннее представление о мире и симулирует возможные исходы.
До Qwen-AgentWorld мировые модели в основном оперировали визуальными данными (Gato от DeepMind, Genie от Google DeepMind). Qwen-AgentWorld — первая модель, которая делает это на уровне языка, покрывая семь доменов агентных взаимодействий в рамках одной архитектуры.
Архитектура: MoE с двумя размерами
Qwen-AgentWorld выпускается в двух конфигурациях:
-
Qwen-AgentWorld-35B-A3B — 35 миллиардов параметров, 3 миллиарда активных
-
Qwen-AgentWorld-397B-A17B — 397 миллиардов параметров, 17 миллиардов активных
Обе используют MoE (Mixture of Experts) архитектуру, что позволяет активировать лишь часть параметров на каждый запрос, сохраняя производительность при снижении вычислительных затрат.
Семь доменов
Модель обучена симулировать среды в семи доменах:
-
MCP — Model Context Protocol, взаимодействие с инструментами
-
Search — веб-поиск и навигация
-
Terminal — командная строка и терминал
-
SWE — Software Engineering, разработка ПО
-
Web — взаимодействие с веб-интерфейсами
-
OS — операционные системы
-
Android — мобильные интерфейсы
Это первый случай, когда одна модель покрывает такой диапазон доменов — от низкоуровневых операций в терминале до высокоуровневых задач разработки.
Трехэтапный пайплайн обучения
Этап 1: Непрерывное предобучение (CPT)
На этом этапе модель получает общие способности к моделированию мира из динамики переходов состояний и расширенных профессиональных корпусов. Используется более 10 миллионов траекторий взаимодействий агентов с реальными средами.
Ключевая новация — Turn-Level Information-Theoretic Loss Masking: маскировка потерь на уровне туров, которая учит модель фокусироваться на информативных переходах состояний, а не на тривиальных повторах.
Этап 2: Надзорная тонкая настройка (SFT)
Активирует способность модели к рассуждению о следующем состоянии. На этом этапе модель учится строить длинные цепочки рассуждений (chain-of-thought) для предсказания, как изменится среда после действия агента.
Этап 3: Обучение с подкреплением (RL)
Затачивает точность симуляции через гибридную систему вознаграждений (rubric-and-rule rewards). Авторы столкнулись с несколькими проблемами стабильности:
-
Reward Collapse — коллапс вознаграждения из-за многопошагового расширения
-
Reward Hacking — модель учится хвалить себя вместо того, чтобы честно симулировать
-
Reward Shaping — необходимость формирования вознаграждения, чтобы направлять обучение
AgentWorldBench: новый бенчмарк
Для оценки языковых мировых моделей команда Qwen создала AgentWorldBench — комплексный бенчмарк, построенный на реальных взаимодействиях пяти передовых моделей на девяти устоявшихся бенчмарках:
-
Tool Decathlon
-
Terminal-Bench 1.0 и 2.0
-
OSWorld-Verified
-
и другие
Оценка проводится через Reference-Grounded Judging — судейство, привязанное к ground-truth данным, по пяти измерениям качества симуляции. Используется доменно-ориентированная система критериев (domain-aware rubrics) с дифференцированными критериями соответствия.
Эмпирические результаты показывают, что Qwen-AgentWorld значительно превосходит существующие передовые модели.
Применение 1: Симулятор среды
Qwen-AgentWorld работает как разъединённый симулятор среды для агентов:
-
Поддерживает масштабируемую и контролируемую симуляцию тысяч реальных сред для агентов RL
-
Дает прирост, превосходящий обучение только в реальных средах
-
Позволяет симулировать 4000 OpenClaw-сред для RL-обучения агентов без доменно-специфической адаптации
Абляция симулятора показывает: использование Qwen3.6-Plus как симулятора дает незначительный прирост, тогда как Qwen-AgentWorld-397B-A17B даёт существенный выигрыш. Это подтверждает, что качество мировой модели — это узкое горлышко для Sim RL.
Применение 2: Фундаментальная модель агентов
Второе применение — использование Qwen-AgentWorld как универсальной фундаментальной модели агентов:
-
Обучение мировой модели действует как эффективный warm-up
-
Улучшает результаты на 7 агентных бенчмарках
-
Работает на трёх полностью out-of-domain задачах без RL-тонкой настройки
-
Предоставляет первоначальную валидацию того, что языковые мировые модели могут служить фундаментом для построения более сильных агентов
Почему это важно
Qwen-AgentWorld решает фундаментальную проблему обучения агентов: реальные среды дороги и медленны. Каждый шаг агента в реальном терминале, браузере или операционной системе занимает секунды или минуты. Мировая модель позволяет симулировать эти среды в десятки раз быстрее, что критично для RL-обучения.
Кроме того, модель открывает путь к контролируемой симуляции: можно адаптировать среду (MCP Environment Adaptation), строить вымышленные миры (Search Fictional-World Construction) и тестировать агентов в условиях, которые невозможно воспроизвести в реальности.
Открытый исходный код
Как и принято в серии Qwen, модель доступна с открытым исходным кодом:
-
GitHub: QwenLM/Qwen-AgentWorld
-
HuggingFace: qwen-agentworld
-
Статья: arXiv:2606.24597
Выводы
Qwen-AgentWorld — это не просто новая модель, а новый подход к обучению агентов. Переход от «модели, которая отвечает» к «модели, которая понимает мир» — это шаг того же масштаба, что переход от чат-ботов к агентам. И если Sim RL действительно превзойдёт реальное обучение, как показывают результаты, мы можем ожидать ускорения развития агентов в ближайшие месяцы.