arXiv 2606.24597 · 2026-06 · Qwen Team 技术报告 · 顶级实验室

Qwen-AgentWorld:面向通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng 等 33 人 · arXiv 预印本(Qwen Team 技术报告) · 2026 · arXiv: 2606.24597
原题:Qwen-AgentWorld: Language World Models for General Agents
Open Access 新颖度 0.87

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

想让人工智能助手真正学会干活,光教它怎么出招还不够,还得让它明白每一步操作之后环境会变成什么样。

先设想一个场景:你在电脑终端里敲下一行删除文件的命令,按回车之前,你心里其实已经“预演”过结果——文件会消失,屏幕回到提示符。这种在脑子里预判“做了这个动作,世界会怎么变”的能力,科学家称之为世界模型。很多研究者认为它是通往通用智能的基石;甚至有学者从理论上证明,任何能在足够多任务上举一反三的智能体,内部一定已经学会了某种世界模型

过去几年,世界模型的明星大多出现在画面和物理世界里:有的能实时生成可以操控的游戏画面,有的能根据动作生成物理世界的下一段视频。可今天的大模型智能体,工作场所是另一种世界——由文字构成的数字环境:命令行终端、搜索引擎、各种工具接口、代码仓库,以及手机、网页、电脑桌面的界面。

作者指出,在“智能体—环境”这个互动循环里有两个互补的角色:策略(看到情况,决定做什么)和世界模型(给定情况和动作,预测接下来会发生什么)。然而现有研究几乎只在打磨策略这一侧,文字环境里还缺一个通用的世界模型

这个缺口还带来很实际的麻烦:用强化学习训练智能体,需要它在真实环境里反复试错,而真实环境成本高、速度慢、不好控制;另一类办法是工程师用代码批量搭建模拟环境,它可靠、能自动判分,但只适用于能被程序精确描述的领域,像搜索引擎这种开放世界就很难用代码写出来。

② 研究问题(要回答什么?)

这项研究想弄清楚,能不能训练出一个专门用文字模拟各种数字环境的大模型,并借助它让智能体变得更强。

打个比方:飞行员上天之前,要在飞行模拟器里练上几百小时。作者想做的,就是给人工智能智能体造一台“万能模拟器”——不过它不是用代码一点点搭出来的,而是一个读过海量真实操作记录、会自己推理“接下来屏幕上会出现什么”的大模型。作者把这类模型叫做语言世界模型

围绕这台模拟器,论文依次回答了四个问题。

具体如下:

③ 研究方法(怎么做的?)

作者的做法可以概括成三件事:备教材、分三步上课、出一套考卷

第一,备教材。模拟器要学的,是“动作→环境回应”这样一对对的记录。作者从三条渠道收集:自建一整套运行在 Ubuntu、macOS 电脑和安卓虚拟机上的环境,让智能体自动执行海量任务;从公开渠道收集终端录屏、开源工具调用日志等“野生”记录,再交给多个清洗智能体层层过滤;以及团队日常研发中积累的智能体轨迹。合计超过一千万条真实环境交互轨迹,覆盖七个领域。对手机、网页、桌面这三类图形界面,作者不给模型看截图,而是把界面写成一棵“文字版的界面结构树”。此外还加入了法律、医疗、金融、网络安全、工业制造、时事百科等专业知识语料——因为要模拟一个医院信息系统,得先懂点医学。

第二,分三步上课,作者的口号是“预训练注入、微调激活、强化学习打磨”:

第三,出考卷。作者搭建了 AgentWorldBench:请五个顶尖模型在九个知名智能体测试上真实跑任务,把真实环境的回应当“标准答案”,共 2170 道题,且与训练数据来源完全不重叠。

模型做了两种尺寸,都采用“混合专家”结构——好比一个大型专家团,每次只请其中一小部分人上场:大号总参数 3970 亿、每次激活 170 亿;小号总参数 350 亿、每次激活 30 亿。

④ 结果(发现了什么?)

这台专门训练的环境模拟器在模拟真实环境上拿下了总分第一,而用它当陪练或当热身,都让智能体在多项真实任务上明显进步。

① 模拟得像不像
在两千多道考题上(满分 100),大号模型总平均 58.71,超过总分第二的 GPT-5.4(58.25)和其余所有参与比较的顶级模型。和 GPT-5.4 相比,优势主要在终端(57.73 对 53.69)和软件工程(68.49 对 66.29)。小号模型经过训练从 47.73 涨到 56.39,一口气提高 8.66 分,已略超 Claude Sonnet 4.6。但在手机、网页、桌面这些图形界面上,它只排第五。搜索是所有模型最难模拟的领域,最高分也只有 37.82,约为软件工程最高分的一半。
② 当陪练:模拟环境里练出真本事
用它模拟出 4000 个个人助理类工作环境(排日程、处理邮件、管理文件等),智能体在里面练完后,在两个真实测试上分别从 65.4 升到 69.7、从 47.9 升到 55.0;换成没受过这种训练的通用模型当模拟器,几乎没有提升。更神奇的是虚构世界:作者让模拟器编出一千个完全虚构但内部自洽的“平行世界”(比如一份 2029 年的手机市场排行榜,品牌是真的,型号是编的),搜索智能体只在这些假世界里练习,到真实的大规模信息搜集测试上,得分从 34.02 涨到 50.31,还超过了用真实搜索引擎训练的 45.6。
③ 当热身课:先学预测,再去干活
只让智能体做“预测下一步环境会怎样”的练习——不调用任何工具、每道题只有一轮——之后直接去考七个需要多轮使用工具的测试,七项全部上涨:终端任务 33.25→39.55,高难度软件工程任务 42.18→47.42;三个训练里完全没出现过的领域也涨了约九到十一分。智能体在思考中“预判环境回应”的准确率从 69.9% 升到 78.3%。

还有一个细节:只拿终端这一个领域的数据做强化学习,软件工程、搜索、工具接口三个没练过的领域也一起变好——说明模型学到的是“环境一般怎么回应动作”的通用规律,而不是某个领域的格式套路。

⑤ 讨论(这些发现说明什么?)

这项研究最值得玩味的地方,是它改变了智能体从哪里获得练习机会这件事。

过去,智能体要么在真实环境里练(贵、慢、不可控),要么在工程师用代码搭好的环境里练(可靠,但只能覆盖能写成程序的领域)。现在多了第三条路:一个学会了“环境如何回应”的大模型本身就能充当环境。它的好处不只是便宜,更在于可以按指令调控——可以故意制造间歇性报错、分页返回、只给一半结果,专门戳智能体的软肋;也可以编出整个虚构世界,逼着搜索智能体老老实实去搜,而不是靠记忆作答。实验里一个很说明问题的现象:在模拟世界里练的智能体学会了更多地“打开网页看全文”(每条任务从 2.5 次增加到 4 次),而在真实搜索引擎里练的反而越来越少点开网页(降到 1.5 次)。

第二个启发是先想后做。作者翻看智能体的思考记录,发现热身后的模型会在动手前先在脑子里模拟环境的反应。比如一道配置邮件服务器的题,热身后的模型正确预判“只改路由设置没用,因为服务器在查路由之前就会先拒收未知收件人”,于是直接改对了地方;热身前的模型预判错了,一直瞎试到超时。

当然也要看到它的分寸

⑥ 结论(最终结论 + 启示)

这篇论文把世界模型从画面和物理世界搬进了智能体每天打交道的文字环境,并证明它既能当陪练场,也能当热身课。

它交出了三样东西:一个能在单一模型里模拟七类数字环境的模型家族,一套拿真实环境回应当标准答案的评测考卷,以及两条让智能体变强的路线。

作为陪练场,它的价值不在于完全替代真实环境,而在于提供真实环境给不了的东西:规模(一次铺开几千个环境)和可控(想让它报错就报错,想编一个世界就编一个世界)。作为热身课,它说明“预测环境会怎样”本身就是一种可以迁移的能力——学会想象后果的智能体,在从没见过的任务上也更会做事。

作者在结尾给出的判断是:语言世界模型为扩展通用智能体打开了一条新的坐标轴,让智能体的成长不再只受限于真实环境能提供多少互动。接下来他们想做的,包括让智能体和世界模型互相出题、共同进化,把截图和文字结合起来做多模态世界模型,以及学会判断什么时候该用模拟器、什么时候该回到真实环境。

对普通读者来说,一个值得记住的启示是:会“想象后果”,可能是比会“多试几次”更高效的学习方式

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流:世界模型——基于当前观测与动作预测环境动态——被广泛视为通用智能的基础(LeCun 2022;Hafner et al. 2023/2025;Ball et al. 2025;Ali et al. 2025;Assran et al. 2025)。Richens et al.(2025)进一步证明:任何能在足够宽的任务范围上泛化的智能体都必然学到了世界模型;Cifuentes(2026)将其推广到部分可观测与随机情形。视觉与具身领域已有 IRIS、DreamerV3/Dreamer 4、Cosmos、Genie 3、GameNGen、V-JEPA 2、UniSim 等实例。

文献空白

本文贡献

I. Theoretical Framework & Hypotheses(理论框架与假设)

形式化:语言世界模型(LWM)是给定交互历史与当前动作、预测下一环境观测的条件文本生成器:ôt+1 = fθ(c, o≤t, a≤t),训练目标为真实观测 ot+1;CPT 阶段把语言建模目标直接映射为 p(ot+1 | o≤t, a≤t)c 为系统提示,含五部分:任务描述、动作空间、初始状态、示例(可选 few-shot)、模拟指令(可控条件,如“在 web_search 结果中隐藏答案”)。

统一轨迹模式:环境轨迹即智能体与环境的多轮对话——user 轮承载动作、assistant 轮承载环境观测;可从智能体轨迹中剥离推理、仅保留(动作, 观测)对得到。无状态环境(Search)的状态隐含于对话历史,有状态环境(Terminal、OS)维护显式内部状态。三类 GUI 域以无障碍树与 UI 视图层级而非像素帧表示观测。

领域动作观测核心能力
MCPJSON 工具调用工具返回(文件、数据库等)事实性世界知识
SearchWeb Search / Extractor对话历史(查询+结果)事实性世界知识
SWERead / Edit / Bash工具输出(文件内容+diff)代码执行推理
TerminalBash 命令 / 按键stdout + shell 提示符长上下文因果推理
Android点击 / 滑动 / 输入UI 视图层级 + 应用状态视觉状态推理
Web点击 / 输入 / 导航无障碍树 + 浏览器状态视觉状态推理
OS鼠标 / 键盘无障碍树 + 窗口/应用状态视觉状态推理

研究问题

编号问题对应设定
RQ1单一 LWM 能否在 7 域上达到或超过前沿模型的模拟保真度AgentWorldBench 五维量表 + 规则验证(可控性/错误处理/长上下文一致性)
RQ2LWM 学到的是可迁移的环境知识还是领域格式仅用 Terminal 数据做 Stage 3 RL,评测其余文本域
RQ3作为解耦模拟器能否支撑可扩展、可控的 Sim RL 并迁移到真实环境OpenClaw 环境扩展、MCP 环境适配、Search 虚构世界构造
RQ4作为统一底座,LWM 训练能否作为预热提升下游智能体LWM RL 后不再微调,直接评测 7 个多轮工具基准

理论依据:Richens et al.(2025)“通用智能体必含世界模型”定理;LeCun(2022)统一的世界模型—执行者架构;视觉—语言—动作研究中的 World Action Model 范式(Ye et al. 2026b)。

M. Materials & Methods(材料与方法)

R. Results(结果)

R1 · 模拟保真度(AgentWorldBench 五维量表均值,0–100,Table 5 节选)

模型MCPSearchTerm.SWEAndroidWebOS均值
Claude Opus 4.854.9335.1459.1864.1061.5054.6666.6256.59
Claude Opus 4.669.9029.3057.5164.5561.7451.4270.2057.80
GPT-5.470.1037.2653.6966.2960.0051.8068.5858.25
Gemini 3.1 Pro59.0730.2152.4759.0761.4052.8366.9254.57
Qwen3.5-35B-A3B(基座)57.8725.9846.1347.5853.1847.1056.2747.73
Qwen-AgentWorld-35B-A3B64.7936.6953.9665.6358.1749.5565.9256.39
Qwen3.5-397B-A17B(基座)68.3130.8155.3064.4454.9048.5560.8554.74
Qwen-AgentWorld-397B-A17B68.2437.8257.7368.4960.2050.9867.8958.71

R3 · 下游智能体收益(Table 6–9)

范式设置基准Δ
模拟器 · 环境扩展4k OpenClaw 模拟环境,35B 策略,397B 作模拟器Claw-Eval65.469.7+4.3
同上同上QwenClawBench47.955.0+7.1
模拟器 · 环境适配MCP 受控模拟,35B-SFT 策略Tool Decathlon32.436.1+3.7
同上同上MCPMark 均值21.533.8+12.3
模拟器 · 虚构世界1k 虚构搜索世界,35B-SFTWideSearch F1 Item / Row34.02 / 13.7250.31 / 24.21+16.29 / +10.49
同上397B-SFTWideSearch F1 Item / Row70.11 / 45.6973.98 / 51.74+3.87 / +6.05
底座 · LWM RL 预热35B-SFT,域内Terminal-Bench 2.033.2539.55+6.30
同上域内SWE-Bench Verified / Pro64.47 / 42.1867.86 / 47.42+3.39 / +5.24
同上域内WideSearch F1 Item / Row33.38 / 13.2746.17 / 20.14+12.79 / +6.87
同上域外Claw-Eval / QwenClawBench53.60 / 39.7664.88 / 49.43+11.28 / +9.67
同上域外BFCL v4 均值62.2971.25+8.96

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((语言世界模型))
    I 引言
      世界模型是通用智能基石
      智能体研究偏重策略端
      文本环境缺通用世界模型
      既有工作多为单域微调
      代码合成环境覆盖受限
    R 问题
      单模型模拟七类环境
      如何评测模拟保真度
      能否充当强化学习陪练
      能否作为智能体预热
    M 方法
      两档MoE规模
      逾千万条真实交互轨迹
      预训练注入 微调激活
      强化学习打磨保真
      逐轮信息论损失掩码
      量表加规则九比一奖励
      自建2170样本评测集
    R 结果
      总分58.71居首
      领先次席仅0.46分
      图形界面域排第五
      终端单域训练可迁移
      虚构世界训练胜真实
      预热七项基准全涨
      域外基准涨约9到11分
    a 讨论
      RL数据来源被改写
      可控性是模拟前提
      先预测后行动
      事实性仍是最弱项
      评测集由团队自建
    D 结论
      世界模型进入文本环境
      陪练场与热身课
      扩展智能体新坐标轴
      下一步多模态与共进化

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。