🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
想让人工智能助手真正学会干活,光教它怎么出招还不够,还得让它明白每一步操作之后环境会变成什么样。
先设想一个场景:你在电脑终端里敲下一行删除文件的命令,按回车之前,你心里其实已经“预演”过结果——文件会消失,屏幕回到提示符。这种在脑子里预判“做了这个动作,世界会怎么变”的能力,科学家称之为世界模型。很多研究者认为它是通往通用智能的基石;甚至有学者从理论上证明,任何能在足够多任务上举一反三的智能体,内部一定已经学会了某种世界模型。
过去几年,世界模型的明星大多出现在画面和物理世界里:有的能实时生成可以操控的游戏画面,有的能根据动作生成物理世界的下一段视频。可今天的大模型智能体,工作场所是另一种世界——由文字构成的数字环境:命令行终端、搜索引擎、各种工具接口、代码仓库,以及手机、网页、电脑桌面的界面。
作者指出,在“智能体—环境”这个互动循环里有两个互补的角色:策略(看到情况,决定做什么)和世界模型(给定情况和动作,预测接下来会发生什么)。然而现有研究几乎只在打磨策略这一侧,文字环境里还缺一个通用的世界模型。
这个缺口还带来很实际的麻烦:用强化学习训练智能体,需要它在真实环境里反复试错,而真实环境成本高、速度慢、不好控制;另一类办法是工程师用代码批量搭建模拟环境,它可靠、能自动判分,但只适用于能被程序精确描述的领域,像搜索引擎这种开放世界就很难用代码写出来。
② 研究问题(要回答什么?)
这项研究想弄清楚,能不能训练出一个专门用文字模拟各种数字环境的大模型,并借助它让智能体变得更强。
打个比方:飞行员上天之前,要在飞行模拟器里练上几百小时。作者想做的,就是给人工智能智能体造一台“万能模拟器”——不过它不是用代码一点点搭出来的,而是一个读过海量真实操作记录、会自己推理“接下来屏幕上会出现什么”的大模型。作者把这类模型叫做语言世界模型。
围绕这台模拟器,论文依次回答了四个问题。
具体如下:
- 问题一:能不能造出来?一个模型能否同时模拟七类环境——工具接口、搜索引擎、命令行终端、软件工程、安卓手机、网页和电脑桌面,并且模拟得足够逼真?
- 问题二:怎么判断像不像?需要一套公平的考卷,拿模型的“预测”去对照真实环境的“实际回应”。
- 问题三:能不能当陪练?把它和智能体分开,让智能体在模拟环境里做强化学习,练出来的本事能不能搬到真实世界去用,甚至比在真实环境里练得更好?
- 问题四:能不能当热身课?让智能体自己先学会“预测环境”,再去做真正的任务,会不会变成更好的智能体?
③ 研究方法(怎么做的?)
作者的做法可以概括成三件事:备教材、分三步上课、出一套考卷。
第一,备教材。模拟器要学的,是“动作→环境回应”这样一对对的记录。作者从三条渠道收集:自建一整套运行在 Ubuntu、macOS 电脑和安卓虚拟机上的环境,让智能体自动执行海量任务;从公开渠道收集终端录屏、开源工具调用日志等“野生”记录,再交给多个清洗智能体层层过滤;以及团队日常研发中积累的智能体轨迹。合计超过一千万条真实环境交互轨迹,覆盖七个领域。对手机、网页、桌面这三类图形界面,作者不给模型看截图,而是把界面写成一棵“文字版的界面结构树”。此外还加入了法律、医疗、金融、网络安全、工业制造、时事百科等专业知识语料——因为要模拟一个医院信息系统,得先懂点医学。
第二,分三步上课,作者的口号是“预训练注入、微调激活、强化学习打磨”:
- 预训练(注入):让模型大量阅读交互记录,学会“工具会返回什么、状态怎么变化”。这里有个巧思:很多回合只是工具把输入原样“复读”一遍,没有新信息,学它反而添乱。作者用四个简单的统计量给每个回合归类,“复读型”回合只保留百分之五参与学习,“读取文件、返回内容”这种信息量大的回合则全部保留。
- 监督微调(激活):教模型在给出预测前先写下推理过程——这个动作要干什么、之前的状态是什么、回应应该长什么样。候选题一万零二百五十道,经过三选一和打分淘汰,留下七千零九十四道。
- 强化学习(打磨):请一位“AI 阅卷老师”从格式、事实、前后一致、逼真、完整简洁五个方面打分,再配上一部分能用程序严格判对错的题目,两者按九比一混合成奖励。作者还专门堵住了模型“自夸刷分”的漏洞——比如在预测里硬塞“操作已全部成功完成”这类讨好阅卷老师的话。
第三,出考卷。作者搭建了 AgentWorldBench:请五个顶尖模型在九个知名智能体测试上真实跑任务,把真实环境的回应当“标准答案”,共 2170 道题,且与训练数据来源完全不重叠。
模型做了两种尺寸,都采用“混合专家”结构——好比一个大型专家团,每次只请其中一小部分人上场:大号总参数 3970 亿、每次激活 170 亿;小号总参数 350 亿、每次激活 30 亿。
④ 结果(发现了什么?)
这台专门训练的环境模拟器在模拟真实环境上拿下了总分第一,而用它当陪练或当热身,都让智能体在多项真实任务上明显进步。
在两千多道考题上(满分 100),大号模型总平均 58.71,超过总分第二的 GPT-5.4(58.25)和其余所有参与比较的顶级模型。和 GPT-5.4 相比,优势主要在终端(57.73 对 53.69)和软件工程(68.49 对 66.29)。小号模型经过训练从 47.73 涨到 56.39,一口气提高 8.66 分,已略超 Claude Sonnet 4.6。但在手机、网页、桌面这些图形界面上,它只排第五。搜索是所有模型最难模拟的领域,最高分也只有 37.82,约为软件工程最高分的一半。
用它模拟出 4000 个个人助理类工作环境(排日程、处理邮件、管理文件等),智能体在里面练完后,在两个真实测试上分别从 65.4 升到 69.7、从 47.9 升到 55.0;换成没受过这种训练的通用模型当模拟器,几乎没有提升。更神奇的是虚构世界:作者让模拟器编出一千个完全虚构但内部自洽的“平行世界”(比如一份 2029 年的手机市场排行榜,品牌是真的,型号是编的),搜索智能体只在这些假世界里练习,到真实的大规模信息搜集测试上,得分从 34.02 涨到 50.31,还超过了用真实搜索引擎训练的 45.6。
只让智能体做“预测下一步环境会怎样”的练习——不调用任何工具、每道题只有一轮——之后直接去考七个需要多轮使用工具的测试,七项全部上涨:终端任务 33.25→39.55,高难度软件工程任务 42.18→47.42;三个训练里完全没出现过的领域也涨了约九到十一分。智能体在思考中“预判环境回应”的准确率从 69.9% 升到 78.3%。
还有一个细节:只拿终端这一个领域的数据做强化学习,软件工程、搜索、工具接口三个没练过的领域也一起变好——说明模型学到的是“环境一般怎么回应动作”的通用规律,而不是某个领域的格式套路。
⑤ 讨论(这些发现说明什么?)
这项研究最值得玩味的地方,是它改变了智能体从哪里获得练习机会这件事。
过去,智能体要么在真实环境里练(贵、慢、不可控),要么在工程师用代码搭好的环境里练(可靠,但只能覆盖能写成程序的领域)。现在多了第三条路:一个学会了“环境如何回应”的大模型本身就能充当环境。它的好处不只是便宜,更在于可以按指令调控——可以故意制造间歇性报错、分页返回、只给一半结果,专门戳智能体的软肋;也可以编出整个虚构世界,逼着搜索智能体老老实实去搜,而不是靠记忆作答。实验里一个很说明问题的现象:在模拟世界里练的智能体学会了更多地“打开网页看全文”(每条任务从 2.5 次增加到 4 次),而在真实搜索引擎里练的反而越来越少点开网页(降到 1.5 次)。
第二个启发是先想后做。作者翻看智能体的思考记录,发现热身后的模型会在动手前先在脑子里模拟环境的反应。比如一道配置邮件服务器的题,热身后的模型正确预判“只改路由设置没用,因为服务器在查路由之前就会先拒收未知收件人”,于是直接改对了地方;热身前的模型预判错了,一直瞎试到超时。
当然也要看到它的分寸:
- 模拟保真度虽然总分第一,但只比第二名高 0.46 分,谈不上碾压;在另一套用程序严格判分的检验里,GPT-5.4 反而排第一(72.93 对 67.12)。
- 它只看文字不看截图,图形界面的模拟排第五,作者自己也承认这是缺少多模态预训练的代价。
- “事实准确”始终是五个评分维度里最弱的一项,搜索仍然很难模拟。
- 不加控制指令的模拟训练在工具接口任务上毫无收益,甚至略降;而控制指令是从经过验证的真实轨迹里整理出来的,这意味着模拟器暂时还离不开真实数据打底。
- 考卷由作者团队自建、由另一个大模型阅卷;不过作者用三位不同的 AI 阅卷老师交叉检验,模型排名高度一致。
⑥ 结论(最终结论 + 启示)
这篇论文把世界模型从画面和物理世界搬进了智能体每天打交道的文字环境,并证明它既能当陪练场,也能当热身课。
它交出了三样东西:一个能在单一模型里模拟七类数字环境的模型家族,一套拿真实环境回应当标准答案的评测考卷,以及两条让智能体变强的路线。
作为陪练场,它的价值不在于完全替代真实环境,而在于提供真实环境给不了的东西:规模(一次铺开几千个环境)和可控(想让它报错就报错,想编一个世界就编一个世界)。作为热身课,它说明“预测环境会怎样”本身就是一种可以迁移的能力——学会想象后果的智能体,在从没见过的任务上也更会做事。
作者在结尾给出的判断是:语言世界模型为扩展通用智能体打开了一条新的坐标轴,让智能体的成长不再只受限于真实环境能提供多少互动。接下来他们想做的,包括让智能体和世界模型互相出题、共同进化,把截图和文字结合起来做多模态世界模型,以及学会判断什么时候该用模拟器、什么时候该回到真实环境。
对普通读者来说,一个值得记住的启示是:会“想象后果”,可能是比会“多试几次”更高效的学习方式。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流:世界模型——基于当前观测与动作预测环境动态——被广泛视为通用智能的基础(LeCun 2022;Hafner et al. 2023/2025;Ball et al. 2025;Ali et al. 2025;Assran et al. 2025)。Richens et al.(2025)进一步证明:任何能在足够宽的任务范围上泛化的智能体都必然学到了世界模型;Cifuentes(2026)将其推广到部分可观测与随机情形。视觉与具身领域已有 IRIS、DreamerV3/Dreamer 4、Cosmos、Genie 3、GameNGen、V-JEPA 2、UniSim 等实例。
文献空白:
- 在智能体—环境循环中,策略(状态→动作)与世界模型(状态, 动作→后继状态)互补,但 LLM 智能体研究几乎只关注策略侧,语言环境仍缺通用世界模型。
- 既有语言世界模型多为单域、事后微调:Web(WebDreamer、WMA、WebWorld、DynaWeb)、SWE(SWE-World、CWM)、搜索(ZeroSearch、SSRL)、GUI(Code2World、CUWM、MobileDreamer)、τ-bench(Simia);Wang et al.(2024)表明现成 LLM 仍是不可靠的文本世界模拟器。
- Qian et al.(2026)的负面结果显示现有智能体不会把世界模型当作前瞻工具来用——作者据此主张世界建模应从 CPT 起即作为原生训练目标,而非训练后“外挂”。
- 代码驱动的环境合成(AWM、Agent-World 近 2000 个环境、EnvScaler、ScaleEnv 等)执行确定、奖励可验证,但只覆盖可被程序规格化的领域;搜索引擎、真实 MCP 服务器等难以用代码合成。
本文贡献:
- 提出 Qwen-AgentWorld-35B-A3B / 397B-A17B,作者称其为首个在单一模型内以长思维链模拟 7 个智能体领域(MCP、Search、Terminal、SWE、Android、Web、OS)的原生语言世界模型族,基于逾 1000 万条真实环境交互轨迹,经“CPT 注入—SFT 激活—RL 打磨”三阶段训练。
- 构建 AgentWorldBench:5 个前沿模型在 9 个既有基准上的真实交互、2170 个样本、参照真实观测的五维量表评审,另配规则验证器。
- 系统研究世界建模增强通用智能体的两条互补范式:解耦的环境模拟器(可扩展、可控的 Sim RL)与统一的智能体底座(LWM 训练作为下游智能体 RL 前的预热)。
I. Theoretical Framework & Hypotheses(理论框架与假设)
形式化:语言世界模型(LWM)是给定交互历史与当前动作、预测下一环境观测的条件文本生成器:ôt+1 = fθ(c, o≤t, a≤t),训练目标为真实观测 ot+1;CPT 阶段把语言建模目标直接映射为 p(ot+1 | o≤t, a≤t)。c 为系统提示,含五部分:任务描述、动作空间、初始状态、示例(可选 few-shot)、模拟指令(可控条件,如“在 web_search 结果中隐藏答案”)。
统一轨迹模式:环境轨迹即智能体与环境的多轮对话——user 轮承载动作、assistant 轮承载环境观测;可从智能体轨迹中剥离推理、仅保留(动作, 观测)对得到。无状态环境(Search)的状态隐含于对话历史,有状态环境(Terminal、OS)维护显式内部状态。三类 GUI 域以无障碍树与 UI 视图层级而非像素帧表示观测。
| 领域 | 动作 | 观测 | 核心能力 |
|---|---|---|---|
| MCP | JSON 工具调用 | 工具返回(文件、数据库等) | 事实性世界知识 |
| Search | Web Search / Extractor | 对话历史(查询+结果) | 事实性世界知识 |
| SWE | Read / Edit / Bash | 工具输出(文件内容+diff) | 代码执行推理 |
| Terminal | Bash 命令 / 按键 | stdout + shell 提示符 | 长上下文因果推理 |
| Android | 点击 / 滑动 / 输入 | UI 视图层级 + 应用状态 | 视觉状态推理 |
| Web | 点击 / 输入 / 导航 | 无障碍树 + 浏览器状态 | 视觉状态推理 |
| OS | 鼠标 / 键盘 | 无障碍树 + 窗口/应用状态 | 视觉状态推理 |
研究问题:
| 编号 | 问题 | 对应设定 |
|---|---|---|
| RQ1 | 单一 LWM 能否在 7 域上达到或超过前沿模型的模拟保真度 | AgentWorldBench 五维量表 + 规则验证(可控性/错误处理/长上下文一致性) |
| RQ2 | LWM 学到的是可迁移的环境知识还是领域格式 | 仅用 Terminal 数据做 Stage 3 RL,评测其余文本域 |
| RQ3 | 作为解耦模拟器能否支撑可扩展、可控的 Sim RL 并迁移到真实环境 | OpenClaw 环境扩展、MCP 环境适配、Search 虚构世界构造 |
| RQ4 | 作为统一底座,LWM 训练能否作为预热提升下游智能体 | LWM RL 后不再微调,直接评测 7 个多轮工具基准 |
理论依据:Richens et al.(2025)“通用智能体必含世界模型”定理;LeCun(2022)统一的世界模型—执行者架构;视觉—语言—动作研究中的 World Action Model 范式(Ye et al. 2026b)。
M. Materials & Methods(材料与方法)
- 架构与规模:两档 MoE——35B-A3B(总参 350 亿/激活 30 亿)与 397B-A17B(总参 3970 亿/激活 170 亿),分别以同架构的 Qwen3.5-35B-A3B、Qwen3.5-397B-A17B 基座检查点为起点训练;正文未披露专家数、层数与 CPT token 总量。
- 数据来源(三路):① 自建智能体基础设施(容器沙箱、MCP 服务器、持久终端,及 Ubuntu/macOS/Android 虚拟机上的 GUI 环境,自动合成任务并端到端执行,为主要来源);② 公开交互痕迹(终端录屏、开源工具调用日志、代码执行痕迹,经多智能体清洗管线);③ 内部 SFT 智能体轨迹。合计逾 1000 万条、覆盖 7 域(摘要口径)。三阶段数据池严格不相交:CPT 取①②与专业知识语料,SFT 与 RL 仅取内部轨迹。
- SFT / RL 数据(Table 2):SFT 7094 条、RL 训练 92308 条,平均 19443 token、13.4 轮。分域 SFT/RL:MCP 179/4156,Search 1042/20004,Terminal 1580/34125,SWE 249/8181,Android 1337/11498,Web 1605/8716,OS 1102/5628。
- 预处理:轨迹逐轮展开为预测样本(训练集每条轨迹随机取一轮);剔除少于两轮、调用未声明工具、受环境故障污染的轨迹,并做“重试循环跳过”(保留状态链)与 GUI“无变化回合过滤”。
- 系统提示模板:以 AutoResearch 自动迭代(每次 10 轮、12 路并行)得到 v0–v11 共 12 个模板(约 30 至 1100 行),经人工审核;RL 用 v0、CPT 用 v1、SFT 从 v2–v11 随机抽取。
- Stage 1 · CPT(注入):非思考模式、标准下一 token 预测;加入工业控制与制造、网络安全、法律法规、医疗健康、金融、时事与百科等专业世界知识语料(单轮样本)。逐轮信息论损失掩码:以动作/观测词集计算
OL = |Wact∩Wobs| / |Wact|、Nov = |Wobs∖Wact| / |Wobs|、Jac(词集交并比)与字符长度比R = |obs| / |act|,把回合归入 7 类并按比例保留损失(被掩码回合仍作上下文):检索 100%、扩展 100%、动作 100%、变换 50%、样板 10%、回显 5%、其他 100%,从而把“学下一状态”与“学下一 token”解耦。 - Stage 2 · SFT(激活):切换为带显式推理链的思考轨迹,损失同 CPT;上下文窗口 256k;每样本从 10 个模板变体中均匀替换系统提示;每个查询由通用推理模型生成 3 个 rollout,独立评审两两比较选优、低于阈值则丢弃——10250 个候选保留 7094 条(69.2%)。
- Stage 3 · RL(打磨):算法 GSPO;提示上限 128k token(历史常达数万 token 而输出仅数百至数千 token,算力主要耗在提示处理)。奖励 = 五维量表(LLM 评审,各 1–5 分,总分 = 均值×5 ∈ [5, 25],无效评分记 0)与规则验证器(0/1 放缩到 [0, 25])按 9:1 混合;多策略 JSON 解析与严格标签提取,只把预测观测交给评审。
- 稳定性处理:多轮展开使样本共享长前缀、奖励崩塌(类似 Echo Trap)→ RL 池每条轨迹只展开一轮;对照的 Reference-Reward(与初始策略两两比较,0/1)收敛慢,Turing-Test Reward 几乎不收敛;针对“自夸式”奖励作弊采用规则锚定、内容类型分类(确定性内容须精确匹配)与思考/预测严格分离三重缓解。
- 评测集 AgentWorldBench:5 个前沿智能体(文本域以 Claude Opus 4.6 为主,GUI 域另加 3 个 Qwen 系模型)在 9 个基准(如 Tool Decathlon、Terminal-Bench 1.0 & 2.0、OSWorld-Verified)上的真实轨迹;每条文本轨迹取首轮、末轮与 3 个中间轮后随机保留 50%,共 2170 样本,文本四域占 72.4%(SWE 21.8%、Search 21.1%、Terminal 16.3%、MCP 13.2%)、GUI 三域各 9.2%;训练与评测按数据源切分,保证分布外。
- 评审协议:参照式评审(评审可见真实观测),五维 Format / Factuality / Consistency / Realism / Quality 均值归一到 0–100;确定性内容须精确匹配,预置环境内容与运行时元数据(时间戳、PID)只验格式与合理范围;以双盲图灵测试校准评审。Gemini 3 Flash、Claude Sonnet 4.5、GPT-5.2 三评审的模型排名 Spearman
ρ = 0.92–0.99(均p < 10−5),选图灵测试准确率最高的 GPT-5.2。 - 对照与设置:14 个基线(前沿闭源 5、开放权重 4、未经 LWM 训练的 Qwen 系 5);温度 0.6,支持时开启思考模式,开放权重模型以 SGLang 部署。附录另设规则验证三轴:可控性(Ctrl)、错误处理(Err)、长上下文一致性(LC)。
R. Results(结果)
R1 · 模拟保真度(AgentWorldBench 五维量表均值,0–100,Table 5 节选)
| 模型 | MCP | Search | Term. | SWE | Android | Web | OS | 均值 |
|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 54.93 | 35.14 | 59.18 | 64.10 | 61.50 | 54.66 | 66.62 | 56.59 |
| Claude Opus 4.6 | 69.90 | 29.30 | 57.51 | 64.55 | 61.74 | 51.42 | 70.20 | 57.80 |
| GPT-5.4 | 70.10 | 37.26 | 53.69 | 66.29 | 60.00 | 51.80 | 68.58 | 58.25 |
| Gemini 3.1 Pro | 59.07 | 30.21 | 52.47 | 59.07 | 61.40 | 52.83 | 66.92 | 54.57 |
| Qwen3.5-35B-A3B(基座) | 57.87 | 25.98 | 46.13 | 47.58 | 53.18 | 47.10 | 56.27 | 47.73 |
| Qwen-AgentWorld-35B-A3B | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 |
| Qwen3.5-397B-A17B(基座) | 68.31 | 30.81 | 55.30 | 64.44 | 54.90 | 48.55 | 60.85 | 54.74 |
| Qwen-AgentWorld-397B-A17B | 68.24 | 37.82 | 57.73 | 68.49 | 60.20 | 50.98 | 67.89 | 58.71 |
- 总体:397B 均值 58.71 居首,高于 GPT-5.4(58.25)0.46;文本四域均值 58.07 对 56.84(+1.23),相对 GPT-5.4 的优势最明显于 Terminal 与 SWE。分列看 MCP 最高为 GPT-5.4(70.10),Terminal 与 Web 最高为 Claude Opus 4.8。GUI 三域均值本模型 59.69 列第五(Claude Opus 4.6 以 61.12 居首),作者归因于缺少多模态预训练。Search 对所有模型最难,最佳 37.82 约为 SWE 或 MCP 最佳分的一半。
- 世界模型训练的净效应:397B 由 54.74 升至 58.71(文本域 +3.35、GUI 域 +4.92);35B 提升 8.66,反超 Claude Sonnet 4.6(56.04)0.35。同架构家族但未经 LWM 训练的 Qwen3.6-Plus(50.81)、Qwen3.6-Max-Preview(52.42)明显更低,增益并非来自基座通用能力。
- R2 · 跨域泛化:在 Qwen3.5-35B-A3B-SFT(经 CPT 与通用 SFT、无世界模型训练)上仅用 Terminal 数据做 Stage 3 RL,100 步内 Terminal 32.8→47.0(+14.2),未训练的 SWE 52.0→63.5(+11.5)、Search 20.2→32.0(+11.8)、MCP 53.5→58.5(+5.0),增益在前 10 步即出现并保持稳定。
- 规则验证(附录 C,Table 10):GPT-5.4 以 72.93 居首,本模型 397B 为 67.12 列第二;相对基座 35B 48.21→57.28、397B 60.04→67.12。
- RL 训练动态(35B,440 步):Consistency 绝对提升最大(2.81→3.10,+0.29),Quality 最小(+0.11);Format 与 Quality 90 步内完成 90% 提升,Consistency 与 Realism 需约 250 步;Factuality 相对提升最大(2.03→2.26,+11.3%)但始终最低。
R3 · 下游智能体收益(Table 6–9)
| 范式 | 设置 | 基准 | 前 | 后 | Δ |
|---|---|---|---|---|---|
| 模拟器 · 环境扩展 | 4k OpenClaw 模拟环境,35B 策略,397B 作模拟器 | Claw-Eval | 65.4 | 69.7 | +4.3 |
| 同上 | 同上 | QwenClawBench | 47.9 | 55.0 | +7.1 |
| 模拟器 · 环境适配 | MCP 受控模拟,35B-SFT 策略 | Tool Decathlon | 32.4 | 36.1 | +3.7 |
| 同上 | 同上 | MCPMark 均值 | 21.5 | 33.8 | +12.3 |
| 模拟器 · 虚构世界 | 1k 虚构搜索世界,35B-SFT | WideSearch F1 Item / Row | 34.02 / 13.72 | 50.31 / 24.21 | +16.29 / +10.49 |
| 同上 | 397B-SFT | WideSearch F1 Item / Row | 70.11 / 45.69 | 73.98 / 51.74 | +3.87 / +6.05 |
| 底座 · LWM RL 预热 | 35B-SFT,域内 | Terminal-Bench 2.0 | 33.25 | 39.55 | +6.30 |
| 同上 | 域内 | SWE-Bench Verified / Pro | 64.47 / 42.18 | 67.86 / 47.42 | +3.39 / +5.24 |
| 同上 | 域内 | WideSearch F1 Item / Row | 33.38 / 13.27 | 46.17 / 20.14 | +12.79 / +6.87 |
| 同上 | 域外 | Claw-Eval / QwenClawBench | 53.60 / 39.76 | 64.88 / 49.43 | +11.28 / +9.67 |
| 同上 | 域外 | BFCL v4 均值 | 62.29 | 71.25 | +8.96 |
- 模拟器质量是关键:以未经 LWM 训练的 Qwen3.6-Plus 作模拟器,Claw-Eval / QwenClawBench 仅为 66.7 / 47.8。
- 可控性是 Sim RL 的前提:MCP 上无控制指令的 Sim RL 使 Tool Decathlon 反降至 31.5、MCPMark 仅 24.6;受控后 36.1 / 33.8(Postgres +19.0、Notion +17.9、Filesys +13.3,Playwright 与 GitHub 无变化)。
- Sim RL 对 Real RL(WideSearch,35B):F1 Item 50.3% 对 45.6%;两者均把 web_search 从约 5 次降到约 3.5 次/轨迹,但 web_extractor 调用 Sim RL 由 2.5 升至 4.0、Real RL 由 2.5 降至 1.5。
- 预热机制:思考中含显式下一状态预测的回合,预测准确率由 69.9% 升至 78.3%(+8.4);LWM 推理分析中 129 个回合出现 1347 次“Wait!”式自我纠正(平均 10.4 次/回合,Terminal 16.9、MCP 12.7,单回合峰值 56)。
a / D. Discussion & Conclusion(讨论与结论)
- 范式意义 · 智能体 RL 的第三种数据源:在真实环境(昂贵、不可控)与代码合成环境(确定、可验证但限于可规格化领域)之外,LWM 以“牺牲确定性换通用性”覆盖搜索引擎、真实 MCP 服务器等难以程序化的领域;更关键的是可控性——用自然语言模拟指令注入间歇性错误、分页、部分结果,或构造与现实事实不相交的虚构世界(答案只存在于虚构设定中,智能体无法靠参数记忆绕过搜索,也不会把训练期检索结果误当真实知识),使 Sim RL 可定向塑造行为(web_extractor 调用的反向分化即例证),并在 WideSearch 上超过 Real RL。
- 范式意义 · 世界建模作为可迁移的元推理:LWM RL 本质是单轮、无工具的下一状态预测,却在多轮工具调用基准上普遍提升,并在训练中完全不含 Claw 或函数调用数据的域外基准上获 +11.3 / +9.7 / +9.0;作者将其解释为“先预测后行动”的内部规划,与 LeCun 统一世界模型—执行者设想及 VLA 领域的 World Action Model 呼应。并行工作 ECHO(Shrivastava et al. 2026)以辅助观测预测损失使 Terminal-Bench 2.0 通过率约翻倍,从另一方向独立印证。
- 与既往 SOTA 的关键差距:相对通用前沿模型作模拟器,总分领先 GPT-5.4 仅 0.46、文本域 +1.23;相对自身基座 +3.97(397B)/ +8.66(35B)。相对 WebWorld、SWE-World、CWM、RLVR-World、ZeroSearch 等既有 LWM,作者强调的差异是单模型覆盖 7 域、从 CPT 起原生训练;相对 AgentFounder 则是领域更广并追加 SFT 与 RL 阶段。但正文未与这些既有 LWM 在同一基准上做正面数值比较。
- 局限:① GUI 域仅以无障碍树/视图层级文本表示,保真度列第五;② 规则验证中 GPT-5.4 仍居首;③ Factuality 始终最弱、Search 最难,事实性世界知识是模拟瓶颈;④ 无控制指令的 Sim RL 在 MCP 上无效,而控制指令取自前沿智能体在真实环境中通过自动验证的轨迹——(评注)Sim RL 仍需真实数据锚定;⑤ AgentWorldBench 为作者自建、由 LLM 评审(虽三评审排名高度一致);⑥ 预热实验仅在 35B 上进行,Sim RL 与 Real RL 的直接对比仅见于 WideSearch;⑦ CPT 数据量与分域构成、MoE 细节未披露。
- 实践启示:LWM 宜作为真实环境的补充而非替代——用于低成本铺开数千环境、构造对抗性与虚构条件、在下游智能体 RL 前做预热;真实环境仍承担锚定与最终验证。
- 未来工作(作者列出):智能体与 LWM 协同进化(自博弈互相推高边界);融合 GUI 截图的多模态扩展;自适应 Sim-to-Real 路由(按查询权衡成本与保真);动态工具合成。
- 团队:Qwen Team,项目负责人 Fei Huang、Jianhong Tu;外部顾问 Ning Ding(清华大学)。
🧠 IRMaD 思维导图
mindmap
root((语言世界模型))
I 引言
世界模型是通用智能基石
智能体研究偏重策略端
文本环境缺通用世界模型
既有工作多为单域微调
代码合成环境覆盖受限
R 问题
单模型模拟七类环境
如何评测模拟保真度
能否充当强化学习陪练
能否作为智能体预热
M 方法
两档MoE规模
逾千万条真实交互轨迹
预训练注入 微调激活
强化学习打磨保真
逐轮信息论损失掩码
量表加规则九比一奖励
自建2170样本评测集
R 结果
总分58.71居首
领先次席仅0.46分
图形界面域排第五
终端单域训练可迁移
虚构世界训练胜真实
预热七项基准全涨
域外基准涨约9到11分
a 讨论
RL数据来源被改写
可控性是模拟前提
先预测后行动
事实性仍是最弱项
评测集由团队自建
D 结论
世界模型进入文本环境
陪练场与热身课
扩展智能体新坐标轴
下一步多模态与共进化
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。