🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
想让机器人、自动驾驶汽车这类要在真实世界里干活的人工智能变得更聪明,直接拿到现实中去练既慢又贵,还可能出危险。
所以研究者一直想先造一座「虚拟训练场」。在这座训练场里,AI 要练两门互相绑定的本事:一门是看懂——从眼前零碎的画面里推断出场景里有什么、东西之间是什么关系、接下来可能怎么变;另一门是生成——在脑子里预演未来可能出现的画面,并想好自己该怎么动手。
可到目前为止,这两门本事基本是分开练、分开用的。设想一台家用机器人被要求饭后收拾餐桌,按现在的做法,它得同时装好几套模型:
- 一个视觉语言模型,负责认出碗碟、想好先收什么后收什么;
- 一个动作模型,负责算出手臂和夹爪具体怎么动;
- 再一个世界模型,负责预演「这么动之后桌面会变成什么样」。
这就像一支乐队里每个乐手各看各的谱子、彼此不通气——既浪费算力,又容易在交接处出错。英伟达自己此前的 Cosmos 系列也是如此:负责生成视频的、负责推理问答的、负责按控制信号改画面的,各是一套独立的模型。更何况真实世界不只有画面,还有声音:碰撞声、脚步声、机器的轰鸣,往往藏着眼睛看不到的线索。
② 研究问题(要回答什么?)
这份技术报告要回答的核心问题是,能不能只用一个模型,把看懂世界、预演未来和动手操作这几件事全部包下来。
换句话说,作者想造的不是又一个更大的视频生成器,而是一个「全能选手」:给它不同的输入、要它不同的输出,它就能自动切换身份。具体要检验的有四点:
- 能不能统一:文字、图片、视频、声音、动作这五种「语言」,能否放进同一个模型里,既能读懂、也能生成?
- 统一了会不会打折:一个模型身兼数职,会不会样样通、样样松?它在每一项上能不能追上甚至超过只干这一件事的专门模型?
- 能力之间会不会互相帮忙:负责「想」的部分更懂物理,能否让负责「画」的部分画得更合理?看过汽车怎么开、人手怎么动的经验,能否让机器人更快学会新任务?
- 能不能当底座:这样一个通用模型,稍加训练,能否变成某一项上的顶尖专用模型?
③ 研究方法(怎么做的?)
作者把这个模型叫作 Cosmos 3。可以把它想象成一个脑子里住着两位搭档:
- 「思考者」(推理塔):像写作文一样一个字一个字地往外说,负责看懂图片视频、回答问题、做计划。
- 「造梦者」(生成塔):从一团雪花般的噪声出发,一遍遍擦去杂质,最后「洗」出清晰的画面、声音和动作。
两位搭档各有一套自己的「脑细胞」(参数),但坐在同一张桌子上:造梦者干活时可以随时看思考者写下的全部内容,思考者却从不偷看造梦者的草稿,这样它原本的说话本领就不会被带偏。
怎么切换身份?靠排座位。所有输入排成一列:文字和「看懂用」的图像排最前面,已知的条件(比如第一帧画面、控制信号、机器人动作)排在中间,要生成的内容排在最后。输入图片和问题、只要文字回答,它就是看图说话的模型;把一张图放在「已知」位置,它就能让这张图动起来;把机器人动作放在「已知」位置,它就预演「这么动会发生什么」;反过来把视频放在「已知」位置,它就能推出「是什么动作造成了这个变化」;把动作和视频都放在「待生成」位置,它就成了一个边想象后果、边决定怎么动的机器人大脑。
两个关键小发明。一是把汽车、摄像机、机械臂、人的头和手这些五花八门的「身体」,动作都翻译成同一种说法:每一小段时间里位置和朝向变了多少,再加上手爪是张开还是合上。二是给视频、声音、动作装上同一个「物理时钟」:三者每秒的帧数、片段数、指令数各不相同,模型按真实经过的时间给它们标位置,声音才能对准画面里碰撞的那一刻。
训练顺序也很讲究。先练思考者(先学两千二百万条通用图文数据,再学两百二十万条机器人、自动驾驶、智能基础设施等专业数据);再用练好的思考者给造梦者「开蒙」;造梦者先学图片、视频和声音(七亿六千七百万张图、三亿四千七百七十万段视频),这时思考者冻住不动;中期再加入动作数据(八百四十万段、六万一千三百小时)和控制信号数据;最后针对画图、做视频、控制机器人分别做专项训练。模型分小、中、大三个尺寸,约四十亿、一百六十亿、六百四十亿个参数,这次公开的是中、大两款。
④ 结果(发现了什么?)
在看懂画面、画图、拍视频、配声音和控制机器人这几大类测试里,这一个模型大多拿到了开源第一,不少项目还超过了闭源的顶级商业模型。
下面挑最有代表性的成绩来说,括号里是对比对象的分数。
作者在 48 个理解类测试上检验了思考者。大号模型在「智能基础设施」(仓库、交通摄像头)上得 62.6 分、在「自动驾驶」上得 79.3 分,超过所有对比模型,包括谷歌的 Gemini 3.1 Pro(58.6 和 47.2);机器人类 57.8 分,只比 Gemini 3.1 Pro 的 58.2 差一点;但通用题目 73.7 分,仍落后 Gemini 3.1 Pro 的 77.5。
专门强化过画图的版本在 UniGenBench 上拿到 91.36,是全部参评模型里最高的,超过闭源的 Gemini 3 Pro Image(90.69)。在公众投票的 Artificial Analysis 文生图榜上,它是开源模型第一、全部模型第四。
在专测物理 AI 场景的 PAIBench-G 上,文生视频 80.0、图生视频 82.8,所有模型里最高(谷歌 Veo-3.1 为 79.1 和 82.6)。在只看「物理对不对」的 Physics-IQ 上,图生视频 43.8、视频续写 59.7,都是最佳。在让真人逐条打钩的评测里,图生视频 89.6 分,和 Veo-3.1 的 89.7 几乎打平;在以人手操作为主的 HWB 上得 71.9 分,比 Veo-3.1 高出 4.1 分。
「声音和画面对不对得上」这一项,中号模型得分最高;但声音本身的音质还不如闭源的 Seedance-1.5-Pro,所以综合分 7.34 低于后者的 7.64。
专门训练成机器人策略的版本,在包含 120 个任务的 RoboLab 仿真测试中成功率 39.7%,明显高于知名机器人模型 π0.5 的 28.1%;在由各地使用者用真实机械臂两两盲比的 RoboArena 排行榜上排第一(截至 2026 年 5 月 30 日),在 MolmoSpaces 上也排第一。
最有意思的是「互相帮忙」的证据。把造梦者的搭档从普通的 Qwen3-VL 换成自家练过物理知识的思考者,生成视频在机器人类场景的得分从 66.5 升到 71.3;训练时加上声音,视频本身的分数反而略有上升;学过多种「身体」动作的版本换到一个从没见过的机器人环境里,训练 500 步就有 24.6% 的成功率,没学过的版本还是 0%。
⑤ 讨论(这些发现说明什么?)
这些结果说明了几件事。
第一,「合在一起」不是拖累,反而互相成全。过去人们担心一个模型什么都干,就什么都干不精。这份报告给出了一串反证:懂物理的思考者让造梦者画得更对;声音训练没有拖累画面;「正着预演后果」「倒着推断动作」「直接决定怎么动」这三种动作任务放在一起练,倒推动作的误差降了七成多;汽车、摄像机、机械臂和人手的动作经验,能迁移到新的机器人身上。这就像一个既会画画、又懂物理、还会做实验的学生,每门课都在给别的课打底子。
第二,「一个底座、多种用途」开始成为现实。同一个基座稍加专项训练,就分别成了开源最强的画图模型、做视频模型和机器人策略模型;以前每种控制信号都要单独装一个「插件」,现在一个模型全包,效果还不比原来差。
但也要看到它的短板和需要谨慎的地方:
- 音质、中文文字渲染、通用看图问答,仍明显落后于最好的闭源或专门模型;
- 电脑造出来的虚拟训练数据帮了不少忙,但在「人」这一类画面上反而拉低了分数,说明虚拟人还不够真;
- 不少测试是作者自己设计的,或者要靠别的 AI 当裁判、先把提示词改写成固定格式,公平性还需要外部检验;
- 排行榜名次只是某一时刻的快照,最小号的模型也还没有发布。
⑥ 结论(最终结论 + 启示)
这份报告给出的答案是肯定的,一个统一的全模态世界模型可以同时胜任理解、生成、模拟和控制,而且这些本事还能互相促进。
它把物理 AI 里原本分家的四类模型——看图说话的、生成视频的、预演世界的、指挥动作的——合并成了一个,只靠换输入和输出就能切换角色,并在多数测试上达到或刷新了最好成绩。
对未来的启示是:训练机器人的「虚拟训练场」,也许不再是一堆模型拼起来的,而是一个模型。作者设想它分三步发挥作用:眼下用来批量造逼真的训练数据;接着作为各种专用模型的更好起点;更长远地,直接生成完整的训练环境,让机器人在里面安全地反复练习。作者把代码、模型权重、合成数据集和评测基准都按开放许可证公开了,其他研究者可以直接在这个底座上继续搭建。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。物理 AI 智能体需要两种相互耦合的能力:理解(从部分观测推断潜在表征、语义与动力学)与生成(预测并模拟合理的未来、预判自身动作的后果)。既有研究基本将二者割裂,形成三个模型族:判别式的视觉语言模型(VLM);生成式的视频生成模型与前向动力学模型;以及做动作预测的视觉-语言-动作模型(VLA)与世界-动作模型(WAM)。作者认为这种范式分离具有根本局限——理解需要推理世界的未来演化与动作后果,生成则依赖对世界与智能体行为的紧凑结构化表征——拼接式架构既次优又浪费算力。
文献空白。统一理解与生成的全模态路线(Unified-IO 2、Chameleon、Transfusion、Mixture-of-Transformers、BAGEL,以及 GPT-4o、Gemini 等闭源系统)已证明二者可以共享表征,但仍集中于文本-图像或通用媒体生成,较少触及物理世界动力学、动作条件生成、逆动力学与具身控制;世界模型与 VLA/WAM 研究则多限于特定领域、动作空间或本体。NVIDIA 此前的 Cosmos 系列同样按功能分立:Cosmos-Predict2.5 负责视频世界模拟,Cosmos-Reason 系列负责物理推理,Cosmos-Transfer2.5 以每种控制模态一个 ControlNet 分支做控制迁移。
本研究贡献。
- 提出 Cosmos 3 全模态世界模型家族:在单一 Mixture-of-Transformers(MoT)骨干中联合处理并生成语言、图像、视频、音频与动作,仅凭输入-输出配置即可充当 VLM、文生图、文/图/视频生视频(可同步生成音频)、控制迁移、前向动力学、逆动力学与策略模型,无需任何结构改动;
- 将动作作为一等模态,以位姿差分伪动作统一自动驾驶、相机运动、机器人与人类自我中心运动四类本体;
- 设计绝对时间调制的三维 MRoPE,把不同采样率的视频、音频、动作 token 对齐到同一物理时间轴;
- 给出「先推理塔、后生成塔、逐阶段引入模态」的训练课程,以及支撑数十万亿 token 训练的数据与训练基础设施;
- 在 48 项理解基准及覆盖图像、视频、音视频、控制迁移、动力学与策略的生成类基准上系统评测,并以 OpenMDW-1.1 许可证开源代码、Nano/Super 权重、五个合成数据集与评测基准。
I. Theoretical Framework & Hypotheses(理论框架与假设)
核心设计:双塔 MoT + 统一 token 排布。每个 Transformer 解码层含两套完整参数(LayerNorm、注意力投影、FFN 各自独立):推理塔处理前置的自回归(AR)子序列(语言 token 与 ViT 编码的图像/视频 token),生成塔处理后置的扩散(DM)子序列(VAE 编码的图像/视频 token、音频 token、动作 token)。两塔均由预训练 VLM 权重初始化,经双流联合注意力耦合:
OAR = Attncausal(QAR, KAR, VAR):AR token 只做因果自注意力,永不被 DM token 更新,保全 VLM 的文本生成能力;ODM = Attnfull(QDM, [KAR; KDM], [VAR; VDM]):DM token 做全双向注意力,键值为 AR 与 DM 的拼接。
排布规则:AR 在前、DM 在后;DM 内每个模态「干净条件 token 在前、带噪目标 token 在后」;条件与目标内部按视觉→音频→动作排序。于是不同任务只是同一格式的不同实例(SAR = [l1…ln, ⟨EOS⟩, ⟨BOG⟩]):
| 模式 | 序列 | 等价的传统模型族 |
|---|---|---|
| 语言 | [SAR],扩散参数不激活 | VLM |
| 文生图 | [SAR, ṽ1] | 图像生成器 |
| 文生视频(+音频) | [SAR, ṽ1:N, s̃] | 视频 / 音视频生成器 |
| 图/视频生视频 | [SAR, v1:P, ṽP+1:N],P=1 即 I2V | 图像动画 / 未来预测 |
| 控制迁移 | [SAR, vctrl1:N, ṽ1:N] | ControlNet 类 |
| 前向动力学 | 干净动作作条件,生成未来视频 | 世界模拟器 |
| 逆向动力学 | 干净视频作条件,生成动作 | 逆动力学模型 |
| 策略 | 动作与视频同为生成目标 | 世界-动作模型 |
动作表示:动作 token at 表示从 vt−1 到 vt 的转移,至多由三部分组成(主观测系位姿、执行器位姿、抓取状态)。位姿以相对变换 ΔTt = Tt−1−1Tt 表示(旋转取 6D 表示,输出经 SVD 还原为 SO(3)),以规避 PID 参数等本体特定控制细节;抓取状态直接编码当前值。领域感知投影 z = Win(k)x + bin(k)、x = Wout(k)z + bout(k) 每个本体域一套权重,共享 MoT 骨干。
多模态位置编码:在 Qwen3-VL 的 3D MRoPE 上加入绝对时间调制 δt = TPSbase / TPS,其中 TPSbase = 24/4 = 6(24 FPS、VAE 时间压缩 4 倍),音频 TPS = 48000/1920 ≈ 25,动作 TPS 即其采样频率;音频与动作只携带时间坐标(h = w = 0)。AR 与 DM 之间插入固定时间间隔 15000,以消除首帧过饱和与棋盘伪影(Super 上尤甚)。
训练目标:推理塔为下一 token 预测;生成塔在全部模态上用整流流匹配,xσ = σ·ε + (1−σ)·x0,预测恒定速度 v* = ε − x0,条件 token 不计损失;各模态独立采样噪声水平,并以 σ = s·t̄ / (1 + (s−1)·t̄) 做分辨率自适应偏移。
| 核心主张 | 对应设计 | 检验证据 |
|---|---|---|
| C1 理解能增益生成 | 推理塔权重初始化 + 联合注意力 | 附录 E.1:自家推理塔替换 Qwen3-VL-8B |
| C2 模态之间互促 | 音视频联合预训练 | 附录 E.3 |
| C3 统一动作先验可迁移 | 四类本体联合动作中期训练 | MT-init 对 PT-init(表 18–20)与协同矩阵 |
| C4 三种动作模式共享结构 | FD / ID / 策略同一序列模型 | 附录 E.4 |
| C5 单一骨干可替代专用适配器 | 控制视频作为序列内条件 | 表 16–17,对照 Cosmos-Transfer2.5 |
M. Materials & Methods(材料与方法)
| 变体 | 总参数 | 稠密骨干 | 层数 | 隐藏维 | 注意力头 / KV 头 | FFN 维 | 初始化 |
|---|---|---|---|---|---|---|---|
| Cosmos3-Edge | 4B | 2B | 28 | 2,048 | 16 / 8 | 9,216 | 自研 LLM 从零训练(15T tokens),ReLU²、去 QK norm;尚未发布 |
| Cosmos3-Nano | 16B | 8B | 36 | 4,096 | 32 / 8 | 12,288 | Qwen3-VL-8B |
| Cosmos3-Super | 64B | 32B | 64 | 5,120 | 64 / 8 | 25,600 | Qwen3-VL-32B |
- 编码器:理解侧 ViT(16×16 patch,两层 MLP 合并 2×2 token,DeepStack 聚合,视频帧间插入文本时间戳),与骨干联合训练;生成侧沿用 Wan2.2-TI2V-5B 视频 VAE(时间 4 倍、空间 32×32 压缩),冻结;音频 VAE 处理 48 kHz 立体声、hop 1920、每秒 25 token,冻结;动作投影从零初始化。每个非语言模态加可学习模态嵌入。
- 推理塔数据(约 24.2M 样本):预训练 22,002,013 条(图文 18,814,952 / 视频文本 1,016,299 / 纯文本 2,170,762),其中 19.7M 取自 Nemotron Nano 2;SFT 2,171,673 条,视频文本占 50%,覆盖自动驾驶、机器人、智能基础设施。清洗:会话级多模态语义去重(K-means 分簇、余弦相似度阈值 0.95,去除 4.23%),再由 Gemma-4-31B-it 按忠实度 / 完整性 / 正确性三维 1–5 分打分,采用「三维皆达阈值」规则——预训练阈值 2(保留 78%),SFT 阈值 5(保留 46%)。
- 推理塔训练:全部组件从一开始联合训练(不设单独对齐阶段),2 个 epoch,序列 ≤16k token(单样本图像 ≤2,048、视频 ≤8,192 token),平方根归一化逐 token 损失;AdamW 峰值学习率 5×10−5(ViT 5×10−6)。SFT 8,200 iter、全局 batch 512,预训练 : SFT 采样预算 1 : 4,另混入 800K 指令跟随样本。
- 生成塔数据:预训练 767M 图像、347.7M 视频片段(来自 7.8B 原始图、3B 原始视频);以 Qwen3-VL-Embedding-8B / Cosmos-Embed1 嵌入后用 20,000 簇 KMeans 簇内去重;47 类分层标签,DOVER 美学 / 技术质量与 VTSS 评分加约 100 个伪影标签过滤;全阶段使用结构化 JSON 字幕(LoRA 微调 Qwen3-VL-8B 的自研标注器)。音频:138.9M 片段带音轨,中期经 SAM-Audio 源分离、SyncNet 唇同步(置信度 ≥3.0)等流程精选 18.8M(非语音 12.8M、同步语音 6M)。动作:8.4M episode、61.3K 小时(自我中心 41.3K 小时 67.4%、自动驾驶 10.0K 小时 16.3%、机器人 5.4K 小时 8.7%、相机运动 4.6K 小时 7.5%)。合成数据五套:SDG-PhyxSim 76,489、RobotSim 208,022、DriveSim 264,000、SynHuman 236,937、Warehouse 122,952 条。迁移:3M 视频 + MADS 1.1M 条七视角驾驶样本。
- 生成塔预训练:仅更新生成塔、推理塔冻结;256p / 480p / 720p 三档、五种宽高比、最长 400 帧(720p 为 300 帧),每序列 74,000 token 打包;T2I / T2V / I2V / V2V 采样比 20% / 56% / 16% / 8%;视频用 mode 采样、其余模态 logit-normal;shift 按分辨率取 1 / 3 / 5;学习率 10−4,文本 dropout 10%。Nano 31.05T tokens(1,024 张 GB200),Super 17.86T tokens(2,048 张 GB200)。
- 生成塔中期训练:图像 10%、视频 32%、视频+音频 8%、动作 25%(FD / ID / 策略)、通用迁移 20%、驾驶迁移 5%;动作损失 ×10;shift 升至 3 / 5 / 10。Nano 2.4T、Super 1.9T tokens。
- 后训练(均不改结构):Super-Text2Image 两阶段 SFT(20k 步,真实 / 合成 / 文字渲染 = 45% / 40% / 15%;再以 470k 超高质量图文对训 2k 步);Super-Image2Video 10k iter、学习率 1×10−5、约 50B tokens,目标 480p、189 帧(约 8 秒、24fps);Nano-Policy-DROID 在 DROID(76k 轨迹、350 小时、86 任务、564 场景)上训练,输入本体感受状态与三视角拼接的 540×640 画布,15Hz 预测 32 个未来关节位置并附带视频输出,推理用 4 步去噪、CFG 3、跳过视频解码,部署于 2 张 RTX Pro 6000。
- 系统工程:自研 SILA 数据平台(Lance 列式存储)使任务启动由 30–60 分钟降至约 5 分钟、吞吐提升 10 倍;rank 同步数据流选择 +54%、look-ahead 打包 +8%、两路扁平注意力较 FlexAttention +22%、选择性激活检查点 +13%、torch.compile +41%(均为 Nano 端到端吞吐);并行采用 HSDP + Ulysses 上下文并行。实测 Nano 520 TFLOPS / MFU 0.23,Super 673 TFLOPS / MFU 0.30。
R. Results(结果)
R1 · 理解(推理塔,48 项基准,四类汇总)
| 模型 | 通用 | 机器人 | 智能基础设施 | 驾驶 |
|---|---|---|---|---|
| Cosmos3-Super | 73.7 | 57.8 | 62.6 | 79.3 |
| Cosmos3-Nano | 69.6 | 55.1 | 61.0 | 76.0 |
| Gemini 3.1 Pro(闭源) | 77.5 | 58.2 | 58.6 | 47.2 |
| Qwen3-VL-32B | 72.8 | 52.6 | 56.1 | 40.7 |
| Gemma-4-31B | 69.8 | 51.0 | 51.3 | 36.6 |
通用类与开源模型相当,但仍落后 Gemini 3.1 Pro;三个物理 AI 领域类全面领先开源与闭源模型,仅机器人类小幅落后 Gemini 3.1 Pro。作者将通用能力相对 Cosmos-Reason2 的提升归因于多出 20% 的预训练数据。
R2 · 生成主基准
| 基准 | Cosmos 3 最佳 | 最强对照 | 结论 |
|---|---|---|---|
| UniGenBench All(1,170 提示) | 91.36(Super-T2I) | Gemini 3 Pro Image 90.69;FLUX.2-dev 87.60 | 全场第一 |
| CVTG-500L 英文 GNED / PNED | 80.88 / 89.08 | Qwen-Image-2512 79.68 / 90.86 | GNED 最高 |
| CVTG-102ch 中文 GNED | 32.02 | Z-Image-Turbo 49.18 | 明显落后 |
| PAIBench-G T2V / I2V Overall | 80.0 / 82.8(Super) | Veo-3.1 79.1 / 82.6 | 全场第一 |
| RBench I2V | 58.4%(Nano) | Wan 2.6(闭源)60.7% | 开源第一 |
| Physics-IQ I2V / V2V(直接) | 43.8 / 59.7 | Sora2 42.3;Magi-1 56.0 | 第一 |
| Physics-IQ(WMReward + BoN) | 48.9 / 63.4 | Sora2 46.4;Magi-1 62.6 | 第一 |
| Cosmos HUE T2V(人评) | 89.3 | Veo-3.1 91.3;Seedance-1.5-Pro 90.0 | 开源第一,落后闭源 |
| Cosmos HUE I2V(人评) | 89.6 | Veo-3.1 89.7 | 基本持平 |
| Human World Bench | 71.9 | Veo-3.1 67.8;Wan2.2-A14B 60.7 | +4.1 / +11.2 |
| SoundBench AVQ / SAV / PQ | 7.34 / 8.35 / 6.32(Nano) | Seedance-1.5-Pro 7.64 / 8.21 / 7.06 | 语义对齐第一,音质落后 |
- R3 · 公开榜单:Super-Text2Image 借助智能体改写—评判循环(至多 2 轮重写,GPT-5.5 改写、Gemini 3.1 Pro 评判)在 Artificial Analysis 文生图榜位列开源第一、总榜第四;Super-Image2Video 在 Artificial Analysis 图生视频(无音频)榜位列开源第一、总榜第 22。
- R4 · 控制迁移:PAIBench-C(600 段,blur / edge / seg / depth 单控制)上,Super Edge F1 0.50、depth si-RMSE 0.58,Nano DOVER 10.39、seg mIoU 0.72,对 Cosmos-Transfer2.5(0.45 / 0.68 / 9.49 / 0.68)逐项持平或胜出——一个统一骨干替代四个逐模态 ControlNet 分支。AVBench-C(486 段)人评画质 2.86 / 2.82 对 2.59,自车轨迹漂移 0.003 对 0.008。
- R5 · 动作(表 18,MT-init):自动驾驶逆动力学 ATE 0.90 m(Super),DepthAnything3 为 9.29 m、VGGT 为 23.46 m;相机运动前向动力学 RRE 0.142°、RTE 0.026 m、ATE 0.99 m,优于 HY-World 1.5(0.377° / 0.042 / 1.39)与 Lingbot-World(0.299° / 0.057 / 2.88);自我中心 FD PSNR 16.19 dB 对 LOME 9.36 dB;机器人 FD PSNR 26.04 dB 对 Ctrl-World 22.99 dB。MT-init 普遍优于 PT-init(如 Super 机器人 FD 26.04 对 22.69)。
- R6 · 策略:RoboLab(120 任务 × 10 rollout)指定式指令成功率 39.7%,π0.5 28.1%,同模型 PT-init 30.2%;复杂任务 29.4% 对 π0.5 14.7%。RoboArena 真实世界盲评榜第一(截至 2026-05-30);MolmoSpaces All Combined 第一,oracle 成功率 39.0%(截至 2026-06-20),且与 RoboLab、RoboArena 提交的是同一模型与超参数。LIBERO-10 新本体适配:500 iter 时 MT-init 24.6% 对 PT-init 0.0%,2,000 iter 时 97.4% 对 95.2%。
- R7 · 统一带来的增益(消融):① 以自家推理塔替换 Qwen3-VL-8B 作理解塔(生成塔均从零训练),T2V Domain 73.7→75.7,其中 Robot 66.5→71.3、AV 52.6→54.9,Quality 持平;I2V Domain 80.0→80.8。② 加入音频继续预训练,T2V Overall 78.6→79.1、I2V 81.7→82.2。③ FPS 控制综合分:无控制 8.51、仅文本 9.28、仅 MRoPE 调制 9.63、二者兼用 9.81。④ FD / ID / 策略联合训练(PushT,Edge):ID MSE 1.11×10−3→3.09×10−4(相对降 72%),策略覆盖率 74.1%→77.3%,FD PSNR 27.13→26.22 小幅下降。⑤ 动作域协同:AV 数据使相机 FD PSNR 11.96→12.82;Google Robot 使 WidowX-250 FD PSNR +1.39;自我中心预热使 AgiBot FD PSNR 在 5K 步 +0.94、后期约 +1.3–1.6。⑥ 视频-动作一致性:执行预测动作块后与模拟器 rollout 对比,第三人称视角 PSNR 23.19 dB、腕部视角 17.33 dB。
- R8 · 相对前代:PAIBench-G T2V 80.0 对 Cosmos-Predict2.5-14B 76.4;HUE T2V 89.3 对 82.1;HWB 71.9 对 38.7。作者将其归因于全模态架构带来的增益。
- R9 · 合成数据消融:SDG-All 使 PAIBench-G Overall 79.67→79.77、Quality 72.56 为各变体最佳;但 Human 域在所有 SDG 变体中均下降(−0.38 至 −0.69)。
a / D. Discussion & Conclusion(讨论与结论)
- 理论意义:从「模型拼接」到「条件方向」。本文最核心的主张是,VLM、视频生成器、世界模拟器与世界-动作模型并非需要各自训练的模型族,而是同一全模态序列模型在不同「干净条件 / 带噪目标」配置下的实例。R7 的消融链条(理解塔增益生成、音频增益视频、跨本体动作先验加速适配、三种动作模式共享结构)为「统一带来正迁移而非负干扰」提供了成体系的证据,这是它区别于把多个模型装进同一个仓库的关键。
- 与既有统一模型的关系。作者坦承其解码层结构与 BAGEL 相近,差异在训练策略、位置编码与能力范围;编码器与初始化也沿用 Wan2.2 VAE 与 Qwen3-VL。因此新意主要在把全模态范式延伸到动作与物理动力学(动作作为扩散模态、物理时间轴对齐、FD / ID / 策略统一),而非新的底层算子。
- 局限一 · 能力短板:通用理解仍落后 Gemini 3.1 Pro(73.7 对 77.5);音频感知质量 PQ(6.28 / 6.32)落后 Seedance-1.5-Pro(7.06)与 Veo-3.1(6.68);中文文字渲染 CVTG-102ch GNED 仅 32.02;HUE T2V 仍落后两款闭源模型;多项前向动力学以 PSNR 作代理指标,作者自承单条录制的未来并非唯一合理结果。
- 局限二 · 评测依赖:HUE、HWB、SoundBench、UniGenBench-Phys、AVBench-C、HealthSurgiBench 与若干驾驶基准为作者自建或使用内部数据;大量指标依赖 VLM 裁判(UniGenBench 用 Gemini 3.1 Pro,PAIBench-G 改用 Qwen2.5-VL-72B,作者称公开榜所用 Qwen3-VL-235B-A22B 的判分不可复现);评测前统一用 Claude Opus 4.6 / 4.7 把提示词改写为结构化 JSON;HUE 中真实视频也只得 93.6 / 94.4,说明题库仍不完美。
- 局限三 · 数据与发布:合成数据在 Human 域一致拉低分数,揭示虚拟人的仿真—现实鸿沟;RoboArena、MolmoSpaces 名次为时点快照;文生图公开榜成绩借助外部 LLM / VLM 组成的智能体循环;Edge 版本尚未发布;Super 的预训练 token 数(17.86T)少于 Nano(31.05T)。
- 实践启示:作者把 Cosmos 3 定位为物理 AI 的「中期训练底座」——近期用于合成高保真训练数据,中期作为任务 / 本体专用模型的起点(无需改结构即可后训练),远期生成复杂的闭环训练环境。代码、Nano / Super 权重、五个合成数据集与评测基准以 Linux 基金会 OpenMDW-1.1 许可证开源。
- 机构:NVIDIA(arXiv 署名 294 人,Ming-Yu Liu 统筹)。
🧠 IRMaD 思维导图
mindmap
root((全模态世界模型))
I 引言
物理AI需理解加生成
现有方案靠模型拼接
前代Cosmos各自独立
统一模型少涉动作
R 问题
五种模态能否合一
统一后是否打折
能力之间能否互促
底座能否速成专家
M 方法
推理塔加生成塔
生成可看推理反之不行
动作成为扩散模态
物理时钟对齐时间
先练推理再初始化生成
模态分阶段逐步加入
四十亿到六百四十亿参数
R 结果
文生图全场第一
物理场景视频全场最高
物理一致性测试第一
手部操作视频超闭源
机器人策略三榜第一
音质通用理解仍落后
a 讨论
推理塔提升生成质量
声音训练帮助视频
动作先验跨本体迁移
一个骨干替代四分支
评测多为自建需复核
D 结论
物理AI通用底座
造数据当起点建环境
代码权重数据全开源
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。