arXiv 技术报告 · 英伟达二百九十四位作者 · 权重代码与数据开源 · 开源文生图与图生视频榜首 · RoboArena 榜首

看懂、想象、动手合为一体:面向物理 AI 的全模态世界模型 Cosmos 3

NVIDIA Cosmos Team(arXiv 署名 294 人), Ming-Yu Liu(统筹) · arXiv 技术报告(v4,2026-06-23) · 2026 · arXiv: 2606.02800
原题:Cosmos 3: Omnimodal World Models for Physical AI
Open Access 新颖度 0.88

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

想让机器人、自动驾驶汽车这类要在真实世界里干活的人工智能变得更聪明,直接拿到现实中去练既慢又贵,还可能出危险。

所以研究者一直想先造一座「虚拟训练场」。在这座训练场里,AI 要练两门互相绑定的本事:一门是看懂——从眼前零碎的画面里推断出场景里有什么、东西之间是什么关系、接下来可能怎么变;另一门是生成——在脑子里预演未来可能出现的画面,并想好自己该怎么动手。

可到目前为止,这两门本事基本是分开练、分开用的。设想一台家用机器人被要求饭后收拾餐桌,按现在的做法,它得同时装好几套模型:

这就像一支乐队里每个乐手各看各的谱子、彼此不通气——既浪费算力,又容易在交接处出错。英伟达自己此前的 Cosmos 系列也是如此:负责生成视频的、负责推理问答的、负责按控制信号改画面的,各是一套独立的模型。更何况真实世界不只有画面,还有声音:碰撞声、脚步声、机器的轰鸣,往往藏着眼睛看不到的线索。

② 研究问题(要回答什么?)

这份技术报告要回答的核心问题是,能不能只用一个模型,把看懂世界、预演未来和动手操作这几件事全部包下来。

换句话说,作者想造的不是又一个更大的视频生成器,而是一个「全能选手」:给它不同的输入、要它不同的输出,它就能自动切换身份。具体要检验的有四点:

③ 研究方法(怎么做的?)

作者把这个模型叫作 Cosmos 3。可以把它想象成一个脑子里住着两位搭档

两位搭档各有一套自己的「脑细胞」(参数),但坐在同一张桌子上:造梦者干活时可以随时看思考者写下的全部内容,思考者却从不偷看造梦者的草稿,这样它原本的说话本领就不会被带偏。

怎么切换身份?靠排座位。所有输入排成一列:文字和「看懂用」的图像排最前面,已知的条件(比如第一帧画面、控制信号、机器人动作)排在中间,要生成的内容排在最后。输入图片和问题、只要文字回答,它就是看图说话的模型;把一张图放在「已知」位置,它就能让这张图动起来;把机器人动作放在「已知」位置,它就预演「这么动会发生什么」;反过来把视频放在「已知」位置,它就能推出「是什么动作造成了这个变化」;把动作和视频都放在「待生成」位置,它就成了一个边想象后果、边决定怎么动的机器人大脑。

两个关键小发明。一是把汽车、摄像机、机械臂、人的头和手这些五花八门的「身体」,动作都翻译成同一种说法:每一小段时间里位置和朝向变了多少,再加上手爪是张开还是合上。二是给视频、声音、动作装上同一个「物理时钟」:三者每秒的帧数、片段数、指令数各不相同,模型按真实经过的时间给它们标位置,声音才能对准画面里碰撞的那一刻。

训练顺序也很讲究。先练思考者(先学两千二百万条通用图文数据,再学两百二十万条机器人、自动驾驶、智能基础设施等专业数据);再用练好的思考者给造梦者「开蒙」;造梦者先学图片、视频和声音(七亿六千七百万张图、三亿四千七百七十万段视频),这时思考者冻住不动;中期再加入动作数据(八百四十万段、六万一千三百小时)和控制信号数据;最后针对画图、做视频、控制机器人分别做专项训练。模型分小、中、大三个尺寸,约四十亿、一百六十亿、六百四十亿个参数,这次公开的是中、大两款。

④ 结果(发现了什么?)

在看懂画面、画图、拍视频、配声音和控制机器人这几大类测试里,这一个模型大多拿到了开源第一,不少项目还超过了闭源的顶级商业模型。

下面挑最有代表性的成绩来说,括号里是对比对象的分数。

① 看懂世界
作者在 48 个理解类测试上检验了思考者。大号模型在「智能基础设施」(仓库、交通摄像头)上得 62.6 分、在「自动驾驶」上得 79.3 分,超过所有对比模型,包括谷歌的 Gemini 3.1 Pro(58.6 和 47.2);机器人类 57.8 分,只比 Gemini 3.1 Pro 的 58.2 差一点;但通用题目 73.7 分,仍落后 Gemini 3.1 Pro 的 77.5。
② 画图
专门强化过画图的版本在 UniGenBench 上拿到 91.36,是全部参评模型里最高的,超过闭源的 Gemini 3 Pro Image(90.69)。在公众投票的 Artificial Analysis 文生图榜上,它是开源模型第一、全部模型第四。
③ 拍视频
在专测物理 AI 场景的 PAIBench-G 上,文生视频 80.0、图生视频 82.8,所有模型里最高(谷歌 Veo-3.1 为 79.1 和 82.6)。在只看「物理对不对」的 Physics-IQ 上,图生视频 43.8、视频续写 59.7,都是最佳。在让真人逐条打钩的评测里,图生视频 89.6 分,和 Veo-3.1 的 89.7 几乎打平;在以人手操作为主的 HWB 上得 71.9 分,比 Veo-3.1 高出 4.1 分。
④ 配声音
「声音和画面对不对得上」这一项,中号模型得分最高;但声音本身的音质还不如闭源的 Seedance-1.5-Pro,所以综合分 7.34 低于后者的 7.64。
⑤ 动手
专门训练成机器人策略的版本,在包含 120 个任务的 RoboLab 仿真测试中成功率 39.7%,明显高于知名机器人模型 π0.5 的 28.1%;在由各地使用者用真实机械臂两两盲比的 RoboArena 排行榜上排第一(截至 2026 年 5 月 30 日),在 MolmoSpaces 上也排第一。

最有意思的是「互相帮忙」的证据。把造梦者的搭档从普通的 Qwen3-VL 换成自家练过物理知识的思考者,生成视频在机器人类场景的得分从 66.5 升到 71.3;训练时加上声音,视频本身的分数反而略有上升;学过多种「身体」动作的版本换到一个从没见过的机器人环境里,训练 500 步就有 24.6% 的成功率,没学过的版本还是 0%。

⑤ 讨论(这些发现说明什么?)

这些结果说明了几件事。

第一,「合在一起」不是拖累,反而互相成全。过去人们担心一个模型什么都干,就什么都干不精。这份报告给出了一串反证:懂物理的思考者让造梦者画得更对;声音训练没有拖累画面;「正着预演后果」「倒着推断动作」「直接决定怎么动」这三种动作任务放在一起练,倒推动作的误差降了七成多;汽车、摄像机、机械臂和人手的动作经验,能迁移到新的机器人身上。这就像一个既会画画、又懂物理、还会做实验的学生,每门课都在给别的课打底子。

第二,「一个底座、多种用途」开始成为现实。同一个基座稍加专项训练,就分别成了开源最强的画图模型、做视频模型和机器人策略模型;以前每种控制信号都要单独装一个「插件」,现在一个模型全包,效果还不比原来差。

但也要看到它的短板和需要谨慎的地方:

⑥ 结论(最终结论 + 启示)

这份报告给出的答案是肯定的,一个统一的全模态世界模型可以同时胜任理解、生成、模拟和控制,而且这些本事还能互相促进。

它把物理 AI 里原本分家的四类模型——看图说话的、生成视频的、预演世界的、指挥动作的——合并成了一个,只靠换输入和输出就能切换角色,并在多数测试上达到或刷新了最好成绩。

对未来的启示是:训练机器人的「虚拟训练场」,也许不再是一堆模型拼起来的,而是一个模型。作者设想它分三步发挥作用:眼下用来批量造逼真的训练数据;接着作为各种专用模型的更好起点;更长远地,直接生成完整的训练环境,让机器人在里面安全地反复练习。作者把代码、模型权重、合成数据集和评测基准都按开放许可证公开了,其他研究者可以直接在这个底座上继续搭建。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。物理 AI 智能体需要两种相互耦合的能力:理解(从部分观测推断潜在表征、语义与动力学)与生成(预测并模拟合理的未来、预判自身动作的后果)。既有研究基本将二者割裂,形成三个模型族:判别式的视觉语言模型(VLM);生成式的视频生成模型与前向动力学模型;以及做动作预测的视觉-语言-动作模型(VLA)与世界-动作模型(WAM)。作者认为这种范式分离具有根本局限——理解需要推理世界的未来演化与动作后果,生成则依赖对世界与智能体行为的紧凑结构化表征——拼接式架构既次优又浪费算力。

文献空白。统一理解与生成的全模态路线(Unified-IO 2、Chameleon、Transfusion、Mixture-of-Transformers、BAGEL,以及 GPT-4o、Gemini 等闭源系统)已证明二者可以共享表征,但仍集中于文本-图像或通用媒体生成,较少触及物理世界动力学、动作条件生成、逆动力学与具身控制;世界模型与 VLA/WAM 研究则多限于特定领域、动作空间或本体。NVIDIA 此前的 Cosmos 系列同样按功能分立:Cosmos-Predict2.5 负责视频世界模拟,Cosmos-Reason 系列负责物理推理,Cosmos-Transfer2.5 以每种控制模态一个 ControlNet 分支做控制迁移。

本研究贡献。

I. Theoretical Framework & Hypotheses(理论框架与假设)

核心设计:双塔 MoT + 统一 token 排布。每个 Transformer 解码层含两套完整参数(LayerNorm、注意力投影、FFN 各自独立):推理塔处理前置的自回归(AR)子序列(语言 token 与 ViT 编码的图像/视频 token),生成塔处理后置的扩散(DM)子序列(VAE 编码的图像/视频 token、音频 token、动作 token)。两塔均由预训练 VLM 权重初始化,经双流联合注意力耦合:

排布规则:AR 在前、DM 在后;DM 内每个模态「干净条件 token 在前、带噪目标 token 在后」;条件与目标内部按视觉→音频→动作排序。于是不同任务只是同一格式的不同实例(SAR = [l1…ln, ⟨EOS⟩, ⟨BOG⟩]):

模式序列等价的传统模型族
语言[SAR],扩散参数不激活VLM
文生图[SAR, ṽ1]图像生成器
文生视频(+音频)[SAR, ṽ1:N, s̃]视频 / 音视频生成器
图/视频生视频[SAR, v1:P, ṽP+1:N]P=1 即 I2V图像动画 / 未来预测
控制迁移[SAR, vctrl1:N, ṽ1:N]ControlNet 类
前向动力学干净动作作条件,生成未来视频世界模拟器
逆向动力学干净视频作条件,生成动作逆动力学模型
策略动作与视频同为生成目标世界-动作模型

动作表示:动作 token at 表示从 vt−1vt 的转移,至多由三部分组成(主观测系位姿、执行器位姿、抓取状态)。位姿以相对变换 ΔTt = Tt−1−1Tt 表示(旋转取 6D 表示,输出经 SVD 还原为 SO(3)),以规避 PID 参数等本体特定控制细节;抓取状态直接编码当前值。领域感知投影 z = Win(k)x + bin(k)x = Wout(k)z + bout(k) 每个本体域一套权重,共享 MoT 骨干。

多模态位置编码:在 Qwen3-VL 的 3D MRoPE 上加入绝对时间调制 δt = TPSbase / TPS,其中 TPSbase = 24/4 = 6(24 FPS、VAE 时间压缩 4 倍),音频 TPS = 48000/1920 ≈ 25,动作 TPS 即其采样频率;音频与动作只携带时间坐标(h = w = 0)。AR 与 DM 之间插入固定时间间隔 15000,以消除首帧过饱和与棋盘伪影(Super 上尤甚)。

训练目标:推理塔为下一 token 预测;生成塔在全部模态上用整流流匹配,xσ = σ·ε + (1−σ)·x0,预测恒定速度 v* = ε − x0,条件 token 不计损失;各模态独立采样噪声水平,并以 σ = s·t̄ / (1 + (s−1)·t̄) 做分辨率自适应偏移。

核心主张对应设计检验证据
C1 理解能增益生成推理塔权重初始化 + 联合注意力附录 E.1:自家推理塔替换 Qwen3-VL-8B
C2 模态之间互促音视频联合预训练附录 E.3
C3 统一动作先验可迁移四类本体联合动作中期训练MT-init 对 PT-init(表 18–20)与协同矩阵
C4 三种动作模式共享结构FD / ID / 策略同一序列模型附录 E.4
C5 单一骨干可替代专用适配器控制视频作为序列内条件表 16–17,对照 Cosmos-Transfer2.5

M. Materials & Methods(材料与方法)

变体总参数稠密骨干层数隐藏维注意力头 / KV 头FFN 维初始化
Cosmos3-Edge4B2B282,04816 / 89,216自研 LLM 从零训练(15T tokens),ReLU²、去 QK norm;尚未发布
Cosmos3-Nano16B8B364,09632 / 812,288Qwen3-VL-8B
Cosmos3-Super64B32B645,12064 / 825,600Qwen3-VL-32B

R. Results(结果)

R1 · 理解(推理塔,48 项基准,四类汇总)

模型通用机器人智能基础设施驾驶
Cosmos3-Super73.757.862.679.3
Cosmos3-Nano69.655.161.076.0
Gemini 3.1 Pro(闭源)77.558.258.647.2
Qwen3-VL-32B72.852.656.140.7
Gemma-4-31B69.851.051.336.6

通用类与开源模型相当,但仍落后 Gemini 3.1 Pro;三个物理 AI 领域类全面领先开源与闭源模型,仅机器人类小幅落后 Gemini 3.1 Pro。作者将通用能力相对 Cosmos-Reason2 的提升归因于多出 20% 的预训练数据。

R2 · 生成主基准

基准Cosmos 3 最佳最强对照结论
UniGenBench All(1,170 提示)91.36(Super-T2I)Gemini 3 Pro Image 90.69;FLUX.2-dev 87.60全场第一
CVTG-500L 英文 GNED / PNED80.88 / 89.08Qwen-Image-2512 79.68 / 90.86GNED 最高
CVTG-102ch 中文 GNED32.02Z-Image-Turbo 49.18明显落后
PAIBench-G T2V / I2V Overall80.0 / 82.8(Super)Veo-3.1 79.1 / 82.6全场第一
RBench I2V58.4%(Nano)Wan 2.6(闭源)60.7%开源第一
Physics-IQ I2V / V2V(直接)43.8 / 59.7Sora2 42.3;Magi-1 56.0第一
Physics-IQ(WMReward + BoN)48.9 / 63.4Sora2 46.4;Magi-1 62.6第一
Cosmos HUE T2V(人评)89.3Veo-3.1 91.3;Seedance-1.5-Pro 90.0开源第一,落后闭源
Cosmos HUE I2V(人评)89.6Veo-3.1 89.7基本持平
Human World Bench71.9Veo-3.1 67.8;Wan2.2-A14B 60.7+4.1 / +11.2
SoundBench AVQ / SAV / PQ7.34 / 8.35 / 6.32(Nano)Seedance-1.5-Pro 7.64 / 8.21 / 7.06语义对齐第一,音质落后

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((全模态世界模型))
    I 引言
      物理AI需理解加生成
      现有方案靠模型拼接
      前代Cosmos各自独立
      统一模型少涉动作
    R 问题
      五种模态能否合一
      统一后是否打折
      能力之间能否互促
      底座能否速成专家
    M 方法
      推理塔加生成塔
      生成可看推理反之不行
      动作成为扩散模态
      物理时钟对齐时间
      先练推理再初始化生成
      模态分阶段逐步加入
      四十亿到六百四十亿参数
    R 结果
      文生图全场第一
      物理场景视频全场最高
      物理一致性测试第一
      手部操作视频超闭源
      机器人策略三榜第一
      音质通用理解仍落后
    a 讨论
      推理塔提升生成质量
      声音训练帮助视频
      动作先验跨本体迁移
      一个骨干替代四分支
      评测多为自建需复核
    D 结论
      物理AI通用底座
      造数据当起点建环境
      代码权重数据全开源

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。