arXiv 技术报告 · 九十六卡并行十九万个仿真世界 · 三项基准 SOTA

超越人类示范:不靠模仿人类轨迹的端到端自动驾驶

Xiaomi Autonomous Driving L3 Team · arXiv 技术报告 (cs.RO / cs.CV / cs.LG) · 2026 · arXiv: 2609.06055
原题:DriveZero: End-to-End Driving Beyond Human Demonstrations
Open Access 新颖度 0.88

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

现在的自动驾驶系统,绝大多数是靠模仿人类司机的驾驶记录学出来的。工程师收集海量的真实行车数据,然后训练模型:在这个路况下,人类司机是怎么打方向盘、怎么踩刹车的,你也照着做。

这条路走得通,而且规模化和稳定性都不错。但它有一个天花板式的问题:人类的记录成了唯一的老师,那么学生最多也就学到老师的水平。

更具体地说,这里有三个绕不过去的缺陷:

有没有别的老师?有,就是强化学习——让模型自己去开,开错了就受惩罚,开好了就得奖励。这样它能看到自己行为的后果,能主动去到那些危险的状态里,并学会怎么脱身。可问题是,真正要部署的系统只能看摄像头画面,而让模型在逼真的画面里反复试错,计算代价高得离谱。

② 研究问题(要回答什么?)

这项研究要回答的是,自动驾驶能不能不再以人类的驾驶记录为学习上限。作者的破题思路是一句很关键的观察:

「开车」这件事其实包含两种性质完全不同的能力,它们最适合的学习方式也不同。

既然如此,为什么要把它们捆在一起用同一种方式训练呢?作者的方案是先分开各练各的,最后再合起来:动作能力在一个高速的、简化的仿真世界里用强化学习练(那里不需要渲染画面,可以跑得飞快);感知能力在海量图像上练(那里不需要闭环,只需要数据多);最后把两者蒸馏成一个只看摄像头的可部署系统。

研究要检验的核心命题是:这样学出来的系统,能不能超过那份用来搭建训练场景的人类记录本身?

③ 研究方法(怎么做的?)

整套方法由三块拼成,名字分别对应三个阶段。

第一块:在仿真世界里学会开车。

作者把真实的行车记录改造成可交互的世界。原本的记录是「死」的——所有车的轨迹都已经写定了。作者的做法是给每一个背景车辆都配一个独立的「行为提供者」:有的继续按记录回放,有的改由规则模型驱动(会跟车、会刹车),有的甚至由正在训练的策略自己控制。这样一来,场景就「活」了,你的车动作变了,周围的车会做出相应的反应。

然后让一个「特权老师」在这些世界里从零开始学。之所以叫特权,是因为它不看画面,直接读取结构化的场景信息——周围有哪些车、在什么位置、地图长什么样、红绿灯是什么状态。省掉了渲染画面这一步,速度就快得多:作者一次并行跑了将近二十万个世界,铺在九十六块显卡上。

值得注意的是,这个老师完全从随机初始化开始,没有任何模仿预训练。人类记录在这里只负责两件事:提供场景的初始布置,以及提供导航目标点。至于「怎么开」,一点都不教。

奖励的设计有个巧妙之处:六项软性的驾驶质量指标(安全、合规、舒适等)不是加起来,而是乘起来。这意味着只要有任何一项接近零,总分就接近零——你不能靠开得特别舒适来抵消一次压线。

还有一个「多想一步」的机制。强化学习训练时同时会学出一个「估值器」,用来判断某个局面的好坏。作者在真正开车时把它利用起来:先让策略给出它最想做的那个动作,再额外采样几十个备选动作,每个都在脑子里往前推演几步,用同一套奖励规则打分。只有当某个备选明显好过原来的选择时,才换用它;差距不大就维持原判。这是一种谨慎的设计——额外的计算只在有把握时才改变决策。

第二块:不用标注学会看世界。

感知模型的训练通常需要大量人工标注:框出车辆、标出车道线、标注深度。作者绕开了这一步,改为把四个现成的视觉基础模型蒸馏进一个骨干网络,而监督信号完全来自这些冻结模型输出的特征,不需要任何检测、分割、车道或深度标签。这带来一个实际好处:训练素材可以自由混合网络图片和行车画面,因为反正都不需要标注。

第三块:把老师的本事传给学生。

老师读结构化信息,而实际部署的系统只能看摄像头。桥梁在于行车记录本身:记录里的每一帧,既有多路摄像头画面,也有对应的结构化场景状态。于是可以让老师根据状态推演出一条轨迹,用这条轨迹去监督只看画面的学生。

学生会一次性给出多条候选轨迹,训练时只有最接近老师那条的候选参与计算损失,这样不同的候选就能各自去捕捉不同的驾驶模式,而不是所有候选都挤向同一个平均答案。另外有一个独立的打分模块,负责在推理时从这些候选中挑一条。

最后还有一个记录数据给不了的好处:老师是「目标导向」的,你可以在同一个场景下给它换一个目标点,它就会推演出另一条合理的轨迹。同一段路况因此可以生成多条不同意图下的监督信号——这正是「每个场景只有一个标准答案」这个缺陷的直接解药。

④ 结果(发现了什么?)

研究结果显示,完全不看人类驾驶轨迹训练出来的系统,反而超过了提供训练场景的那份人类记录本身。

先看老师的成绩。在业界通用的规划基准上,与「原样回放人类记录」这个参照物相比:

对比项Val14Test14-hardTest14-random
人类记录回放93.53 / 80.3285.96 / 68.8094.03 / 75.86
本文的强化学习老师95.16 / 94.2589.97 / 89.1894.50 / 95.00

六项全胜。尤其在第二组数字(背景车会对你做出反应的那种更真实的设定)上,差距极大——比如中间那一列,从 68.80 提升到 89.18。这说明人类记录一旦被放进一个会回应的环境里,其实相当脆弱,而闭环学出来的策略要稳健得多。

「多想一步」确实有用,而且花的算力越多越有用。保持模型完全不变,只增加推理时的备选动作数量:

备选动作数平均分提升
不搜索93.01
8 个93.12+0.11
16 个93.13+0.13
32 个93.40+0.39
64 个93.57+0.56

这是一条清晰的「推理时算力换性能」曲线——不用重新训练,不用改模型,只要愿意多算一会儿,成绩就往上走。

再看学生的成绩。只用四路摄像头、在完全没有人类轨迹监督的情况下训练出来的端到端系统,在主流基准上拿到 94.8 分——这个数字恰好与人类司机的得分持平。再叠加更多的仿真场景做数据扩充后,它在三个基准上全部刷新了最好成绩,其中一个基准还是在完全没有针对性微调的情况下直接迁移过去的。

消融实验补上了两块关键证据:

⑤ 讨论(这些发现说明什么?)

这项工作真正的分量,在于它动的是训练范式,而不是网络结构。

过去几年端到端自动驾驶的主线,基本是在「如何更好地模仿人类」这个框架内做优化:更强的骨干、更好的时序建模、更巧的轨迹表示。这篇论文提出的问题不一样——为什么一定要模仿人类?它给出的答案是:人类记录的真正价值不在于「示范怎么开」,而在于「提供了真实的场景分布和导航目标」。把它降格成场景素材之后,行为本身可以由闭环互动重新学出来,而且能学得更好。

「超过日志回放」这个结果尤其值得琢磨。有人可能会觉得这是评测的取巧——记录回放在闭环评测里本来就吃亏,因为它不会对变化了的环境做出反应。这个批评有一定道理,作者的数据也印证了这点:在背景车会回应的设定下,人类记录的分数掉得特别厉害。但这恰恰是论证的一部分:一份静态的记录,本身就不构成一个足够好的行为上限,因为真实驾驶是互动的,而记录不是。用它当唯一监督信号,学到的东西天然就缺了「应对变化」这一块。

感知那部分的设计同样值得注意。不需要任何人工标注这件事,实际意义可能比它在论文中占的篇幅更大。感知模型的标注成本一直是自动驾驶研发的重头开销,而这里的做法把监督完全转移到了现成基础模型的特征上。副作用是训练素材的来源被彻底解放了——既然不需要标注,网络图片和行车画面就可以随便混。

推理时搜索那部分,则是一个把「测试时计算扩展」这个思路从语言模型迁移到控制领域的清晰案例。而且作者的实现相当克制:默认保留策略原本的选择,只有当备选明显更优时才替换。这个设计承认了一件事——用于推演的背景车运动模型和估值器都是近似的,微小的分数差可能只是噪声。这种对自身不确定性的诚实处理,比单纯追求分数更值得学习。

需要客观看待的地方:这是一份技术报告,来自产业界团队。整套系统的组件(近端策略优化、多教师特征蒸馏、胜者通吃的多模态回归、低秩微调)都有明确的既有出处,作者也逐一标注。它的贡献在于整体架构的重新组织与大规模验证,而非某个单点算法的发明。另外,闭环强化学习的这一环仍然发生在结构化的仿真世界里——它简化掉了感知误差、传感器噪声、以及真实交通中更复杂的博弈行为,这些在部署时都会重新出现。

⑥ 结论(最终结论 + 启示)

这项工作最值得记住的一点,是它把人类驾驶记录从「学习目标」降格成了「场景素材」。这个视角的转换带来了一连串后果:既然不再以人类轨迹为准绳,模型就不再受限于记录里那唯一的一个答案;既然可以在闭环里试错,安全攸关的挽回操作就能被主动学习而不是被动等待。

支撑这个转换的是一次清晰的任务分解:感知要理解世界,适合用海量图像学;动作要与世界互动,适合用闭环反馈学。两者分头训练,最后蒸馏成一个纯靠摄像头的可部署系统。

结果印证了这条路线。在强化学习中长出来的驾驶行为,在全部六项闭环设定上都超过了那份提供训练场景的人类记录;蒸馏后的纯相机系统在主流基准上追平了人类司机的得分,并在三个基准上刷新了最好成绩。

而那条「多想一步就多得一点分」的曲线,还额外提供了一个部署上的自由度:同一个模型,可以根据车上算力的余量,在推理时自行决定要不要多花点时间把决策做得更稳。这在实际产品中往往比多零点几分的离线成绩更有价值。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

端到端自动驾驶旨在将车载观测与导航意图直接映射为车辆运动。多数现有系统通过模仿人类驾驶日志学习该映射:该范式可扩展且稳定,但它使记录的人类轨迹成为唯一监督来源,学到的行为因此受限于日志的质量与覆盖度。

作者明确列举了三重结构性缺陷:(1) 每个记录场景只含一个已实现的未来,即便多种动作同样有效;(2) 安全攸关的偏离与恢复机动极为罕见;(3) 学到的策略所诱导的状态在离线数据中不存在,因而策略一旦离开示范分布,误差便会累积。

强化学习提供了另一种行为来源:通过闭环交互优化显式目标,策略可观察自身动作的后果、将失败转化为训练信号、访问受扰状态并学会恢复。但将该优势引入端到端驾驶存在困难——直接的视觉 RL 将样本密集的探索与昂贵的视觉仿真耦合在一起,限制了可扩展性。作者将此概括为一个核心张力:闭环 RL 适合学习「如何驾驶」,而部署所需的纯相机策略却不适合大规模在线探索。

相对于 ROACH(将 CARLA 中的 RL coach 蒸馏为单目策略)与 GigaFlow(经自博弈 DAgger 将向量观测的 RL 教师迁移至像素学生)等前作,本文的差异在于:前作在闭环中训练策略但直接取用现成的视觉编码器,而本文将感知模型与动作模型分别在各自最适合的范式中预训练——感知受益于大规模多样图像与丰富表征监督,动作受益于紧凑结构化状态上的高吞吐闭环交互——最后经蒸馏重新统一为可部署的纯相机策略。

I. Theoretical Framework & Hypotheses(理论框架与假设)

系统由三阶段构成,其分解本身即为核心论点。

模块学习范式观测空间是否用人类行为
DriveRL(动作)闭环 PPO,从随机初始化开始特权结构化状态(日志仅提供场景与目标)
DriveVFM(感知)多教师聚合式特征蒸馏原始图像(无任何任务标注)
DriveZero(统一)开环轨迹蒸馏多视角相机(监督来自教师 rollout)

DriveRL 的观测与动作:结构化观测 O_t 含自车、周边参与者、局部矢量地图与红绿灯状态。自车与各参与者以当前帧 + 前 4 帧(5 Hz 采样)共 5 帧表示,至多 96 个参与者;地图以至多 256 个局部矢量元素 token 表示,红绿灯状态附着于其所辖元素。导航由自车坐标系下的目标点 G_t 提供,采用两点、置换不变的表示(训练时取自日志未来自车位置,部署时沿路线选近/远两个锚点且前瞻距离随车速缩放、每步重算)。

策略输出有界 Beta 分布,作用于纵向加加速度轮胎转角变化率直接控制车辆而不做轨迹后处理。策略网络:三个专用编码器将 agent、自车运动学、地图输入嵌入为 256 维 token;两个目标点经正弦位置编码与共享 MLP 后均值池化为单一目标特征;以自车 token 为唯一 query,两层交叉注意力聚合 agent 上下文,再经一层 ego-to-map 交叉注意力提取地图上下文;拼接后由共享 MLP 融合送入策略头。策略共 5.7M 参数

奖励函数r_t = h_t + (1 − d_t)·( g_t + (1/H)·Π_{k∈K} q_{t,k} ),其中 h_t 为硬事件惩罚(触发即终止 rollout),g_t 为一次性到达目标奖励(不终止),q_{t,k} ∈ [0,1] 为覆盖安全、合规与舒适的六项软性驾驶质量分,H = 110 为 rollout 视界。乘性构造要求六项软标准被联合满足——任一项趋零即整体趋零,从而排除以某一维度补偿另一维度的取巧。Critic 被分解为每个奖励项一个价值通道,各通道之和等于总回报。

价值引导的测试时动作搜索:候选 0 保留 Beta 策略的众数,另从同一策略采样 N−1 个备选首动作。每个候选经 L 步 rollout 评估(首动作为该候选,后续动作取同一策略在候选诱导状态下的众数;背景车以有界加速度与偏航率的恒定转率–加速度模型外推)。评分 S⁽ⁱ⁾ = Σ_{ℓ} γ^ℓ Π_{u<ℓ}(1−d_u)·r_ℓ + γ^L·Π(1−d_u)·V复用 PPO 的训练奖励、折扣因子与 critic,使候选排序与 PPO 所优化的目标保持一致。保守选择:仅当最高分候选超过众数动作的分数达到边际 δ 时才执行,否则执行众数动作。

M. Materials & Methods(材料与方法)

R. Results(结果)

DriveRL 闭环对比(nuPlan,NR / R)

方法用人类数据Val14Test14-hardTest14-random均值
Log-Replay(人类记录回放)93.53 / 80.3285.96 / 68.8094.03 / 75.86
PDM-Closed92.84 / 92.1265.08 / 75.1990.05 / 91.63
Plan-R188.98 / 87.6977.45 / 77.2091.23 / 90.04
CaRL93.87 / 93.12— / 85— / —
GigaFlow— / 93.80— / —— / —
DriveRL95.16 / 94.2589.97 / 89.1894.50 / 95.0093.01
DriveRL-TTS95.54 / 94.5391.13 / 89.1595.93 / 95.1293.57

消融(ViT-S 骨干,navtrain 无 SimScale,NAVSIMv1 navtest)

视觉骨干NCDACEPTTCComfortPDMS
DA3 Small99.1098.8489.6896.2199.9393.31
DA2 ViT-S98.5799.2191.4495.1399.9693.72
DINOv2 ViT-S98.8699.0791.6395.4699.9893.88
DINOv3 ViT-S98.9399.0191.3195.7799.9793.88
DriveVFM ViT-S99.1799.1491.7996.2999.9894.41

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((超越人类示范的端到端驾驶))
    I 引言
      主流系统模仿人类日志
      每个场景只有一个答案
      危险恢复动作极其罕见
      偏离分布后误差累积
      视觉强化学习代价过高
    R 问题
      能否不以人类轨迹为上限
      感知与动作能否分头训练
      学生能否继承闭环行为
    M 方法
      日志改造成可交互世界
      特权教师从零学起
      六项软指标相乘而非相加
      九十六卡并行十九万世界
      价值引导的测试时搜索
      仅当明显更优才替换
      四个视觉模型蒸馏进骨干
      全程不需要任何标注
      胜者通吃多模态蒸馏
      换目标点生成多样监督
    R 结果
      六项闭环全面超越日志
      反应式设定优势尤其大
      同时超过两个无人类数据前作
      候选数增加分数单调上升
      纯相机学生追平人类得分
      三项基准刷新最好成绩
      教师监督优于人类轨迹
      多教师骨干累积生效
    a 讨论
      改的是范式不是结构
      日志不构成行为上限
      免标注解放语料来源
      测试时算力换性能
      仿真仍简化了感知误差
    D 结论
      日志降格为场景素材
      感知与动作分头再合流
      部署时可自行权衡算力

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。