🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
现在的自动驾驶系统,绝大多数是靠模仿人类司机的驾驶记录学出来的。工程师收集海量的真实行车数据,然后训练模型:在这个路况下,人类司机是怎么打方向盘、怎么踩刹车的,你也照着做。
这条路走得通,而且规模化和稳定性都不错。但它有一个天花板式的问题:人类的记录成了唯一的老师,那么学生最多也就学到老师的水平。
更具体地说,这里有三个绕不过去的缺陷:
- 每个场景只有一个「标准答案」。同一个路口,其实往左绕、往右绕、减速等一等,可能都是合理的选择。但记录里只有司机实际做的那一个,其余的可能性模型永远学不到。
- 最该学的情况恰恰最少见。紧急避险、从危险姿态中挽回,这些安全攸关的操作在正常驾驶记录里极其罕见——因为好司机根本不会开到那种境地。
- 模型自己犯的错,记录里没有答案。一旦模型稍微偏离了人类的轨迹,它就进入了一个训练数据里从未出现过的状态。此时它不知道该怎么办,误差会越滚越大。
有没有别的老师?有,就是强化学习——让模型自己去开,开错了就受惩罚,开好了就得奖励。这样它能看到自己行为的后果,能主动去到那些危险的状态里,并学会怎么脱身。可问题是,真正要部署的系统只能看摄像头画面,而让模型在逼真的画面里反复试错,计算代价高得离谱。
② 研究问题(要回答什么?)
这项研究要回答的是,自动驾驶能不能不再以人类的驾驶记录为学习上限。作者的破题思路是一句很关键的观察:
「开车」这件事其实包含两种性质完全不同的能力,它们最适合的学习方式也不同。
- 感知——看懂这个世界。它需要的是海量、多样的图像,以及丰富的表征监督。
- 动作——与这个世界互动。它需要的是高频率的闭环反馈,也就是「做了之后看看会怎样」。
既然如此,为什么要把它们捆在一起用同一种方式训练呢?作者的方案是先分开各练各的,最后再合起来:动作能力在一个高速的、简化的仿真世界里用强化学习练(那里不需要渲染画面,可以跑得飞快);感知能力在海量图像上练(那里不需要闭环,只需要数据多);最后把两者蒸馏成一个只看摄像头的可部署系统。
研究要检验的核心命题是:这样学出来的系统,能不能超过那份用来搭建训练场景的人类记录本身?
③ 研究方法(怎么做的?)
整套方法由三块拼成,名字分别对应三个阶段。
第一块:在仿真世界里学会开车。
作者把真实的行车记录改造成可交互的世界。原本的记录是「死」的——所有车的轨迹都已经写定了。作者的做法是给每一个背景车辆都配一个独立的「行为提供者」:有的继续按记录回放,有的改由规则模型驱动(会跟车、会刹车),有的甚至由正在训练的策略自己控制。这样一来,场景就「活」了,你的车动作变了,周围的车会做出相应的反应。
然后让一个「特权老师」在这些世界里从零开始学。之所以叫特权,是因为它不看画面,直接读取结构化的场景信息——周围有哪些车、在什么位置、地图长什么样、红绿灯是什么状态。省掉了渲染画面这一步,速度就快得多:作者一次并行跑了将近二十万个世界,铺在九十六块显卡上。
值得注意的是,这个老师完全从随机初始化开始,没有任何模仿预训练。人类记录在这里只负责两件事:提供场景的初始布置,以及提供导航目标点。至于「怎么开」,一点都不教。
奖励的设计有个巧妙之处:六项软性的驾驶质量指标(安全、合规、舒适等)不是加起来,而是乘起来。这意味着只要有任何一项接近零,总分就接近零——你不能靠开得特别舒适来抵消一次压线。
还有一个「多想一步」的机制。强化学习训练时同时会学出一个「估值器」,用来判断某个局面的好坏。作者在真正开车时把它利用起来:先让策略给出它最想做的那个动作,再额外采样几十个备选动作,每个都在脑子里往前推演几步,用同一套奖励规则打分。只有当某个备选明显好过原来的选择时,才换用它;差距不大就维持原判。这是一种谨慎的设计——额外的计算只在有把握时才改变决策。
第二块:不用标注学会看世界。
感知模型的训练通常需要大量人工标注:框出车辆、标出车道线、标注深度。作者绕开了这一步,改为把四个现成的视觉基础模型蒸馏进一个骨干网络,而监督信号完全来自这些冻结模型输出的特征,不需要任何检测、分割、车道或深度标签。这带来一个实际好处:训练素材可以自由混合网络图片和行车画面,因为反正都不需要标注。
第三块:把老师的本事传给学生。
老师读结构化信息,而实际部署的系统只能看摄像头。桥梁在于行车记录本身:记录里的每一帧,既有多路摄像头画面,也有对应的结构化场景状态。于是可以让老师根据状态推演出一条轨迹,用这条轨迹去监督只看画面的学生。
学生会一次性给出多条候选轨迹,训练时只有最接近老师那条的候选参与计算损失,这样不同的候选就能各自去捕捉不同的驾驶模式,而不是所有候选都挤向同一个平均答案。另外有一个独立的打分模块,负责在推理时从这些候选中挑一条。
最后还有一个记录数据给不了的好处:老师是「目标导向」的,你可以在同一个场景下给它换一个目标点,它就会推演出另一条合理的轨迹。同一段路况因此可以生成多条不同意图下的监督信号——这正是「每个场景只有一个标准答案」这个缺陷的直接解药。
④ 结果(发现了什么?)
研究结果显示,完全不看人类驾驶轨迹训练出来的系统,反而超过了提供训练场景的那份人类记录本身。
先看老师的成绩。在业界通用的规划基准上,与「原样回放人类记录」这个参照物相比:
| 对比项 | Val14 | Test14-hard | Test14-random |
|---|---|---|---|
| 人类记录回放 | 93.53 / 80.32 | 85.96 / 68.80 | 94.03 / 75.86 |
| 本文的强化学习老师 | 95.16 / 94.25 | 89.97 / 89.18 | 94.50 / 95.00 |
六项全胜。尤其在第二组数字(背景车会对你做出反应的那种更真实的设定)上,差距极大——比如中间那一列,从 68.80 提升到 89.18。这说明人类记录一旦被放进一个会回应的环境里,其实相当脆弱,而闭环学出来的策略要稳健得多。
「多想一步」确实有用,而且花的算力越多越有用。保持模型完全不变,只增加推理时的备选动作数量:
| 备选动作数 | 平均分 | 提升 |
|---|---|---|
| 不搜索 | 93.01 | — |
| 8 个 | 93.12 | +0.11 |
| 16 个 | 93.13 | +0.13 |
| 32 个 | 93.40 | +0.39 |
| 64 个 | 93.57 | +0.56 |
这是一条清晰的「推理时算力换性能」曲线——不用重新训练,不用改模型,只要愿意多算一会儿,成绩就往上走。
再看学生的成绩。只用四路摄像头、在完全没有人类轨迹监督的情况下训练出来的端到端系统,在主流基准上拿到 94.8 分——这个数字恰好与人类司机的得分持平。再叠加更多的仿真场景做数据扩充后,它在三个基准上全部刷新了最好成绩,其中一个基准还是在完全没有针对性微调的情况下直接迁移过去的。
消融实验补上了两块关键证据:
- 老师的监督确实优于人类轨迹的监督。这是全文最核心的对照——在同样的架构和数据下,换成学老师、并配合目标增强,成绩超过了学人类。
- 感知骨干的融合是叠加生效的。把四个视觉基础模型融进一个骨干后,表现(94.41)优于其中任何一个单独使用(93.31 到 93.88 不等),而且每加一个老师模型,成绩都有累积的提升。
⑤ 讨论(这些发现说明什么?)
这项工作真正的分量,在于它动的是训练范式,而不是网络结构。
过去几年端到端自动驾驶的主线,基本是在「如何更好地模仿人类」这个框架内做优化:更强的骨干、更好的时序建模、更巧的轨迹表示。这篇论文提出的问题不一样——为什么一定要模仿人类?它给出的答案是:人类记录的真正价值不在于「示范怎么开」,而在于「提供了真实的场景分布和导航目标」。把它降格成场景素材之后,行为本身可以由闭环互动重新学出来,而且能学得更好。
「超过日志回放」这个结果尤其值得琢磨。有人可能会觉得这是评测的取巧——记录回放在闭环评测里本来就吃亏,因为它不会对变化了的环境做出反应。这个批评有一定道理,作者的数据也印证了这点:在背景车会回应的设定下,人类记录的分数掉得特别厉害。但这恰恰是论证的一部分:一份静态的记录,本身就不构成一个足够好的行为上限,因为真实驾驶是互动的,而记录不是。用它当唯一监督信号,学到的东西天然就缺了「应对变化」这一块。
感知那部分的设计同样值得注意。不需要任何人工标注这件事,实际意义可能比它在论文中占的篇幅更大。感知模型的标注成本一直是自动驾驶研发的重头开销,而这里的做法把监督完全转移到了现成基础模型的特征上。副作用是训练素材的来源被彻底解放了——既然不需要标注,网络图片和行车画面就可以随便混。
推理时搜索那部分,则是一个把「测试时计算扩展」这个思路从语言模型迁移到控制领域的清晰案例。而且作者的实现相当克制:默认保留策略原本的选择,只有当备选明显更优时才替换。这个设计承认了一件事——用于推演的背景车运动模型和估值器都是近似的,微小的分数差可能只是噪声。这种对自身不确定性的诚实处理,比单纯追求分数更值得学习。
需要客观看待的地方:这是一份技术报告,来自产业界团队。整套系统的组件(近端策略优化、多教师特征蒸馏、胜者通吃的多模态回归、低秩微调)都有明确的既有出处,作者也逐一标注。它的贡献在于整体架构的重新组织与大规模验证,而非某个单点算法的发明。另外,闭环强化学习的这一环仍然发生在结构化的仿真世界里——它简化掉了感知误差、传感器噪声、以及真实交通中更复杂的博弈行为,这些在部署时都会重新出现。
⑥ 结论(最终结论 + 启示)
这项工作最值得记住的一点,是它把人类驾驶记录从「学习目标」降格成了「场景素材」。这个视角的转换带来了一连串后果:既然不再以人类轨迹为准绳,模型就不再受限于记录里那唯一的一个答案;既然可以在闭环里试错,安全攸关的挽回操作就能被主动学习而不是被动等待。
支撑这个转换的是一次清晰的任务分解:感知要理解世界,适合用海量图像学;动作要与世界互动,适合用闭环反馈学。两者分头训练,最后蒸馏成一个纯靠摄像头的可部署系统。
结果印证了这条路线。在强化学习中长出来的驾驶行为,在全部六项闭环设定上都超过了那份提供训练场景的人类记录;蒸馏后的纯相机系统在主流基准上追平了人类司机的得分,并在三个基准上刷新了最好成绩。
而那条「多想一步就多得一点分」的曲线,还额外提供了一个部署上的自由度:同一个模型,可以根据车上算力的余量,在推理时自行决定要不要多花点时间把决策做得更稳。这在实际产品中往往比多零点几分的离线成绩更有价值。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
端到端自动驾驶旨在将车载观测与导航意图直接映射为车辆运动。多数现有系统通过模仿人类驾驶日志学习该映射:该范式可扩展且稳定,但它使记录的人类轨迹成为唯一监督来源,学到的行为因此受限于日志的质量与覆盖度。
作者明确列举了三重结构性缺陷:(1) 每个记录场景只含一个已实现的未来,即便多种动作同样有效;(2) 安全攸关的偏离与恢复机动极为罕见;(3) 学到的策略所诱导的状态在离线数据中不存在,因而策略一旦离开示范分布,误差便会累积。
强化学习提供了另一种行为来源:通过闭环交互优化显式目标,策略可观察自身动作的后果、将失败转化为训练信号、访问受扰状态并学会恢复。但将该优势引入端到端驾驶存在困难——直接的视觉 RL 将样本密集的探索与昂贵的视觉仿真耦合在一起,限制了可扩展性。作者将此概括为一个核心张力:闭环 RL 适合学习「如何驾驶」,而部署所需的纯相机策略却不适合大规模在线探索。
相对于 ROACH(将 CARLA 中的 RL coach 蒸馏为单目策略)与 GigaFlow(经自博弈 DAgger 将向量观测的 RL 教师迁移至像素学生)等前作,本文的差异在于:前作在闭环中训练策略但直接取用现成的视觉编码器,而本文将感知模型与动作模型分别在各自最适合的范式中预训练——感知受益于大规模多样图像与丰富表征监督,动作受益于紧凑结构化状态上的高吞吐闭环交互——最后经蒸馏重新统一为可部署的纯相机策略。
I. Theoretical Framework & Hypotheses(理论框架与假设)
系统由三阶段构成,其分解本身即为核心论点。
| 模块 | 学习范式 | 观测空间 | 是否用人类行为 |
|---|---|---|---|
| DriveRL(动作) | 闭环 PPO,从随机初始化开始 | 特权结构化状态 | 否(日志仅提供场景与目标) |
| DriveVFM(感知) | 多教师聚合式特征蒸馏 | 原始图像 | 否(无任何任务标注) |
| DriveZero(统一) | 开环轨迹蒸馏 | 多视角相机 | 否(监督来自教师 rollout) |
DriveRL 的观测与动作:结构化观测 O_t 含自车、周边参与者、局部矢量地图与红绿灯状态。自车与各参与者以当前帧 + 前 4 帧(5 Hz 采样)共 5 帧表示,至多 96 个参与者;地图以至多 256 个局部矢量元素 token 表示,红绿灯状态附着于其所辖元素。导航由自车坐标系下的目标点 G_t 提供,采用两点、置换不变的表示(训练时取自日志未来自车位置,部署时沿路线选近/远两个锚点且前瞻距离随车速缩放、每步重算)。
策略输出有界 Beta 分布,作用于纵向加加速度与轮胎转角变化率,直接控制车辆而不做轨迹后处理。策略网络:三个专用编码器将 agent、自车运动学、地图输入嵌入为 256 维 token;两个目标点经正弦位置编码与共享 MLP 后均值池化为单一目标特征;以自车 token 为唯一 query,两层交叉注意力聚合 agent 上下文,再经一层 ego-to-map 交叉注意力提取地图上下文;拼接后由共享 MLP 融合送入策略头。策略共 5.7M 参数。
奖励函数:r_t = h_t + (1 − d_t)·( g_t + (1/H)·Π_{k∈K} q_{t,k} ),其中 h_t 为硬事件惩罚(触发即终止 rollout),g_t 为一次性到达目标奖励(不终止),q_{t,k} ∈ [0,1] 为覆盖安全、合规与舒适的六项软性驾驶质量分,H = 110 为 rollout 视界。乘性构造要求六项软标准被联合满足——任一项趋零即整体趋零,从而排除以某一维度补偿另一维度的取巧。Critic 被分解为每个奖励项一个价值通道,各通道之和等于总回报。
价值引导的测试时动作搜索:候选 0 保留 Beta 策略的众数,另从同一策略采样 N−1 个备选首动作。每个候选经 L 步 rollout 评估(首动作为该候选,后续动作取同一策略在候选诱导状态下的众数;背景车以有界加速度与偏航率的恒定转率–加速度模型外推)。评分 S⁽ⁱ⁾ = Σ_{ℓ} γ^ℓ Π_{u<ℓ}(1−d_u)·r_ℓ + γ^L·Π(1−d_u)·V,复用 PPO 的训练奖励、折扣因子与 critic,使候选排序与 PPO 所优化的目标保持一致。保守选择:仅当最高分候选超过众数动作的分数达到边际 δ 时才执行,否则执行众数动作。
M. Materials & Methods(材料与方法)
- 混合智能体仿真:每个背景 actor 经统一的物理状态–动作接口获得独立行为提供者,支持三类:日志回放、规则行为(IDM、前车制动)、学习策略(自博弈)。报告设置中背景车用 IDM 的批处理近似,少量用前车制动,行人与非车辆 actor 保持日志回放。
- 自博弈扩展:训练中的策略可额外控制选定背景车,各自获得自我中心观测与目标。作者如实报告 nuPlan 上收益很小,并归因于基准自身——其闭环评测以 IDM 驱动背景车,因而不奖励更自然的交互行为。自博弈是真实路测部署所采用的配置。
- 场景一致的 actor 插入:晚入场 actor 仅在满足三个条件时释放——存在于当前日志帧、自车位姿与日志自车位姿相差在 5 m 与 0.35 rad 之内、且不会与任何可见 actor 碰撞。此设计解决「自车偏离日志后按原时刻插入 actor 会产生不合理位置甚至直接碰撞」的问题。
- 并行规模:整个 rollout 循环(背景智能体行为、车辆动力学、奖励计算、场景编辑)实现为批处理 GPU 运算;每 rank 2,048 个世界,跨 96 GPU 至多并行 196,608 个世界。作者另报告更大的 PPO minibatch 可提升训练表现。
- DriveVFM:遵循 RADIO 的聚合式蒸馏,将冻结的 DINOv3、SigLIP2、SAM、Depth Anything V2 融合进单一驾驶骨干,监督完全来自冻结基础模型的特征,因而训练不需要检测、分割、车道或深度标签。该性质允许预训练语料自由混合网络级图像与驾驶场景。
- DriveZero 架构:输入四路相机(前/后/左/右)、自车运动学与导航指令(由给教师的目标点导出,使师生共享同一驾驶意图)。DriveVFM 经 rank-32 的 Q/V LoRA 微调编码各路图像(骨干本体冻结),视觉 token 附加 3D 位置嵌入后由每相机 16 个可学习 register token 压缩为少量场景 token。自车运动学与指令嵌入为一个 ego token,加到
M个可学习轨迹 query 上;轨迹解码器经对场景 token 的交叉注意力输出轨迹。独立的打分解码器将每条候选编码为 score query,注意视觉 token 并预测 PDM 的六个分量。 - 蒸馏目标:对每个日志帧,冻结教师接收结构化状态与目标点并在全部背景 actor 按日志行进的条件下 rollout,所得轨迹
τ^T以自车相对(x, y, yaw)位姿序列表示,作为胜者通吃目标的回归靶:L_traj = min_m dist(τ̂_m, τ^T)(dist为按点平均的L₁距离)。仅最接近的候选贡献损失,使不同 query 捕捉不同驾驶模态。打分损失L_score = (1/M)·Σ_m Σ_{k=1}^{6} BCE(σ(ŝ_mk), s_mk)。候选轨迹在进入打分分支前被 detach,将轨迹生成与候选排序解耦。总目标L = λ_traj·L_traj + λ_score·L_score。 - 目标增强:因教师是目标条件化的,同一场景可在增广的驾驶意图下被反复查询,产生多样且目标一致的监督——这正是日志数据无法提供的信号。
- 学生训练:NAVSIM navtrain 划分(基于 nuPlan,含 100K 交互式真实场景),不使用记录的人类驾驶轨迹;DriveZero-Scale 另加 SimScale 的 237K 分布外仿真场景。64 条轨迹候选、256 维规划表示、4 层候选解码器;25 epoch,batch size 256,AdamW,初始学习率
2×10⁻⁴余弦退火至零。主表变体均用 DriveVFM ViT-L 骨干。学生始终以开环方式在日志帧上训练,从不进入交互环境,也不需要任何渲染。 - 评测:DriveRL 在 nuPlan 的 Val14 / Test14-hard / Test14-random 三个社区划分上以非反应式(NR)与反应式(R)两种模式评测。学生在 NAVSIMv1 navtest(报 PDMS 及其五个分量)、NAVSIMv2 navhard(报两阶段 EPDMS,其第二阶段评估对高斯泼溅式自车状态扰动的鲁棒性)、以及 HUGSIM 真闭环基准(零样本迁移,无任何针对性微调)上评测。
R. Results(结果)
DriveRL 闭环对比(nuPlan,NR / R)
| 方法 | 用人类数据 | Val14 | Test14-hard | Test14-random | 均值 |
|---|---|---|---|---|---|
| Log-Replay(人类记录回放) | — | 93.53 / 80.32 | 85.96 / 68.80 | 94.03 / 75.86 | — |
| PDM-Closed | 是 | 92.84 / 92.12 | 65.08 / 75.19 | 90.05 / 91.63 | — |
| Plan-R1 | 是 | 88.98 / 87.69 | 77.45 / 77.20 | 91.23 / 90.04 | — |
| CaRL | 否 | 93.87 / 93.12 | — / 85 | — / — | — |
| GigaFlow | 否 | — / 93.80 | — / — | — / — | — |
| DriveRL | 否 | 95.16 / 94.25 | 89.97 / 89.18 | 94.50 / 95.00 | 93.01 |
| DriveRL-TTS | 否 | 95.54 / 94.53 | 91.13 / 89.15 | 95.93 / 95.12 | 93.57 |
- R1 · 全面超越日志专家:DriveRL 在全部六项非反应式与反应式设定上均超过 Log-Replay,证明闭环 RL 可学到超越其训练世界种子示范的驾驶行为。同时在所有已报告设定上超过 CaRL 与 GigaFlow 这两个同样不使用人类数据的前作。差距在反应式设定下尤为悬殊(如 Test14-hard R:68.80 → 89.18),说明静态日志在会回应的环境中表现脆弱。
- R2 · 测试时算力扩展(固定检查点,
L = 5,δ = 0.03):候选数N由 8 增至 64,均值由 93.01 单调升至 93.57(+0.56)。分项最大增益出现在非反应式划分:Test14-hard NR +1.16,Test14-random NR +1.43。作者将该趋势解释为测试时搜索作为局部策略改进算子的预期作用。TTS 提升五项、在 Test14-hard R 上基本持平(89.15 vs 89.18)——如实报告了未提升的那一项。 - R3 · 纯相机学生追平人类:DriveZero 在 NAVSIMv1 navtest 取得 94.8 PDMS,在完全没有人类轨迹监督的情况下与人类司机(94.8)持平。
- R4 · 数据扩展后三项 SOTA:DriveZero-Scale 在 navtest 达 95.3 PDMS、NAVSIMv2 navhard 达 57.1 EPDMS、闭环 HUGSIM 达 46.6 HD-Score(零样本,无 HUGSIM 特定微调)。
消融(ViT-S 骨干,navtrain 无 SimScale,NAVSIMv1 navtest)
| 视觉骨干 | NC | DAC | EP | TTC | Comfort | PDMS |
|---|---|---|---|---|---|---|
| DA3 Small | 99.10 | 98.84 | 89.68 | 96.21 | 99.93 | 93.31 |
| DA2 ViT-S | 98.57 | 99.21 | 91.44 | 95.13 | 99.96 | 93.72 |
| DINOv2 ViT-S | 98.86 | 99.07 | 91.63 | 95.46 | 99.98 | 93.88 |
| DINOv3 ViT-S | 98.93 | 99.01 | 91.31 | 95.77 | 99.97 | 93.88 |
| DriveVFM ViT-S | 99.17 | 99.14 | 91.79 | 96.29 | 99.98 | 94.41 |
- R5 · 教师监督优于人类轨迹监督:这是支撑全文核心主张的关键对照——配合目标增强的教师监督超过人类轨迹监督。
- R6 · 多教师累积生效:DriveVFM 融合骨干(94.41)优于任一单独教师骨干(93.31–93.88);additive study 显示每个教师基础模型都累积地贡献增益。
a / D. Discussion & Conclusion(讨论与结论)
- 范式层面的贡献:本文改动的是训练范式而非网络结构。核心论点是人类驾驶日志的价值不在于「示范如何驾驶」,而在于提供真实的场景分布与导航目标。将其降格为场景素材后,行为可由闭环交互重新习得并超越日志本身。作者据此验证了三项分解:摆脱人类示范的 RL 动作模型、无需任务标注预训练的感知模型、以及将二者统一为超越模仿类对手的纯相机规划器。
- 「超越日志专家」的解读边界(评注):日志回放在闭环评测中天然吃亏——它不对变化的环境做出反应,这一点在其反应式得分的大幅下滑中清晰可见。但这恰构成论证的一部分:静态日志本身不构成足够的行为上限,因为真实驾驶是交互的而记录不是;以其为唯一监督必然缺失「应对变化」的能力。该结果应读作「模仿的上限被证伪」,而非「模型比人类司机开得好」。
- 感知侧的实践价值:完全免标注的骨干预训练,将监督转移至现成基础模型的特征,既消除了检测/分割/车道/深度标注成本,又解放了语料来源(网络图像与驾驶场景可自由混合)。其实际工程意义可能大于其在论文中所占篇幅。
- 测试时搜索的迁移意义:将「以策略与价值估计引导测试时搜索」这一在语言模型中成熟的思路迁移至控制领域,并给出清晰的算力–性能曲线。实现上的克制值得称道:默认保留策略众数,仅在备选超出边际
δ时替换;作者明言此举源于「背景 actor rollout 与 critic 均为近似,微小分差可能是噪声」。该设计为部署提供了一个实用自由度——同一模型可依车载算力余量在推理时自行权衡。 - 报告的诚实度:作者主动报告了自博弈在 nuPlan 上收益很小并给出基准层面的归因;亦如实标注 TTS 在 Test14-hard R 上未获提升。这类负面/中性结果的披露提高了整体可信度。
- 性质与局限(评注):本文为产业界技术报告,所用组件(PPO、RADIO 式聚合蒸馏、胜者通吃多模态回归、LoRA、DrivoR 式 register 压缩)均有明确既有出处并被逐一引注;贡献在于整体架构的重新组织与大规模验证而非单点算法发明。此外,闭环 RL 环节仍发生在结构化仿真世界中,简化掉了感知误差、传感器噪声与真实交通中更复杂的博弈行为,这些在部署时会重新出现;学生的训练则完全是开环的,其闭环稳健性由教师间接传递而非直接习得。
🧠 IRMaD 思维导图
mindmap
root((超越人类示范的端到端驾驶))
I 引言
主流系统模仿人类日志
每个场景只有一个答案
危险恢复动作极其罕见
偏离分布后误差累积
视觉强化学习代价过高
R 问题
能否不以人类轨迹为上限
感知与动作能否分头训练
学生能否继承闭环行为
M 方法
日志改造成可交互世界
特权教师从零学起
六项软指标相乘而非相加
九十六卡并行十九万世界
价值引导的测试时搜索
仅当明显更优才替换
四个视觉模型蒸馏进骨干
全程不需要任何标注
胜者通吃多模态蒸馏
换目标点生成多样监督
R 结果
六项闭环全面超越日志
反应式设定优势尤其大
同时超过两个无人类数据前作
候选数增加分数单调上升
纯相机学生追平人类得分
三项基准刷新最好成绩
教师监督优于人类轨迹
多教师骨干累积生效
a 讨论
改的是范式不是结构
日志不构成行为上限
免标注解放语料来源
测试时算力换性能
仿真仍简化了感知误差
D 结论
日志降格为场景素材
感知与动作分头再合流
部署时可自行权衡算力
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。