🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
深度学习有一条被反复验证的经验:让模型端到端地学,效果好过人手把任务拆成几段。这条经验从 AlexNet 开始,一路改写了图像分类、目标检测、图像分割等领域。
原因说起来很朴素:端到端的模型,推理时的做法和训练时完全一样,因此永远不会遇到训练中没见过的输入,也就不会出现越跑越偏的问题。
但生成模型一直是这条规律的例外。今天最主流的生成模型——自回归模型和扩散模型——训练时只学一步,用的时候却要连着跑几百上千步。每一步的误差都会喂给下一步,输入逐渐飘出训练时见过的范围,误差不断累积。
为什么非要这么拆?因为生成的本质是要处理多峰分布。
这话可以这样理解:让模型“画一只狗”,正确答案不是一个,而是几十亿个。如果直接让模型一步到位地去拟合,它只能给出所有正确答案的平均值——而平均出来的那个东西,往往不是任何一只真实的狗,是一团模糊。
现有做法是把生成拆成很多小步,让每一步的目标几乎只有一个答案,从而躲开这种模糊。可恰恰是这个拆法,让生成模型没法端到端。
② 研究问题(要回答什么?)
作者提出了一个非常干净的问题:既然生成过程不能拆,那还有什么可以拆?
一个生成模型总共只有两个过程可以被分解:它怎么生成,以及它怎么训练。既然生成不能拆,那就拆训练循环。
由此引出这篇论文真正的主张。作者认为,衡量一个生成模型的能力,除了大家熟知的两个维度之外,还有第三个被长期忽略的维度。参数量决定了模型能表示什么;数据量决定了模型能学到什么;而第三个维度决定了模型能生成出多少个不同的答案而不把它们糊成一团。
作者把这第三个量叫做生成表达力。它的特殊之处在于:它由训练目标本身决定,无论你把参数和数据堆到多大,它都纹丝不动。一个直接回归的模型,这个量等于 1——哪怕给它无限的参数和数据,它最好的输出也只是所有答案的一个模糊平均。
于是问题变成:能不能把这第三个量也变成可以缩放的?
③ 研究方法(怎么做的?)
方法本身简单到有点朴素,作者自己也承认,最简形式就是“取 K 选一”。
在每一个训练步,模型不再只生成一个候选,而是生成 K 个,然后只对其中离真实数据最近的那一个做梯度更新。实现上就是一个 for 循环,只有最好的那次生成能拿到梯度。
关键在于理解这样做为什么有效。在标准训练里,模型的输入(比如一个随机噪声)会被随机配给某个真实样本,而同一个输入在整个数据集上会被配给许多个不同的样本。模型被要求用同一个输入去还原许多个不同的答案,它能做的最好的事就是输出这些答案的平均——那团模糊就是这么来的。
而探索式建模反过来做:它去找那个生成结果本来就最接近某个真实样本的候选。这样一来,每个候选都可以稳稳地咬住一个不同的答案,模型能捕捉的答案数量,就随着探索量直接增长。
实验上作者分两条线走。第一条线是把探索加到已有的生成模型上——扩散模型、流匹配模型、以及一种可以调节步数的跳跃式模型,覆盖图像、视频和语言三个领域。作者特别强调,这些实验没有为探索单独调过任何超参数,完全沿用原配方,只是加上探索。
第二条线是把探索当作独立方法,做真正的端到端生成,在机器人控制任务上与扩散方法正面对比。
④ 结果(发现了什么?)
实验结果分成效率增益、规模趋势与端到端生成三层,一层比一层更能说明问题。
第一层是效率。在一个当时最强的图像生成配方上加入探索,达到原配方最终水平所需的数据少了 6.2 倍,计算量少了 4.1 倍。参数效率也在提升——一个中等规模的模型探索 5 个候选,跑赢了一个参数多出 47% 的更大模型。
第二层,也是最关键的一层:这些收益不但没有饱和,反而随规模上升。
随数据规模增长
探索带来的收益
随模型规模增长
探索带来的收益
ImageNet 无引导下的
接近最好水平的成绩
这一点至关重要。它意味着探索的行为方式与参数和数据是同一类的——规模越大,不做探索的模型离最优配置就差得越远。作者还指出,真正的基础模型训练所用算力比他们最大的实验还要高出约四个数量级,因此这些数字很可能是低估。
收敛速度的对比更直观:加了探索的配方比原配方快 6.2 倍收敛,而原配方本身已经比更早的基线快 47 倍——两者叠加接近 300 倍。
第三层是端到端生成,这是此前没有做到过的事。在机器人模仿学习任务上,扩散策略需要 100 次网络前向,而探索式策略只用 1 次,成绩反而略胜(方块任务 96% 对 94%,搬运任务 74% 对 72%,其余持平)。在目标导向的世界模型任务上,扩散基线平均需要 192 次函数求值得到 127.2 分,探索式世界模型平均只用 2.3 次就拿到 130.0 分。
还有一个额外发现:探索能改善泛化。在视频生成上,加入探索把最好的成绩从 37.5 提升到 30.0,且过拟合更晚出现。
⑤ 讨论(这些发现说明什么?)
这篇论文有一个不太常见的特点,作者自己也点了出来:深度学习通常是先做实验再解释,而这项工作是理论先预测、实验后确认。他们逐条列出了理论的四项预言及其验证结果,包括“即便最强的生成模型也缺生成表达力”“规模越大它越成为瓶颈”“探索可以替代生成拆解”“探索能解锁端到端生成”,四条全部被实验证实。
其中第三条的验证方式最漂亮。作者用了一种能自由调节生成步数的模型:如果拆训练真的能替代拆生成,那么探索加得越多,最优的生成步数就应该越少。实验正是如此——随着探索增加,越端到端的模型表现越好。这等于说,探索让我们可以“调节一个生成模型有多端到端”。
作者还给了一个有趣的旁证:今天的生成模型如此依赖引导技巧,本身就是模式被糊掉的证据。引导的做法是把采样推离一个更模糊、更容易塌缩的模型;它之所以管用,恰恰是因为原模型自己也在糊。
另一个意外发现是:即便在多峰性并不强的任务上,探索依然有明显帮助。作者的解释是,哪怕目标只有轻微的多峰性,训练过程中每次预测仍会被几个相互竞争的值拉扯,而这种拉扯不只造成模糊,也让优化本身变难。这和过参数化的道理相通——富余的容量让好解更容易被找到。
⑥ 结论(最终结论 + 启示)
这项工作的分量在于它提出的不是一个更好的技巧,而是一根新的坐标轴。
作者的结论是:今天所有不做探索的生成模型,随着规模增长,都会离计算最优的水平越来越远。因为它们的生成表达力在设计训练目标的那一刻就被钉死了,而参数和数据这两根轴无论怎么加都撬不动它。
沿着这条思路走到极限,生成建模就能变成完全端到端的——把驱动了深度学习其余部分的端到端训练,终于也带进生成领域。
作者对局限交代得很清楚。他们主要使用的这个版本,代价会随探索数量增长,因此难以廉价地覆盖极度多峰的分布,另一个代价更低的变体留待后续工作。自回归大语言模型是最难的一类,一部分原因是评测本身——语言建模缺少像图像和视频那样能揭示模式覆盖情况的分布式指标。
他们也指出了几条具体的后续路线:多词元预测的目标多峰性更强,因而更能从探索中获益;某些用变分自编码器推断隐变量的架构,如果改用探索式训练,可以把那个自编码器整个去掉。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
自 AlexNet 起,端到端训练击败人工设计的分阶段流水线,这一模式已重塑图像分类、目标检测、图像分割等领域。其收益归结为一条性质:端到端模型推理时的执行方式与训练时完全一致,因而永不暴露于训练中未见过的输入,避免了损害性能与泛化的分布漂移与曝光偏差。
生成建模却始终是这一趋势的例外。当今最常用、扩展性最好的配方——重构式生成模型(自回归、扩散、流)——推理时的采样方式与训练时截然不同:训练时只预测单步,推理时却作为循环网络展开数百至数千个词元或去噪步,逐步误差层层传递,使输入漂离训练分布并复合放大。
作者论证其根源在于:生成建模的本质是处理多峰概率分布。为在规模上做到这一点,现有重构式模型统一采取把生成过程分解为更小的步骤,使每步目标近乎单峰,从而使重构损失不再把不同模式糊成其均值。而这一分解,恰恰正是阻止生成模型端到端的原因。
由此产生本文的枢纽性追问:既然生成过程不能拆,还有什么可拆?一个生成模型只有两个可分解的过程——如何生成与如何训练。既已排除前者,本文转而分解训练循环本身,是为探索式建模(Explorative Modeling)。
I. Theoretical Framework & Hypotheses(理论框架与假设)
理论承接 Mode Forcing 的核心论点:现代生成建模的技艺,在于设计一个其损失最小值捕捉模式而非求其平均的重构目标。
| 概念 | 定义 | 意义 |
|---|---|---|
| 耦合(coupling) | 输入与其应映射到的目标之间的配对 | 重构式模型事先不知道该配对,故一个输入常被配给数据集中多个有效目标 |
| 模式模糊 | 一对多耦合下,重构损失的最小值是这些目标的均值 | 均值落在模式之间,不匹配任何真实数据点(脱离数据流形) |
| 生成表达力 E | E ≜ sup_{p*, c} sup_{θ* ∈ argmin L(θ)} M(P_θ*(·|c)),即某方法的损失最小值在任意数据分布上所能保留的最大条件模式数 | 由训练目标本身设定,参数与数据无论如何缩放都不改变它 |
| 直接回归器 | E = 1 | 即便参数与数据无限,最优输出仍是全部模式的单一模糊均值 |
| 探索 K 个候选 | 把 E 提升到至少 K | 把模糊的均值锐化为彼此区分的模式 |
反直觉之处:直接平方误差回归本身就是固定方差高斯下的极大似然——似然被忠实地最大化了,只是所优化的密度其生成表达力为 1,而它对多峰数据的最佳拟合就是均值。作者据此指出:“有足够数据与参数就做某种极大似然”这一传统观念并不充分,生成表达力是一条被忽略的缩放轴;这也可能解释长期观察到的似然与样本质量相关性很差的现象——似然衡量密度拟合得多好,生成表达力决定该密度能容纳多少模式。
端到端的严格定义:当一个生成模型训练时与推理时的采样方式相同,从而永不在推理时暴露于未经训练的输入,即称其为端到端(此处指模型自身的生成过程,不涉及测试时的分布漂移)。
可替代性命题:既然分解生成的目的正是提供生成表达力,那么分解生成与分解训练是可相互替代的——本文在第 4 节予以实证确认。
M. Materials & Methods(材料与方法)
- 核心目标函数:最简形式即 best-of-K。对数据样本
x、生成ŷ₁ … ŷ_K ~ G_θ与重构损失J(如平方误差),目标为L(θ) = min_{i ∈ {1…K}} J(ŷᵢ, x)。实现为一个 for 循环,仅最优的那次生成接收梯度。其作用是把损失最小值从数据样本的均值移向真实样本本身。 - 机制解读:探索可视为为生成器搜索正确的隐变量——条件于正确的隐变量后,一对多耦合变为一对一,目标变为单峰,模糊消失。隐变量模型的固有难题正是事先不知道哪个隐变量配哪个数据点,而探索直接搜索“生成结果本已最接近该数据点”的那个候选。
- 变体:主文使用 Forward XM(实现更简单,但代价随探索模式数增长);另有 Reverse XM(大体避免该代价,偏向精确率而非召回率),留作未来工作。记号
XM-K表示探索 K 个模式;所有无探索基线等价于 XM-1。 - 作为新缩放轴的实验(混合式):把探索叠加到 Diffusion / Flow(连续数据一律用 Flow Matching 目标)与 Jumpy 生成模型上,记为
XDiffusion、XJumpy、XRAE等。Jumpy 模型通过改变跳数,在单步直接回归(最端到端)与连续时间流(无穷步)之间插值,因而可直接测量“端到端程度”与“生成表达力”之间的权衡。全部混合实验不做任何 XM 专属的超参数调优,保持各基线配方原参数,仅加入探索。 - 领域覆盖:图像生成(RAE 配方与经调优的 SiT 基线)、视频生成、语言(掩码扩散语言模型 MDLM)——即连续与离散域兼有。
- 指标:图像 FID、视频 FVD;最大规模的图像实验改报
FDr⁶(在六个表征空间上对训练数据的 Fréchet 距离取平均),因为 FID 在该性能水平已饱和。语言使用困惑度-熵前沿,因为单看生成困惑度可被低熵采样刷分。主文实验默认不使用引导(guidance),仅 Table 1 另报带引导结果。 - 作为独立端到端方法的实验:机器人控制两项——行为克隆(Explorative Policy 对比 Diffusion Policy)与目标条件世界建模(Explorative World Model 对比 Diffuser)。保留各基线的架构,偶尔加入一个循环块以引入面向递归的归纳偏置,几乎不做超参数调优。
- 泛化的独立测量:区分两种样本效率——(a)达到目标性能所需处理的训练样本数;(b)在固定规模数据集上开始过拟合前所能达到的最佳性能。后者以验证集性能开始变差为停止点单独测量。
R. Results(结果)
1. 效率增益(作为新缩放轴)
- 在 RAE 图像配方上,仅改变探索量:达到无探索基线最终性能所需数据少 6.2 倍、FLOPs 少 4.1 倍。
- 在经充分调优的
SiT基线上,FLOP 效率最高提升 52%,以 2.5 倍更少的数据达到同等性能。SiT 实验约用 RAE 实验三分之一的算力,意味着算力增至 3 倍时探索带来的效率增益翻倍以上。 - 参数效率:一个 Large 模型探索 5 个模式,跑赢参数多出 47% 且无探索的 XLarge 模型。
- FLOP 最优的探索量随训练推进而增长(尽管 Forward XM 每多探索一个模式都要付出算力),这与算力最优的参数缩放同构。
2. 收益随规模上升而非饱和(核心证据)
| 缩放维度 | 探索带来的收益变化 |
|---|---|
| 数据规模增长 | 7% → 36% |
| 模型规模增长 | 13% → 23% |
| 算力增至 3 倍 | 效率增益翻倍以上 |
作者指出,基础模型的训练算力比其最大实验高约四个数量级,若趋势延续,本文数字很可能低估了该规模下的收益。
3. 跨模态一致性:固定参数量、仅改变探索模式数——图像(FID)与视频(FVD)性能单调改善,部分模型提升超过 20%,且随探索增加尚未见顶;离散域上,为掩码扩散语言模型加入探索全面改善其困惑度-熵前沿。
4. 最强配方上的表现(ImageNet 256×256,XL 模型训练至 2.2×10²¹ FLOPs)
| 方法 | 无引导 FDr⁶ ↓ | 无引导 gFID ↓ | 无引导 IS ↑ | Prec. ↑ | Rec. ↑ |
|---|---|---|---|---|---|
| SiT | — | 8.61 | 131.7 | 0.68 | 0.67 |
| REPA-E | — | 1.70 | 217.3 | 0.77 | 0.66 |
| DiT^DH-XL(RAE 基线) | 4.42 | 1.55 | 237.3 | 0.79 | 0.64 |
| XDiT^DH-XL, XM-2(本文) | 3.91 | 1.43 | 240.3 | 0.79 | 0.64 |
收敛速度的复合效应:XRAE 比 RAE 快 6.2× 收敛,而 RAE 本身比 SiT 快 47×——合计使 XRAE 比标准 SiT 配方快近 300 倍收敛。
5. 泛化(固定数据集下的最佳可达性能):视频生成中增加探索减少过拟合,最优 FVD 由 37.5(无探索)改善至 30.0(有探索)。由于该改善来自把更多训练算力花在探索上,它构成一种算力-泛化的可交换关系:额外算力直接买到更好的泛化。在数据而非算力日益成为大规模训练瓶颈的背景下,这一性质尤其可贵。
6. 训练拆解与生成拆解可相互替代:比较 XDiffusion 与 XJumpy——XJumpy 随探索增加的改善速率显著更高,在无探索时本弱于 XDiffusion,随探索增加则反超。进一步在 XJumpy 内部改变跳数:跳数更少(更端到端)的模型随探索缩放得更好,即探索增加会降低最优的生成拆解程度。这直接证实探索“可以调节既有生成模型有多端到端”。
7. 独立端到端生成(机器人控制)
| 行为克隆(熟练人类演示,状态观测) | NFE ↓ | Lift | Can | Square | Transport | Tool Hang |
|---|---|---|---|---|---|---|
| Diffusion Policy | 100 | 100% | 100% | 94% | 72% | 86% |
| Explorative Policy | 1 | 100% | 100% | 96% | 74% | 86% |
| Maze2D 目标条件世界建模 | U-Maze 分 / NFE | Medium 分 / NFE | Large 分 / NFE | 平均 分 / NFE |
|---|---|---|---|---|
| Diffuser | 118.7 / 64 | 128.5 / 256 | 134.4 / 256 | 127.2 / 192 |
| Explorative World Model | 121.4 / 4 | 122.9 / 1 | 145.8 / 1.9 | 130.0 / 2.3 |
差距的来源被作者归结为一句话:扩散用推理时的生成步数来支付生成表达力,端到端 XM 则用训练时的探索来支付,从而把推理保持在单次前向。
a / D. Discussion & Conclusion(讨论与结论)
- 理论先于实验(罕见的方法论特征):深度学习多是先跑实验后作解释,本文因建立在 Mode Forcing 之上,多数结果是理论先预测、实验后确认。四项预言逐条被证实:(a)即便最强的生成模型也缺生成表达力——探索提升了所有被测配方的图像、视频与语言生成性能;(b)生成表达力在规模上升时日益成为瓶颈——收益由 7% 升至 36%(数据)、13% 升至 23%(模型),且 FLOP 最优探索量随训练推进而上升;(c)探索可替代生成拆解——探索增加则最优生成拆解量下降、更端到端的模型表现更好;(d)XM 解锁端到端生成——探索式策略与世界模型以低至单次前向匹配扩散基线。
- 对“引导”依赖的重新解读:无分类器引导通过把采样推离无条件模型来锐化样本,而无条件模型因条件更少、模式糊得更厉害;Autoguidance 更进一步,通过推离一个刻意更差、更模式塌缩的模型来改善样本。作者据此指出,引导之所以有效,核心正是因为原模型自身在对条件均值作模糊平均——这构成“当今最好的模型仍缺生成表达力”的旁证。
- 富余生成表达力的额外收益:在多峰性并不强的视频生成设定下(Jumpy 模型仅需 10 步),探索依然显著提升性能。作者的假设是:即便弱多峰的目标,在训练过程中仍会把每次预测拉向多个相互竞争的值,而造成模糊的同一股拉扯也让优化更困难;探索释放了这一压力,使每次预测朝其最近匹配训练,目标更少妥协、优化更容易。这与过参数化同构——富余容量使好解更易被找到,提示探索也值得缩放到超出严格必要的程度。
- 核心结论:探索是既有生成模型中缺失的那条缩放轴,其算力最优量像参数与数据一样随规模增长。这意味着今天不做探索训练的生成模型,随规模增长会日益落后于算力最优探索所能达到的水平。推至极限,生成建模可以变为完全端到端,从而把驱动深度学习其余部分的端到端训练最终带入生成领域。
- 局限:(a)端到端实验使用 Forward XM,其代价随探索模式数增长,难以廉价覆盖极度多峰的分布;作者认为 Reverse XM 更适合端到端生成任务,但大体留待未来工作;(b)自回归大语言模型是最难的一类;(c)评测本身构成障碍——语言建模缺少 FID / FVD 这类能揭示模式覆盖的稳健分布式指标;(d)作者明确表示端到端结果几乎未做调参,因而可能低估了充分调优后 XM 的表现。
- 后续方向:多词元预测的目标多峰性更强,因而更受限于生成表达力,探索的可发挥空间更大;Free Transformer 用变分自编码器推断隐变量条件化解码器,改用探索式建模训练可整个移除该自编码器,并消除在推断隐变量上训练带来的曝光偏差;MeanFlow 等少步模型、能量基 Transformer(其最大难题恰是端到端生成与高度多峰分布)、以及与 JEPA 类特征世界模型的结合(特征空间模式远少于原始观测,故小 K 即够用),均被列为自然的结合点。
🧠 IRMaD 思维导图
mindmap
root((探索式建模与第三条缩放轴))
I 引言
端到端训练重塑了深度学习
生成模型是唯一的例外
训练学一步推理跑上千步
误差层层累积并漂出分布
画一只狗有几十亿个正确答案
直接拟合只能给出模糊平均
R 问题
生成不能拆那还能拆什么
模型只有生成与训练两个过程
参数决定能表示什么
数据决定能学到什么
第三个量决定能生成多少种
它由训练目标钉死无法缩放
M 方法
每步生成K个候选只训最优
实现就是一个for循环
找生成本已最接近的那个候选
每个候选咬住一个不同答案
叠加到扩散流与跳跃式模型
覆盖图像视频与语言
混合实验完全不调超参数
另做独立端到端机器人实验
R 结果
数据省6.2倍算力省4.1倍
中模型探索五次胜过大模型
收益随数据由7%升到36%
收益随模型由13%升到23%
无引导下取得1.43的成绩
叠加后收敛快近三百倍
机器人单次前向胜过百步扩散
世界模型两次求值胜过一百九十二次
视频泛化由37.5改善到30.0
a 讨论
理论先预测实验后确认
四项预言全部兑现
依赖引导本身就是模糊的证据
弱多峰下探索仍然有效
富余容量让好解更易找到
D 结论
探索是缺失的第三条轴
不探索的模型会越拉越远
主用版本代价随K增长
自回归语言模型仍是最难一关
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。