arXiv 预印本 · 2026-07-29 · 伊利诺伊大学厄巴纳-香槟 + 哈佛 · 图像 / 视频 / 语言三模态验证 · ImageNet 无引导 FID 1.43

探索式建模:预训练的第三根轴,以及端到端生成的解锁

Alexi Gladstone, Heng Ji, Yilun Du · arXiv (cs.LG / cs.AI / cs.CL / cs.CV) · 2026 · arXiv: 2607.27372
原题:Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
Open Access 新颖度 0.89

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

深度学习有一条被反复验证的经验:让模型端到端地学,效果好过人手把任务拆成几段。这条经验从 AlexNet 开始,一路改写了图像分类、目标检测、图像分割等领域。

原因说起来很朴素:端到端的模型,推理时的做法和训练时完全一样,因此永远不会遇到训练中没见过的输入,也就不会出现越跑越偏的问题。

但生成模型一直是这条规律的例外。今天最主流的生成模型——自回归模型和扩散模型——训练时只学一步,用的时候却要连着跑几百上千步。每一步的误差都会喂给下一步,输入逐渐飘出训练时见过的范围,误差不断累积。

为什么非要这么拆?因为生成的本质是要处理多峰分布

这话可以这样理解:让模型“画一只狗”,正确答案不是一个,而是几十亿个。如果直接让模型一步到位地去拟合,它只能给出所有正确答案的平均值——而平均出来的那个东西,往往不是任何一只真实的狗,是一团模糊。

现有做法是把生成拆成很多小步,让每一步的目标几乎只有一个答案,从而躲开这种模糊。可恰恰是这个拆法,让生成模型没法端到端。

② 研究问题(要回答什么?)

作者提出了一个非常干净的问题:既然生成过程不能拆,那还有什么可以拆?

一个生成模型总共只有两个过程可以被分解:它怎么生成,以及它怎么训练。既然生成不能拆,那就拆训练循环。

由此引出这篇论文真正的主张。作者认为,衡量一个生成模型的能力,除了大家熟知的两个维度之外,还有第三个被长期忽略的维度。参数量决定了模型能表示什么;数据量决定了模型能学到什么;而第三个维度决定了模型能生成出多少个不同的答案而不把它们糊成一团

作者把这第三个量叫做生成表达力。它的特殊之处在于:它由训练目标本身决定,无论你把参数和数据堆到多大,它都纹丝不动。一个直接回归的模型,这个量等于 1——哪怕给它无限的参数和数据,它最好的输出也只是所有答案的一个模糊平均。

于是问题变成:能不能把这第三个量也变成可以缩放的?

③ 研究方法(怎么做的?)

方法本身简单到有点朴素,作者自己也承认,最简形式就是“取 K 选一”。

在每一个训练步,模型不再只生成一个候选,而是生成 K 个,然后只对其中离真实数据最近的那一个做梯度更新。实现上就是一个 for 循环,只有最好的那次生成能拿到梯度。

关键在于理解这样做为什么有效。在标准训练里,模型的输入(比如一个随机噪声)会被随机配给某个真实样本,而同一个输入在整个数据集上会被配给许多个不同的样本。模型被要求用同一个输入去还原许多个不同的答案,它能做的最好的事就是输出这些答案的平均——那团模糊就是这么来的。

而探索式建模反过来做:它去找那个生成结果本来就最接近某个真实样本的候选。这样一来,每个候选都可以稳稳地咬住一个不同的答案,模型能捕捉的答案数量,就随着探索量直接增长。

实验上作者分两条线走。第一条线是把探索加到已有的生成模型上——扩散模型、流匹配模型、以及一种可以调节步数的跳跃式模型,覆盖图像、视频和语言三个领域。作者特别强调,这些实验没有为探索单独调过任何超参数,完全沿用原配方,只是加上探索。

第二条线是把探索当作独立方法,做真正的端到端生成,在机器人控制任务上与扩散方法正面对比。

④ 结果(发现了什么?)

实验结果分成效率增益、规模趋势与端到端生成三层,一层比一层更能说明问题。

第一层是效率。在一个当时最强的图像生成配方上加入探索,达到原配方最终水平所需的数据少了 6.2 倍,计算量少了 4.1 倍。参数效率也在提升——一个中等规模的模型探索 5 个候选,跑赢了一个参数多出 47% 的更大模型。

第二层,也是最关键的一层:这些收益不但没有饱和,反而随规模上升。

7% → 36%
随数据规模增长
探索带来的收益
13% → 23%
随模型规模增长
探索带来的收益
1.43
ImageNet 无引导下的
接近最好水平的成绩

这一点至关重要。它意味着探索的行为方式与参数和数据是同一类的——规模越大,不做探索的模型离最优配置就差得越远。作者还指出,真正的基础模型训练所用算力比他们最大的实验还要高出约四个数量级,因此这些数字很可能是低估。

收敛速度的对比更直观:加了探索的配方比原配方快 6.2 倍收敛,而原配方本身已经比更早的基线快 47 倍——两者叠加接近 300 倍。

第三层是端到端生成,这是此前没有做到过的事。在机器人模仿学习任务上,扩散策略需要 100 次网络前向,而探索式策略只用 1 次,成绩反而略胜(方块任务 96% 对 94%,搬运任务 74% 对 72%,其余持平)。在目标导向的世界模型任务上,扩散基线平均需要 192 次函数求值得到 127.2 分,探索式世界模型平均只用 2.3 次就拿到 130.0 分。

还有一个额外发现:探索能改善泛化。在视频生成上,加入探索把最好的成绩从 37.5 提升到 30.0,且过拟合更晚出现。

⑤ 讨论(这些发现说明什么?)

这篇论文有一个不太常见的特点,作者自己也点了出来:深度学习通常是先做实验再解释,而这项工作是理论先预测、实验后确认。他们逐条列出了理论的四项预言及其验证结果,包括“即便最强的生成模型也缺生成表达力”“规模越大它越成为瓶颈”“探索可以替代生成拆解”“探索能解锁端到端生成”,四条全部被实验证实。

其中第三条的验证方式最漂亮。作者用了一种能自由调节生成步数的模型:如果拆训练真的能替代拆生成,那么探索加得越多,最优的生成步数就应该越少。实验正是如此——随着探索增加,越端到端的模型表现越好。这等于说,探索让我们可以“调节一个生成模型有多端到端”。

作者还给了一个有趣的旁证:今天的生成模型如此依赖引导技巧,本身就是模式被糊掉的证据。引导的做法是把采样推离一个更模糊、更容易塌缩的模型;它之所以管用,恰恰是因为原模型自己也在糊。

另一个意外发现是:即便在多峰性并不强的任务上,探索依然有明显帮助。作者的解释是,哪怕目标只有轻微的多峰性,训练过程中每次预测仍会被几个相互竞争的值拉扯,而这种拉扯不只造成模糊,也让优化本身变难。这和过参数化的道理相通——富余的容量让好解更容易被找到。

⑥ 结论(最终结论 + 启示)

这项工作的分量在于它提出的不是一个更好的技巧,而是一根新的坐标轴。

作者的结论是:今天所有不做探索的生成模型,随着规模增长,都会离计算最优的水平越来越远。因为它们的生成表达力在设计训练目标的那一刻就被钉死了,而参数和数据这两根轴无论怎么加都撬不动它。

沿着这条思路走到极限,生成建模就能变成完全端到端的——把驱动了深度学习其余部分的端到端训练,终于也带进生成领域。

作者对局限交代得很清楚。他们主要使用的这个版本,代价会随探索数量增长,因此难以廉价地覆盖极度多峰的分布,另一个代价更低的变体留待后续工作。自回归大语言模型是最难的一类,一部分原因是评测本身——语言建模缺少像图像和视频那样能揭示模式覆盖情况的分布式指标。

他们也指出了几条具体的后续路线:多词元预测的目标多峰性更强,因而更能从探索中获益;某些用变分自编码器推断隐变量的架构,如果改用探索式训练,可以把那个自编码器整个去掉。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

自 AlexNet 起,端到端训练击败人工设计的分阶段流水线,这一模式已重塑图像分类、目标检测、图像分割等领域。其收益归结为一条性质:端到端模型推理时的执行方式与训练时完全一致,因而永不暴露于训练中未见过的输入,避免了损害性能与泛化的分布漂移与曝光偏差。

生成建模却始终是这一趋势的例外。当今最常用、扩展性最好的配方——重构式生成模型(自回归、扩散、流)——推理时的采样方式与训练时截然不同:训练时只预测单步,推理时却作为循环网络展开数百至数千个词元或去噪步,逐步误差层层传递,使输入漂离训练分布并复合放大。

作者论证其根源在于:生成建模的本质是处理多峰概率分布。为在规模上做到这一点,现有重构式模型统一采取把生成过程分解为更小的步骤,使每步目标近乎单峰,从而使重构损失不再把不同模式糊成其均值。而这一分解,恰恰正是阻止生成模型端到端的原因。

由此产生本文的枢纽性追问:既然生成过程不能拆,还有什么可拆?一个生成模型只有两个可分解的过程——如何生成与如何训练。既已排除前者,本文转而分解训练循环本身,是为探索式建模(Explorative Modeling)

I. Theoretical Framework & Hypotheses(理论框架与假设)

理论承接 Mode Forcing 的核心论点:现代生成建模的技艺,在于设计一个其损失最小值捕捉模式而非求其平均的重构目标

概念定义意义
耦合(coupling)输入与其应映射到的目标之间的配对重构式模型事先不知道该配对,故一个输入常被配给数据集中多个有效目标
模式模糊一对多耦合下,重构损失的最小值是这些目标的均值均值落在模式之间,不匹配任何真实数据点(脱离数据流形)
生成表达力 EE ≜ sup_{p*, c} sup_{θ* ∈ argmin L(θ)} M(P_θ*(·|c)),即某方法的损失最小值在任意数据分布上所能保留的最大条件模式数由训练目标本身设定,参数与数据无论如何缩放都不改变它
直接回归器E = 1即便参数与数据无限,最优输出仍是全部模式的单一模糊均值
探索 K 个候选E 提升到至少 K把模糊的均值锐化为彼此区分的模式

反直觉之处:直接平方误差回归本身就是固定方差高斯下的极大似然——似然被忠实地最大化了,只是所优化的密度其生成表达力为 1,而它对多峰数据的最佳拟合就是均值。作者据此指出:“有足够数据与参数就做某种极大似然”这一传统观念并不充分,生成表达力是一条被忽略的缩放轴;这也可能解释长期观察到的似然与样本质量相关性很差的现象——似然衡量密度拟合得多好,生成表达力决定该密度能容纳多少模式。

端到端的严格定义:当一个生成模型训练时与推理时的采样方式相同,从而永不在推理时暴露于未经训练的输入,即称其为端到端(此处指模型自身的生成过程,不涉及测试时的分布漂移)。

可替代性命题:既然分解生成的目的正是提供生成表达力,那么分解生成与分解训练是可相互替代的——本文在第 4 节予以实证确认。

M. Materials & Methods(材料与方法)

R. Results(结果)

1. 效率增益(作为新缩放轴)

2. 收益随规模上升而非饱和(核心证据)

缩放维度探索带来的收益变化
数据规模增长7% → 36%
模型规模增长13% → 23%
算力增至 3 倍效率增益翻倍以上

作者指出,基础模型的训练算力比其最大实验高约四个数量级,若趋势延续,本文数字很可能低估了该规模下的收益。

3. 跨模态一致性:固定参数量、仅改变探索模式数——图像(FID)与视频(FVD)性能单调改善,部分模型提升超过 20%,且随探索增加尚未见顶;离散域上,为掩码扩散语言模型加入探索全面改善其困惑度-熵前沿

4. 最强配方上的表现(ImageNet 256×256,XL 模型训练至 2.2×10²¹ FLOPs)

方法无引导 FDr⁶ ↓无引导 gFID ↓无引导 IS ↑Prec. ↑Rec. ↑
SiT8.61131.70.680.67
REPA-E1.70217.30.770.66
DiT^DH-XL(RAE 基线)4.421.55237.30.790.64
XDiT^DH-XL, XM-2(本文)3.911.43240.30.790.64

收敛速度的复合效应:XRAE 比 RAE 快 6.2× 收敛,而 RAE 本身比 SiT 快 47×——合计使 XRAE 比标准 SiT 配方快近 300 倍收敛。

5. 泛化(固定数据集下的最佳可达性能):视频生成中增加探索减少过拟合,最优 FVD 由 37.5(无探索)改善至 30.0(有探索)。由于该改善来自把更多训练算力花在探索上,它构成一种算力-泛化的可交换关系:额外算力直接买到更好的泛化。在数据而非算力日益成为大规模训练瓶颈的背景下,这一性质尤其可贵。

6. 训练拆解与生成拆解可相互替代:比较 XDiffusion 与 XJumpy——XJumpy 随探索增加的改善速率显著更高,在无探索时本弱于 XDiffusion,随探索增加则反超。进一步在 XJumpy 内部改变跳数:跳数更少(更端到端)的模型随探索缩放得更好,即探索增加会降低最优的生成拆解程度。这直接证实探索“可以调节既有生成模型有多端到端”。

7. 独立端到端生成(机器人控制)

行为克隆(熟练人类演示,状态观测)NFE ↓LiftCanSquareTransportTool Hang
Diffusion Policy100100%100%94%72%86%
Explorative Policy1100%100%96%74%86%
Maze2D 目标条件世界建模U-Maze 分 / NFEMedium 分 / NFELarge 分 / NFE平均 分 / NFE
Diffuser118.7 / 64128.5 / 256134.4 / 256127.2 / 192
Explorative World Model121.4 / 4122.9 / 1145.8 / 1.9130.0 / 2.3

差距的来源被作者归结为一句话:扩散用推理时的生成步数来支付生成表达力,端到端 XM 则用训练时的探索来支付,从而把推理保持在单次前向。

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((探索式建模与第三条缩放轴))
    I 引言
      端到端训练重塑了深度学习
      生成模型是唯一的例外
      训练学一步推理跑上千步
      误差层层累积并漂出分布
      画一只狗有几十亿个正确答案
      直接拟合只能给出模糊平均
    R 问题
      生成不能拆那还能拆什么
      模型只有生成与训练两个过程
      参数决定能表示什么
      数据决定能学到什么
      第三个量决定能生成多少种
      它由训练目标钉死无法缩放
    M 方法
      每步生成K个候选只训最优
      实现就是一个for循环
      找生成本已最接近的那个候选
      每个候选咬住一个不同答案
      叠加到扩散流与跳跃式模型
      覆盖图像视频与语言
      混合实验完全不调超参数
      另做独立端到端机器人实验
    R 结果
      数据省6.2倍算力省4.1倍
      中模型探索五次胜过大模型
      收益随数据由7%升到36%
      收益随模型由13%升到23%
      无引导下取得1.43的成绩
      叠加后收敛快近三百倍
      机器人单次前向胜过百步扩散
      世界模型两次求值胜过一百九十二次
      视频泛化由37.5改善到30.0
    a 讨论
      理论先预测实验后确认
      四项预言全部兑现
      依赖引导本身就是模糊的证据
      弱多峰下探索仍然有效
      富余容量让好解更易找到
    D 结论
      探索是缺失的第三条轴
      不探索的模型会越拉越远
      主用版本代价随K增长
      自回归语言模型仍是最难一关

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。