arXiv 预印本 · 2026-09-03 · 提出新模型族 · 8B 模型胜过 26B DiffusionGemma 与闭源 Mercury 2 · 代码与权重开源

用离散扩散解锁大模型的无损加速:扩散增强型语言模型 Uno

Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham 等 8 人 · arXiv 预印本 (cs.LG / cs.CL) · 2026 · arXiv: 2609.04010
原题:Unlocking Lossless Speedups in LLMs via Discrete Diffusion
Open Access 新颖度 0.87

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

今天的大语言模型之所以强,靠的是一个特别简单的训练目标:猜下一个词。在海量文本上反复练习猜下一个词,就练出了写代码、做数学、复杂推理的能力。

但这个目标带来一个绕不开的副作用:生成的时候只能一个词一个词地往外蹦。推理链越长,这个限制的代价越大——服务延迟变高,强化学习训练也被拖慢,因为那个阶段大部分时间都花在生成上。

作者指出,逐词生成既不符合语言的特点,也不符合现代硬件的特点

已有的两条解决路线都只解决了一半问题:

最后这一点作者特别强调。现在的应用大多是智能体式的:一个请求就可能触发多个并行智能体、分支轨迹、工具调用和重试,服务系统还会跨请求批量处理。所以只看单请求的延迟是一个很窄的工作区间,会高估实际加速

② 研究问题(要回答什么?)

论文的核心想法作者自己总结得非常简洁:先定义一个高质量的自回归分布,然后学会从同一个分布里并行地抽取多个词

请注意这句话的分量。它不是说“再造一个更快但差一点的模型”,而是说输出分布必须和原来的自回归模型完全一样,只是抽取方式变了。这就是所谓无损加速的含义。

由此产生几个具体问题:

③ 研究方法(怎么做的?)

作者提出的模型叫 Uno,名字来自它把自回归和扩散两套权重统一进一个架构

核心设计:两套权重,各管一件事。模型的每一层都有两组参数:自回归权重负责生成质量,用标准流程训练;扩散权重只负责并行出词,用来提速。

这里有个很聪明的工程选择。扩散权重不是另起炉灶的一整套参数,而是做成挂在每个权重矩阵上的低秩适配器——一种很小的“补丁”。这样做有两个好处:一是额外参数极少,二是草稿和验证两条路径共享同一个底座,天然就很接近。而后面的拒绝采样恰恰要求这两个分布足够接近才高效。

训练流程:先按标准方式把自回归权重训好,然后把它冻住,只训练扩散适配器。作者管这个阶段叫扩散蒸馏——让扩散路径学会一口气并行产出一整块词,而这块词正是自回归模型本来会一个个生成出来的那些。

训练目标由两项组成。一项是让学生分布匹配老师分布的蒸馏损失。另一项很有意思,叫全变差损失,它的作用是提高连续多个词被接受的概率,从而让每次能保住的草稿更长。消融实验显示这一项才是提速的主力。

生成时怎么做:作者设计的采样器分两步。先用扩散路径一次前向就草拟一整块词,然后用自回归权重去验证,只保留被接受的最长前缀。因为自回归权重是冻住的、始终不变的验证者,所以整个过程可证明保持原模型的输出分布

作者还在评测方法上做了一个值得称道的纠正。他指出现有评测在下游任务上测吞吐,而不同模型的推理链长短不一,这会误导性地偏袒那些生成较短推理链的模型。所以他们改用固定输入输出长度的标准化测试,并且既报告单请求吞吐,也报告最大批量下的系统吞吐

④ 结果(发现了什么?)

实验分两条线:从零训练一个自己的模型,以及给开源的 Qwen3-8B 加装扩散权重。两条线都验证了核心主张。

小模型胜过大模型
8B 的 Uno 在几乎所有基准上
胜过 26B 的 DiffusionGemma。
系统吞吐大幅领先
系统吞吐 5255 词每秒,
约为闭源 Mercury 2 的 4.6 倍
训练成本极低
自回归权重用 23 万亿词训练,
扩散权重只用了 70 亿词。

最能说明问题的是与开源扩散模型的对比。8B 的 Uno 在智能体工具使用、智能体编程、长上下文推理、数学、编程各项上全面超过 26B 的 DiffusionGemma 和 14B 的 Nemotron-Labs-Diffusion,在智能体任务上差距尤其大——比如软件工程基准上 Uno 是 68.4 分,DiffusionGemma 只有 18.7 分。

作者特意点出一个关键事实:这两个对比模型都修改了基础的自回归参数,因此是有损的,而 Uno 不是。而且这两个基线在大批量下都比它们各自的自回归母模型还慢——这正是扩散语言模型长期以来的痛点。

和闭源的 Mercury 2 相比,8B 的 Uno 在所有智能体、编程和长上下文基准上都更好,只在一项科学知识基准上略逊。吞吐方面,Uno 的最大系统吞吐约为其 4.6 倍,而作者主动说明这还是在更慢的硬件上跑出来的——Mercury 2 用的是更快的新一代显卡,而且没有公开量化精度,可能还享受了低精度的便宜。

加速幅度上,相对自己的自回归母模型,Uno 在批量为 1 时约快 2.2 倍,在母模型能支持的最大批量下仍快 1.5 倍加速在所有批量下都存在,这正是扩散模型此前做不到的。

开源模型加装的实验同样有力。给 Qwen3-8B 挂上仅 3.5 亿参数的扩散适配器后,系统吞吐超过 5700 词每秒,单请求场景下比母模型快 2.5 倍。和两个无损投机解码基线相比,Uno 在所有批量下都更快,而且额外参数更少——DFlash 需要 10.5 亿参数,接近 Uno 的三倍。此外因为共享同一份缓存,Uno 的峰值显存也更低。

还有一个作者自己都觉得意外的结果。在强化学习后训练阶段,只更新自回归权重而扩散权重保持冻结。按理说随着底座漂移,草稿和验证会越来越对不上,加速应该退化。但实测加速几乎完整保留,接受长度只下降约 6%,端到端训练提速最高达 40%

⑤ 讨论(这些发现说明什么?)

这项工作之所以值得当作范式级进展看待,不在于加速倍数,而在于它把一个长期被当作二选一的问题变成了可以合并的问题

过去几年,自回归和扩散是语言建模的两条对立路线:前者质量高但慢,后者快但质量差。大量工作都在这条取舍曲线上挪动位置。Uno 的做法是不在曲线上挪,而是把两者装进同一个模型——自回归分布定义质量的上限,扩散只负责怎么更快地从这个分布里取样。因为验证者始终是那个没被动过的自回归模型,质量在数学上就被锁死了,速度提升不再需要用质量去换。

和已有方案比,它的位置也很清楚。相对投机解码:不需要单独设计和维护一个草稿模型——作者指出设计草稿模型要做大量关于深度、隐藏维度、注意力头、参数共享的选择,这些负担被完全免除了。相对自投机方法:同样紧密耦合草稿与验证,但做到了无损

还有一个容易被低估的意义:它可以给已有的开源模型做加装,不需要碰基础参数。这意味着这套方法的收益可以直接迁移到整个开源生态,而不只是作者自己的模型。而且扩散权重和自回归权重不需要在同一批数据上训练——用完全不同的开源数据集训练适配器照样有效,这大大降低了应用门槛。

论文对评测方法学的批评也有独立价值。作者指出在下游任务上测吞吐会偏袒生成短推理链的模型,并主张批量为一的延迟只代表很窄的工作区间。在智能体负载成为主流的今天,这个提醒是及时的。

需要客观看待的地方也有几处。论文没有单独的局限性章节,这是一个体例上的缺失。强化学习那部分的结果作者明确写明“详细结果将在下一版给出”,也就是说 40% 提速这个数字目前还没有配套的完整证据。此外,从零训练那个模型的自回归权重是在内部专有数据上训的,这部分不可复现。作者还把“额外去噪步数能否最终超越自回归质量”这个有意思的问题留给了未来工作——如果能超越,就该关掉自回归验证,但那样也就不再无损了。

⑥ 结论(最终结论 + 启示)

这篇论文提出了扩散增强型大模型:在单一架构内统一两条生成路径,一条是自回归的,一条是自回归加扩散的。

三个最重要的结论是:第一,训练扩散权重所需的词量比训练自回归权重少几个数量级——23 万亿对 70 亿,这让它的应用成本极低。第二,Uno 既可以从零训练,也可以给现有的自回归模型加装。第三,在评测过的所有批量下最高提速 3 倍,在母模型支持的最大批量下仍保持 2 倍,且加速同时惠及推理和强化学习后训练。

作者对这项工作意义的表述值得原样记下来:扩散增强型大模型扩展了自回归语言模型的设计空间,在一个统一的架构中把自回归生成的质量与扩散的并行性结合起来

换句话说,这不是在既有取舍曲线上又前进了一小步,而是提出了一个新的模型族,让原本必须二选一的两种性质可以同时拥有。这也是它区别于一般效率优化工作的地方。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

大模型的能力源自一个简单而高效的训练目标——在海量语料上做下一词预测(NTP)。该目标的关键局限在于推理低效:只训练预测下一个词,产生的是每个解码步仅生成一个 token 的自回归系统。随着推理轨迹变长,这一顺序约束的代价不断上升,既抬高服务延迟,也拖慢强化学习后训练——该阶段的运行时由 rollout 生成主导。

作者指出顺序解码对自然语言与现代加速器都不适配:(一)语言包含可预测的搭配与套语序列,本可成块生成,而标准 LLM 无法利用这一冗余;(二)解码常受限于内存带宽,尤其在长上下文下,权重与 KV 状态的搬运限制了推理速度并使 GPU 利用不足;每步预测多个 token 可摊薄这些内存传输并更好地利用并行算力。

既有方案仅部分回应了这一机会:投机解码通过验证小草稿模型提出的 token 加速,但其收益依赖一个高效且良好对齐的草稿器,且需要维护一个独立模型离散扩散模型原生支持并行生成,但领先的 d-LLM 相对 AR 模型仍面临质量—速度取舍,且其加速在大推理批量下消失

作者对最后一点作了重要的评测学论证:当代 LLM 应用以智能体式负载为主,单个请求即可触发并行智能体、分支轨迹、工具调用与重试,而服务系统还跨请求批处理以提升加速器利用率。因此批量为一的延迟只刻画了一个很窄的操作区间,可能高估在并发下会衰减的加速——实用的加速必须在真实批量下评估。

核心思想:定义一个高质量的 AR 分布,然后学会从同一分布中并行采样多个 token

I. Theoretical Framework & Hypotheses(理论框架与假设)

要素设定与既有路线的关键差别
模型族扩散增强型 LLM:单一架构、两组解耦权重——θ_AR 决定响应质量,θ_Δ 专为生成速度优化不同于多词预测(MTP)——后者通过增加未来 token 的预测头来修改架构;本方法是在每一层为标准 AR 权重旁挂轻量扩散权重
扩散权重参数化LoRA 低秩适配器,草稿路径用 θ_AR + θ_Δ,验证路径用 θ_AR,两个分布经共享底座耦合该耦合是拒绝采样高效的前提;相较独立的全尺寸扩散权重,推理期内存开销极小
参数化惯例保留标准 AR 的 NTP 参数化:各位置 logits 预测后继清洁 token不同于常规扩散语言模型——后者通常预测同一位置的清洁 token
无损性来源θ_AR 全程冻结,故基础 AR 模型提供不变的验证者;采样器可证明保持 AR 输出分布相对 EAGLE-3 / DFlash:无需独立草稿模型;相对 TiDAR 等自投机方法:紧密耦合但保持无损
适用范围可应用于任何因果自回归神经网络,含因果 Transformer 与状态空间模型亦可为已有开源 LLM 加装并行生成能力而无需重训其基础参数

四项贡献:(1)提出扩散增强型 LLM 及其训练流水线,把决定响应质量的参数与为生成速度优化的轻量参数解耦;(2)提出 Ψ-Spec 采样器,同时支持无损的 AR 验证式加速在固定上下文长度下通过额外去噪实现的推理时扩展;(3)给出从零训练与增强现有开源 AR LLM 两条路径;(4)证明在基础 AR 模型支持的最大批量下仍有 2× 加速,并同时加速推理与端到端 RL 训练。

M. Materials & Methods(材料与方法)

R. Results(结果)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((扩散增强型大模型))
    I 引言
      下一词预测带来推理低效
      逐词生成拖慢服务与强化学习
      语言中的套话本可成块生成
      解码常受限于内存搬运
      投机解码要另养草稿模型
      扩散模型有质量速度取舍
      大批量下扩散加速会消失
      智能体负载使批量一不具代表性
    R 核心思想
      先定义高质量自回归分布
      再学会从同一分布并行采样
      质量与速度参数彻底解耦
      输出分布可证明保持不变
    M 方法
      每层两组权重
      扩散权重做成低秩适配器
      草稿与验证共享同一底座
      冻结自回归权重做扩散蒸馏
      整条轨迹压成单步去噪
      按块并行 用块因果掩码
      门控适配器分离师生 logits
      全变差损失拉长接受前缀
      草拟一块再验证保留最长前缀
      改用固定长度吞吐测试
    R 结果
      八十亿参数胜二百六十亿
      软件工程 68.4 对 18.7
      系统吞吐 5255 词每秒
      约为闭源方案四点六倍
      且跑在更慢的硬件上
      相对母模型全批量都更快
      加装到开源模型仍有效
      额外参数仅三点五亿
      共享缓存 峰值显存更低
      强化学习后加速几乎不衰减
      端到端训练提速四成
      消融显示全变差损失是主力
    a 讨论
      不在取舍曲线上挪而是合并
      验证者不变故质量被锁死
      免去草稿模型的设计负担
      适配器无需同分布数据
      收益可迁移至开源生态
      批量一的延迟会高估加速
    D 结论
      扩散权重训练量少几个量级
      可从零训练也可加装
      最高三倍 最大批量仍两倍
      扩展了自回归模型设计空间

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。