🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
今天的大语言模型之所以强,靠的是一个特别简单的训练目标:猜下一个词。在海量文本上反复练习猜下一个词,就练出了写代码、做数学、复杂推理的能力。
但这个目标带来一个绕不开的副作用:生成的时候只能一个词一个词地往外蹦。推理链越长,这个限制的代价越大——服务延迟变高,强化学习训练也被拖慢,因为那个阶段大部分时间都花在生成上。
作者指出,逐词生成既不符合语言的特点,也不符合现代硬件的特点:
- 语言里有大量固定搭配和套话,本来完全可以成块地一起生成,但标准模型用不上这个冗余。
- 生成过程往往卡在内存搬运上而不是算力上。把模型权重和缓存搬来搬去限制了速度,显卡实际上处于闲置状态。一次多出几个词,就能把这些搬运成本摊薄。
已有的两条解决路线都只解决了一半问题:
- 投机解码:用一个小模型先猜,大模型再验证。但它要求你额外维护一个对齐良好的小模型。
- 扩散语言模型:天生支持并行生成,但相比自回归模型存在质量与速度的取舍,而且它们的加速在大批量场景下会消失。
最后这一点作者特别强调。现在的应用大多是智能体式的:一个请求就可能触发多个并行智能体、分支轨迹、工具调用和重试,服务系统还会跨请求批量处理。所以只看单请求的延迟是一个很窄的工作区间,会高估实际加速。
② 研究问题(要回答什么?)
论文的核心想法作者自己总结得非常简洁:先定义一个高质量的自回归分布,然后学会从同一个分布里并行地抽取多个词。
请注意这句话的分量。它不是说“再造一个更快但差一点的模型”,而是说输出分布必须和原来的自回归模型完全一样,只是抽取方式变了。这就是所谓无损加速的含义。
由此产生几个具体问题:
- 能不能在同一个架构里,把“决定质量的部分”和“决定速度的部分”彻底分开?
- 能不能设计一种采样方式,可证明地保持原模型的输出分布,同时一次出多个词?
- 这种加速能不能在所有批量大小下都保持,而不是只在单请求时好看?
- 能不能不重新训练已有的开源模型,只给它加个插件就获得这个能力?
③ 研究方法(怎么做的?)
作者提出的模型叫 Uno,名字来自它把自回归和扩散两套权重统一进一个架构。
核心设计:两套权重,各管一件事。模型的每一层都有两组参数:自回归权重负责生成质量,用标准流程训练;扩散权重只负责并行出词,用来提速。
这里有个很聪明的工程选择。扩散权重不是另起炉灶的一整套参数,而是做成挂在每个权重矩阵上的低秩适配器——一种很小的“补丁”。这样做有两个好处:一是额外参数极少,二是草稿和验证两条路径共享同一个底座,天然就很接近。而后面的拒绝采样恰恰要求这两个分布足够接近才高效。
训练流程:先按标准方式把自回归权重训好,然后把它冻住,只训练扩散适配器。作者管这个阶段叫扩散蒸馏——让扩散路径学会一口气并行产出一整块词,而这块词正是自回归模型本来会一个个生成出来的那些。
训练目标由两项组成。一项是让学生分布匹配老师分布的蒸馏损失。另一项很有意思,叫全变差损失,它的作用是提高连续多个词被接受的概率,从而让每次能保住的草稿更长。消融实验显示这一项才是提速的主力。
生成时怎么做:作者设计的采样器分两步。先用扩散路径一次前向就草拟一整块词,然后用自回归权重去验证,只保留被接受的最长前缀。因为自回归权重是冻住的、始终不变的验证者,所以整个过程可证明保持原模型的输出分布。
作者还在评测方法上做了一个值得称道的纠正。他指出现有评测在下游任务上测吞吐,而不同模型的推理链长短不一,这会误导性地偏袒那些生成较短推理链的模型。所以他们改用固定输入输出长度的标准化测试,并且既报告单请求吞吐,也报告最大批量下的系统吞吐。
④ 结果(发现了什么?)
实验分两条线:从零训练一个自己的模型,以及给开源的 Qwen3-8B 加装扩散权重。两条线都验证了核心主张。
8B 的 Uno 在几乎所有基准上
胜过 26B 的 DiffusionGemma。
系统吞吐 5255 词每秒,
约为闭源 Mercury 2 的 4.6 倍。
自回归权重用 23 万亿词训练,
扩散权重只用了 70 亿词。
最能说明问题的是与开源扩散模型的对比。8B 的 Uno 在智能体工具使用、智能体编程、长上下文推理、数学、编程各项上全面超过 26B 的 DiffusionGemma 和 14B 的 Nemotron-Labs-Diffusion,在智能体任务上差距尤其大——比如软件工程基准上 Uno 是 68.4 分,DiffusionGemma 只有 18.7 分。
作者特意点出一个关键事实:这两个对比模型都修改了基础的自回归参数,因此是有损的,而 Uno 不是。而且这两个基线在大批量下都比它们各自的自回归母模型还慢——这正是扩散语言模型长期以来的痛点。
和闭源的 Mercury 2 相比,8B 的 Uno 在所有智能体、编程和长上下文基准上都更好,只在一项科学知识基准上略逊。吞吐方面,Uno 的最大系统吞吐约为其 4.6 倍,而作者主动说明这还是在更慢的硬件上跑出来的——Mercury 2 用的是更快的新一代显卡,而且没有公开量化精度,可能还享受了低精度的便宜。
加速幅度上,相对自己的自回归母模型,Uno 在批量为 1 时约快 2.2 倍,在母模型能支持的最大批量下仍快 1.5 倍。加速在所有批量下都存在,这正是扩散模型此前做不到的。
开源模型加装的实验同样有力。给 Qwen3-8B 挂上仅 3.5 亿参数的扩散适配器后,系统吞吐超过 5700 词每秒,单请求场景下比母模型快 2.5 倍。和两个无损投机解码基线相比,Uno 在所有批量下都更快,而且额外参数更少——DFlash 需要 10.5 亿参数,接近 Uno 的三倍。此外因为共享同一份缓存,Uno 的峰值显存也更低。
还有一个作者自己都觉得意外的结果。在强化学习后训练阶段,只更新自回归权重而扩散权重保持冻结。按理说随着底座漂移,草稿和验证会越来越对不上,加速应该退化。但实测加速几乎完整保留,接受长度只下降约 6%,端到端训练提速最高达 40%。
⑤ 讨论(这些发现说明什么?)
这项工作之所以值得当作范式级进展看待,不在于加速倍数,而在于它把一个长期被当作二选一的问题变成了可以合并的问题。
过去几年,自回归和扩散是语言建模的两条对立路线:前者质量高但慢,后者快但质量差。大量工作都在这条取舍曲线上挪动位置。Uno 的做法是不在曲线上挪,而是把两者装进同一个模型——自回归分布定义质量的上限,扩散只负责怎么更快地从这个分布里取样。因为验证者始终是那个没被动过的自回归模型,质量在数学上就被锁死了,速度提升不再需要用质量去换。
和已有方案比,它的位置也很清楚。相对投机解码:不需要单独设计和维护一个草稿模型——作者指出设计草稿模型要做大量关于深度、隐藏维度、注意力头、参数共享的选择,这些负担被完全免除了。相对自投机方法:同样紧密耦合草稿与验证,但做到了无损。
还有一个容易被低估的意义:它可以给已有的开源模型做加装,不需要碰基础参数。这意味着这套方法的收益可以直接迁移到整个开源生态,而不只是作者自己的模型。而且扩散权重和自回归权重不需要在同一批数据上训练——用完全不同的开源数据集训练适配器照样有效,这大大降低了应用门槛。
论文对评测方法学的批评也有独立价值。作者指出在下游任务上测吞吐会偏袒生成短推理链的模型,并主张批量为一的延迟只代表很窄的工作区间。在智能体负载成为主流的今天,这个提醒是及时的。
需要客观看待的地方也有几处。论文没有单独的局限性章节,这是一个体例上的缺失。强化学习那部分的结果作者明确写明“详细结果将在下一版给出”,也就是说 40% 提速这个数字目前还没有配套的完整证据。此外,从零训练那个模型的自回归权重是在内部专有数据上训的,这部分不可复现。作者还把“额外去噪步数能否最终超越自回归质量”这个有意思的问题留给了未来工作——如果能超越,就该关掉自回归验证,但那样也就不再无损了。
⑥ 结论(最终结论 + 启示)
这篇论文提出了扩散增强型大模型:在单一架构内统一两条生成路径,一条是自回归的,一条是自回归加扩散的。
三个最重要的结论是:第一,训练扩散权重所需的词量比训练自回归权重少几个数量级——23 万亿对 70 亿,这让它的应用成本极低。第二,Uno 既可以从零训练,也可以给现有的自回归模型加装。第三,在评测过的所有批量下最高提速 3 倍,在母模型支持的最大批量下仍保持 2 倍,且加速同时惠及推理和强化学习后训练。
作者对这项工作意义的表述值得原样记下来:扩散增强型大模型扩展了自回归语言模型的设计空间,在一个统一的架构中把自回归生成的质量与扩散的并行性结合起来。
换句话说,这不是在既有取舍曲线上又前进了一小步,而是提出了一个新的模型族,让原本必须二选一的两种性质可以同时拥有。这也是它区别于一般效率优化工作的地方。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
大模型的能力源自一个简单而高效的训练目标——在海量语料上做下一词预测(NTP)。该目标的关键局限在于推理低效:只训练预测下一个词,产生的是每个解码步仅生成一个 token 的自回归系统。随着推理轨迹变长,这一顺序约束的代价不断上升,既抬高服务延迟,也拖慢强化学习后训练——该阶段的运行时由 rollout 生成主导。
作者指出顺序解码对自然语言与现代加速器都不适配:(一)语言包含可预测的搭配与套语序列,本可成块生成,而标准 LLM 无法利用这一冗余;(二)解码常受限于内存带宽,尤其在长上下文下,权重与 KV 状态的搬运限制了推理速度并使 GPU 利用不足;每步预测多个 token 可摊薄这些内存传输并更好地利用并行算力。
既有方案仅部分回应了这一机会:投机解码通过验证小草稿模型提出的 token 加速,但其收益依赖一个高效且良好对齐的草稿器,且需要维护一个独立模型;离散扩散模型原生支持并行生成,但领先的 d-LLM 相对 AR 模型仍面临质量—速度取舍,且其加速在大推理批量下消失。
作者对最后一点作了重要的评测学论证:当代 LLM 应用以智能体式负载为主,单个请求即可触发并行智能体、分支轨迹、工具调用与重试,而服务系统还跨请求批处理以提升加速器利用率。因此批量为一的延迟只刻画了一个很窄的操作区间,可能高估在并发下会衰减的加速——实用的加速必须在真实批量下评估。
核心思想:定义一个高质量的 AR 分布,然后学会从同一分布中并行采样多个 token。
I. Theoretical Framework & Hypotheses(理论框架与假设)
| 要素 | 设定 | 与既有路线的关键差别 |
|---|---|---|
| 模型族 | 扩散增强型 LLM:单一架构、两组解耦权重——θ_AR 决定响应质量,θ_Δ 专为生成速度优化 | 不同于多词预测(MTP)——后者通过增加未来 token 的预测头来修改架构;本方法是在每一层为标准 AR 权重旁挂轻量扩散权重 |
| 扩散权重参数化 | LoRA 低秩适配器,草稿路径用 θ_AR + θ_Δ,验证路径用 θ_AR,两个分布经共享底座耦合 | 该耦合是拒绝采样高效的前提;相较独立的全尺寸扩散权重,推理期内存开销极小 |
| 参数化惯例 | 保留标准 AR 的 NTP 参数化:各位置 logits 预测后继清洁 token | 不同于常规扩散语言模型——后者通常预测同一位置的清洁 token |
| 无损性来源 | θ_AR 全程冻结,故基础 AR 模型提供不变的验证者;采样器可证明保持 AR 输出分布 | 相对 EAGLE-3 / DFlash:无需独立草稿模型;相对 TiDAR 等自投机方法:紧密耦合但保持无损 |
| 适用范围 | 可应用于任何因果自回归神经网络,含因果 Transformer 与状态空间模型 | 亦可为已有开源 LLM 加装并行生成能力而无需重训其基础参数 |
四项贡献:(1)提出扩散增强型 LLM 及其训练流水线,把决定响应质量的参数与为生成速度优化的轻量参数解耦;(2)提出 Ψ-Spec 采样器,同时支持无损的 AR 验证式加速与在固定上下文长度下通过额外去噪实现的推理时扩展;(3)给出从零训练与增强现有开源 AR LLM 两条路径;(4)证明在基础 AR 模型支持的最大批量下仍有 2× 加速,并同时加速推理与端到端 RL 训练。
M. Materials & Methods(材料与方法)
- 双路径结构:
p_θAR(x_ℓ | x_<ℓ) = x^{ℓ−1}_{θAR}(x)为因果掩码下的 AR 路径;扩散路径给出p_{θAR,θΔ}(x_ℓ | z_t) = x^{ℓ−1}_{θAR,θΔ}(z_t)。仅在扩散蒸馏阶段训练θ_Δ,θ_AR保持冻结。 - 扩散蒸馏(目标函数):
L(θ_Δ; θ_AR, α, β) = E[ α·L_DCD + β·L_TV ]。作者说明α=0, β=1产生最大加速,但先以α=β=1训练再切换可加快收敛。 - 一步蒸馏:标准离散一致性蒸馏(DCD)需模拟多步去噪轨迹,在 LLM 规模上反复构造与存储中间潜变量代价过高。作者把整条轨迹蒸馏为单个去噪步,把完全损坏的输入
z₁直接映射到清洁序列x,从而无需模拟或物化任何中间 PF-ODE 状态。 - 块扩散:单步从完全损坏输入恢复整条长序列过于困难,故按块执行——将
x与z₁划分为N个大小为B的块,训练θ_Δ使学生在块x^(b)上的分布(条件于噪声块与前序清洁上下文)匹配教师 AR 在同块上的分布。教师与学生预测在拼接序列[x, z₁]上一次前向算出,使用块因果注意力掩码。 - gated LoRA 的关键作用:需要在
x位置仅用θ_AR算教师 logits,而在z₁位置用θ_AR + θ_Δ算学生 logits。作者以 gated LoRA 实现——在清洁序列位置禁用适配器、在噪声序列位置启用。目标为L_DCD = Σ_b Σ_ℓ D_KL( 学生 ‖ 教师 )。 - 全变差损失(提速主力):采样器只保留扩散预测中被接受的最长连续前缀,故效率取决于该前缀长度。据 Leviathan 等人的推论最小化块级 TV 距离
L_TV = Σ_b Σ_ℓ |学生 − 教师|,以提高连续 token 被接受的概率,从而增加被接受草稿前缀的期望长度。 - Ψ-Spec 采样器:单次扩散前向草拟整块
B个 token;第一个 token 由基础 AR 权重生成故必然被接受;对其余候选施加标准投机解码的拒绝校正,保留被基础 AR 接受的最长前缀,从而保持目标分布。多候选时以树注意力并发验证为前缀树。每前向 token 数(TPF)的界为1 ≤ TPF ≤ (B+1)/2——因为即便立即被拒也产出两个 token(必接受的首 token 与验证者从重归一化残差分布采样的替换 token),而每轮需要草稿与验证两次前向。 - 推理时扩展(新维度):允许去噪步数
T超过草拟 token 数B。与常规推理时扩展方法不同,该途径在不增加上下文长度的前提下分配额外计算。作者指出若额外去噪的质量最终能超越 AR,则应关闭 AR 验证(否则输出被约束在 AR 的质量水平),并把这一质量—算力权衡的系统探索留作未来工作。 - 训练课程的两种规程:仅加速推理——先完成 AR 预训练与后训练(或直接以开源 LLM 初始化),冻结
θ_AR后训练θ_Δ;同时加速 RL 与推理——在 SFT 之后、RL 之前施加扩散蒸馏,所得适配器即可加速 RL rollout。 - 从零训练配置:稠密 decoder-only 因果 Transformer,36 层、隐藏宽度 4,096、SwiGLU MLP 宽度 12,288、32 个 query 头与 8 个 KV 头、头维 128、grouped RMSNorm、RoPE(
θ=10⁷)、250,624 词表、最大配置上下文 524,288。参数量为 6.95B 主干加约 2.05B 的输入/输出词表矩阵。AR 权重在内部专有数据上训练约 23T tokens,采用分阶段上下文扩展(21.9T@8K → 1.1T@32K → 0.5T@128K → 0.3T@512K)。扩散权重为 rank-128 LoRA(α_LoRA = 256),仅在自 SFT 数据随机采样的 7B tokens 上训练,采用上下文长度与块大小课程,全局批量 128,峰值学习率5×10⁻⁵,α=0.01, β=1;训练约 60 小时(8 个 H200 节点 × 8 卡)。 - 评测方法学的修正:作者批评既有评测在推理轨迹长度不一的下游任务上测吞吐,会误导性地偏袒生成较短轨迹的模型。改用固定
m个随机输入 token 与固定n个输出 token(1K/8K 吞吐测试),并先测各方法跨基准的平均 TPF,再按⌈n/TPF⌉步运行,确保所有方法在相同的输入与有效输出长度下比较。同时报告批量为 1 的单请求吞吐与单张 H200 上最大可行批量的系统吞吐。
R. Results(结果)
- 对比开源 d-LLM(8B Uno vs. 26B-A4B DiffusionGemma vs. 14B Nemotron-Labs-Diffusion)
关键限定(作者主动给出):两个基线均修改了基础 AR 参数,因而是有损的,Uno 不是;且两个基线在大批量下都慢于其各自的基础 AR 模型。DiffusionGemma 在批量 1 时更快但准确率显著更低;Uno 尽管每层都用全注意力,系统吞吐仍高于使用带状注意力的 DiffusionGemma。基准 Uno (8B) DiffusionGemma (26B-A4B) Nemotron-Labs-Diffusion (14B) τ2 Telecom 90.1 68.1 14.3 Terminal-Bench v2.1 39.6 14.7 4.5 SWE-bench Verified 68.4 18.7 0.8 AA-LCR 长上下文 68.0 19.7 7.3 GPQA-Diamond 77.1 70.7 40.4 AIME-25 90.7 74.3 40.0 MATH500 98.9 92.4 89.2 系统吞吐(tok/s) 5255 1136 2794 单请求吞吐(tok/s) 405 836 290 - 对比闭源 Mercury 2:8B 的 Uno 在全部智能体工具使用、智能体编程与长上下文推理基准上胜出,仅在一项科学知识基准(AA-Omniscience 14.3 vs 20)上落后,作者归因于模型规模与训练数据的差异。吞吐上 Uno 的最大系统吞吐约为其 4.6×;作者主动说明这还是在明显更慢的硬件上取得的(Mercury 2 运行于更快的 Blackwell GPU),且 Mercury 2 未披露其量化方式,可能还受益于更低精度,而 Uno 与其他基线均用 bfloat16。
- 相对基础 AR 模型:在 1K/8K 测试中,基础 AR 支持的最大批量为 64,此时 Uno 快 1.5×;批量为 1 时约快 2.2×。加速在每一个评测批量下都存在,同时支持低延迟生成与高吞吐服务。
- 开源模型加装(UnoQwen,基于 Qwen3-8B):AR 权重自开源检查点初始化并全程冻结;扩散适配器为 rank-128 LoRA,仅引入 0.35B 可训练参数,在 OpenThoughts3-1.2M 上训练三个 epoch(14.7B tokens),约 32 小时(4 节点 × 8 张 H200)。要点:虽然在该数据集上训练 Qwen3-8B 本身会损害其质量,但在同一数据上训练的扩散权重仍能在相同基准上带来无损加速——证明扩散与 AR 权重无需在同一数据分布上训练。
- 对比无损投机解码基线
系统吞吐相对基础 AR 提速 1.6×,单请求提速 2.5×,并在所有批量下帕累托占优。额外优势:EAGLE-3 与 DFlash 为草稿与验证各维护独立的 KV 缓存,峰值内存更高;Uno 共享单份缓存。训练成本:DFlash 对块大小指标 UnoQwen EAGLE-3 DFlash 平均接受长度 τ(系统最优 B=4) 3.89 2.08 2.07 平均接受长度 τ(单请求最优) 5.97 3.48 2.74 系统吞吐(tok/s) 5733 4944 5351 单请求吞吐(tok/s) 445 284 370 峰值显存(GiB,越低越好) 122.2 130.0 130.1 额外参数(B,越少越好) 0.35 0.40 1.05 B与序列长度L需要B·L的训练上下文,而本方法恒为2·L,与B无关。 - 公平性处理:DFlash 官方建议关闭思考模式以获得更大加速,但作者指出这会把平均准确率自 76.36% 降至 55.40%,因此为公平比较保留思考模式。
- RL 后训练加速(作者称为意外结果):自 SFT 检查点以 DAPO 训练数学、代码、工具使用与网页搜索四个专家,仅更新
θ_AR而扩散权重保持冻结。本应预期草稿分布随底座漂移而偏离验证者、接受率下降从而侵蚀加速,但实测加速得以保留,TPF 仅名义性下降 6%;端到端训练提速最高 40%,主要来自数学与代码专家(工具使用与搜索专家因工具调用主导运行时而增益较小)。四个专家随后以数据无关的 ISO-Merger 方法合并。作者注明该部分“详细结果将在下一版提供”。 - 消融:(1)损失项——仅用
L_TV的 TPF 为 2.39,优于L_DCD + L_TV(2.23)与仅L_DCD(2.23);进一步分析发现L_DCD比L_TV大一个数量级,将其权重降至 0.01 后 TPF 微升至 2.40。(2)课程——每半个 epoch 把块大小自 4 提到 16,TPF 自 2.65 升至 2.71,优于固定块大小 16 训练两个 epoch。(3)适配器配置——把扩散适配器分布到所有层比把同等参数量集中于部分层更有效;rank 自 128 增至 256 提升 TPF 但抬高推理成本;α_LoRA/r_LoRA比值为 64 时最佳。 - 采样器配置:Linear 采样器 TPF 自
B=4的 1.8 升至B=8的 2.2,但B=16仅达 2.3;B=4取得最高系统吞吐。Tree 采样器在(B,K,V)=(16,32,32)下单请求吞吐优于V=64,作者判断是更大的验证开销降低了吞吐。
a / D. Discussion & Conclusion(讨论与结论)
- 范式意义:论文提出扩散增强型 LLM,在单一架构内统一两条生成路径——由
θ_AR参数化的自回归路径与由θ_AR + θ_Δ参数化的扩散路径。其要害不在于加速倍数,而在于把长期对立的 AR 与扩散两条路线合并为一个模型族:AR 分布定义质量上限,扩散仅负责如何更快地从该分布中采样;因验证者是未被改动的 AR 模型,质量在数学上被锁定,速度提升不再以质量为代价。 - 训练经济性:训练扩散权重所需的 token 量比训练 AR 权重少数个数量级(23T vs. 7B)。这使得该能力既可从零构建,也可作为轻量加装施加于既有 AR 模型。
- 相对既有方案的定位:作为 EAGLE-3、DFlash 等投机扩散方法的即插即用替代而无需独立草稿模型——作者指出设计草稿模型需就深度、隐藏维度、MLP 扩张、注意力头数、参数共享与目标特征的 KV 投影作出大量选择,这些负担被完全免除;作为 TiDAR 等自投机方法的替代则不引入有损加速。
- 生态意义:可在不重训基础参数的前提下为开源 LLM 加装并行生成能力,且扩散权重与 AR 权重不必在同一数据分布上训练——即便在会损害基础模型质量的数据集上训练适配器,无损加速依然成立。这使收益可直接迁移至整个开源生态。
- 评测方法学贡献:论文对既有吞吐评测提出两点批评并给出替代方案——其一,在推理轨迹长度不一的下游任务上测吞吐会偏袒生成较短轨迹的模型,应改用固定输入输出长度的标准化测试;其二,在智能体负载已成主流的当下,批量为一的延迟只刻画很窄的操作区间,可能高估并发下会衰减的加速,故须并报系统吞吐。
- 作者对贡献的最终表述:“扩散增强型 LLM 扩展了自回归语言模型的设计空间,在一个统一架构中把 AR 生成的质量与扩散的并行性结合起来。”
- 需要客观看待之处:论文没有独立的局限性章节;RL 加速部分明确注明“详细结果将在下一版提供”,故 40% 的端到端提速目前缺少配套的完整证据;从零训练路径的 AR 权重使用内部专有数据,该部分不可复现;推理时扩展这一新维度(增加去噪步数 T 是否可能超越 AR 质量,以及届时应否关闭 AR 验证——但那将不再无损)被明确留作未来工作;TPF 存在结构性上界
(B+1)/2,因每轮必须付出草稿与验证两次前向。
🧠 IRMaD 思维导图
mindmap
root((扩散增强型大模型))
I 引言
下一词预测带来推理低效
逐词生成拖慢服务与强化学习
语言中的套话本可成块生成
解码常受限于内存搬运
投机解码要另养草稿模型
扩散模型有质量速度取舍
大批量下扩散加速会消失
智能体负载使批量一不具代表性
R 核心思想
先定义高质量自回归分布
再学会从同一分布并行采样
质量与速度参数彻底解耦
输出分布可证明保持不变
M 方法
每层两组权重
扩散权重做成低秩适配器
草稿与验证共享同一底座
冻结自回归权重做扩散蒸馏
整条轨迹压成单步去噪
按块并行 用块因果掩码
门控适配器分离师生 logits
全变差损失拉长接受前缀
草拟一块再验证保留最长前缀
改用固定长度吞吐测试
R 结果
八十亿参数胜二百六十亿
软件工程 68.4 对 18.7
系统吞吐 5255 词每秒
约为闭源方案四点六倍
且跑在更慢的硬件上
相对母模型全批量都更快
加装到开源模型仍有效
额外参数仅三点五亿
共享缓存 峰值显存更低
强化学习后加速几乎不衰减
端到端训练提速四成
消融显示全变差损失是主力
a 讨论
不在取舍曲线上挪而是合并
验证者不变故质量被锁死
免去草稿模型的设计负担
适配器无需同分布数据
收益可迁移至开源生态
批量一的延迟会高估加速
D 结论
扩散权重训练量少几个量级
可从零训练也可加装
最高三倍 最大批量仍两倍
扩展了自回归模型设计空间
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。