🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
现在几乎所有的大语言模型,写字的方式都是一个词一个词往下接。给它一个开头,它预测下一个词;把这个词接上,再预测下一个。像接龙一样,从左到右,一路往下。这套做法叫自回归,是当今主流模型的共同底子。
但还有另一条路,叫扩散。它的思路完全不同:先给你一整段被遮住大半的文字,让模型同时猜出所有被遮住的位置该填什么,然后一轮轮地把遮罩逐步揭开、逐步修正。这更像是先打一个模糊的草稿,再反复地把它擦亮,而不是从左往右一字一句地写。
扩散这条路有个天然的诱人之处:既然是同时猜多个位置,那就有并行生成的可能,不必像接龙那样必须等前一个字定下来。可它一直有个悬而未决的问题——规模放大之后还行不行?
这个问题为什么重要?因为训练一个大模型极其昂贵,你不可能靠试错来决定「用多大的批量」「学习率设多少」「参数和数据该怎么分配」。业界的做法是先在小模型上做大量测量,拟合出一组放大规律,再用这些规律外推到大规模。问题在于,现有的这套规律全都是从接龙式模型上总结出来的。扩散式模型能不能直接照搬?如果不能,差在哪、差多少?在这篇论文之前,没人系统地回答过。
② 研究问题(要回答什么?)
这项研究要回答的是,扩散式语言模型在放大规模时该遵循什么规律,以及这些规律和主流的接龙式模型有没有实质区别。作者把它拆成三个具体问题,正好对应训练大模型时必须做的三类决策:
- 第一,训练时的旋钮怎么调?算力预算变大时,批量该跟着放多大,学习率该降多快?
- 第二,钱该花在哪?给定一个固定的算力预算,应该拿去把模型做大,还是拿去多喂数据?
- 第三,模型内部怎么搭?确定了模型这一侧的预算之后,这些算力该怎么切分——是要很多个小专家还是少数几个大专家?要不要留一个所有输入都会经过的「公共专家」,留多大?
而这项研究真正的目的,其实藏在这些技术问题的背后。作者要检验的是一个更根本的命题:把扩散式模型认真地按规律放大之后,它能不能在同等规模上追上主流的接龙式模型?这关系到扩散究竟只是一个有趣的学术分支,还是一条真能走通的主干道。
③ 研究方法(怎么做的?)
第一步,标定训练旋钮。作者在一批从一亿五千多万到三十六亿参数不等的模型上做了大规模的超参数搜索,算力预算跨越好几个数量级。做完之后,还特意把预算再往上推了一档,检验拟合出来的规律能不能外推到搜索范围之外——结果显示推荐值确实落在实测最优点附近。这一步做得很扎实,因为放大规律的全部价值就在于外推,不验证外推就等于没验证。
这里有一个概念上的关键区分。接龙式训练时,你喂进去多少个词,就有多少个预测目标。但扩散式不同:只有被遮住的位置才算数。按常见的做法,平均只有一半的词会被遮住。也就是说,同样喂一百万个词,扩散式模型实际得到的监督信号只有接龙式的一半左右。作者预判这会改变梯度的噪声水平,进而影响批量和学习率的最优值——这个预判后来被数据证实了。
第二步,决定钱花在哪。作者用了业界标准的做法:固定总算力,然后系统地改变「模型大小」和「训练数据量」的配比,看哪种配比损失最低。把不同算力预算下的最优点连起来,就得到两条「前沿曲线」。
这一步作者做了一个特别有说服力的设计:他们把自己的结果放进一张横跨多项既有研究的对照表里。这张表的妙处在于,它包含了两组「只改一个变量」的对照——
- 有一项研究在同样是接龙式的前提下比较了稠密结构与专家混合结构;
- 另一项研究在同样是稠密结构的前提下比较了接龙式与扩散式。
这两组对照各自指向同一个方向:无论是改成专家混合,还是改成扩散式,都会让最优配比更偏向「多喂数据」。而本文的设定恰好是两者叠加。这就把一个孤立的测量结果,变成了一个有机制解释的结论。
第三步,设计模型内部结构。专家混合模型的思路是:模型里养一大群「专家」,每个词进来只激活其中少数几个,这样总参数可以很大,但实际计算量不大。作者固定住模型侧的算力预算,然后每次只改一个维度,扫描三件事:激活比例(每次用多大比例的专家)、专家颗粒度(把算力切成多少个专家)、以及公共专家占多大份额。
④ 结果(发现了什么?)
研究得到的核心结论是,扩散式模型的放大规律确实与接龙式模型不同,而且这些差别足以影响实际的训练决策。
在同一个算力预算下,接龙式的规律推荐的批量约是一百万个词,而扩散式的实测最优约是三百四十万个词——差了三倍多。有意思的是,学习率两者反而差别不大。作者把批量的巨大差异归因于前面说的「有效监督减半」。
模型侧与数据侧的最优指数分别约为 0.475 和 0.525。两者都接近对半开,但天平明确地偏向数据这一侧。也就是说,多出来的算力,更值得花在多读一些数据上。
在所有测试的规模上,最优的公共专家占比都稳定在三分之一左右,而且损失曲线呈清晰的 U 形。
第三条尤其值得展开,因为它和主流做法明确冲突。在接龙式模型的世界里,公共专家的处理各不相同:有的用四分之一,有的干脆完全不用,还有研究报告说最优比例应当随规模递减,因此建议「固定留一个公共专家就好」。而扩散式模型在这里给出了相反的答案——公共通路的容量应当随模型预算按比例一起增长,而不是保持固定份额然后被稀释掉。作者把它总结成一条好记的规则:每两份路由容量,配一份公共容量。
另外两个结构维度的结论则更朴素:激活比例越稀疏越好,而且规模越大这个好处越明显(作者的解释是极稀疏路由意味着更大的专家池,需要足够的算力才能被训练充分);专家颗粒度没有随规模变化的单调趋势,作者据此判断它不是一个主要的放大方向,在一个中等区间内取值都稳健。
最后是规模化验证。作者按上述规律训了一个总参数三百亿、每个词激活三十亿的模型,从零开始训练,用了二十三点五万亿个词。这个数字大约是同规模主流接龙式模型所用数据量的六成半。结果:
- 在多项知识、推理、编程基准上逼近同规模的主流接龙式模型,而数据量少了约三分之一。
- 与另一个没有这套规律指导的扩散式专家混合模型相比,用远少得多的训练算力达到了同等水平。
- 只做了标准的监督微调之后,在八项推理与编程基准中的七项上超过了一个同规模的扩散式对话模型;而在与主流接龙式模型的比较中仍有竞争力——尽管对方还多做了一轮强化学习。
⑤ 讨论(这些发现说明什么?)
要恰当评价这项工作,得先把它的性质说清楚。它没有提出新的架构,也没有提出新的训练目标。扩散式语言模型、专家混合结构、放大规律的研究方法,都是现成的。那它凭什么算得上重要?
因为它回答的是一个范式层面的问题:非自回归的生成方式,究竟能不能在规模上站住脚?
这个问题不能靠讲道理回答,只能靠把模型真的训出来。而在这项工作之前,想认真训一个大规模扩散语言模型的团队会面临一个尴尬处境:手上唯一能参考的放大规律全部来自接龙式模型,而没人知道它们在扩散场景下偏差多大。这篇论文测出的批量差异——三倍多——说明这个偏差不是可以忽略的小数。若照搬接龙式的推荐值去训一个大扩散模型,很可能一开始就跑在一个明显次优的配置上,而且训到一半才发现,代价极其昂贵。
那个「公共专家占比三分之一」的发现,是全文最有意思的技术点。它之所以有价值,不只是因为它给出了一个数,而是因为它和接龙式模型的主流经验方向相反:接龙式那边的趋势是公共部分随规模相对缩小甚至取消,扩散式这边却要求它按比例一起长大。作者对此给出的解释是,扩散式的路由器面对的输入性质根本不同——接龙式的路由器看到的是确定的前文,而扩散式的路由器看到的是被随机遮住、且遮罩比例还在变化的残缺状态。这种输入的多变性,可能正是需要一条稳定的公共通路来兜底的原因。这个解释目前还是合理推测而非被验证的机制,但它至少让这个反直觉的数字有了可理解的来由。
那张跨研究的对照表同样是方法论上的亮点。单独看「我们的指数偏向数据侧」,这只是一个孤立测量,读者很难判断它是真实规律还是实验设置的偶然产物。但作者把它嵌进两组只改一个变量的对照里,说明「稀疏激活」和「扩散目标」各自都会把天平往数据侧推,而本文正是两者叠加。从一个数变成一个有方向、有机制、可预期的结论,说服力完全不同。
需要客观说明的边界:论文的主张相当克制,用词是「逼近」而非「超越」——扩散式模型仍未在同等规模上全面胜过成熟的接龙式模型。作者也如实指出对方还多做了一轮强化学习,这既是解释也是限定。此外,扩散范式最被寄予厚望的并行解码带来的实际推理加速,在这份以放大规律为主题的工作中并未成为评测重点。
⑥ 结论(最终结论 + 启示)
这项工作的价值,在于它把扩散式语言模型从「有潜力的替代方案」推到了「有章可循的工程路线」。以前想沿这条路走的人,缺的不是想法,而是一张可靠的地图——算力该怎么分、旋钮该怎么拧、结构该怎么搭。这篇论文把这三件事都测了出来。
更重要的是,它证明了地图是准的:按图训出来的三百亿参数模型,用大约六成半的数据量,在多项基准上逼近了同规模的主流接龙式模型;只做标准微调,就在八项推理与编程任务中的七项上超过了同类对手。
三条结论里,最值得记住的是那些与接龙式经验不一致的地方:批量要开得大得多,算力要更偏向数据侧,公共专家的容量要随规模一起长大而不是被稀释。这些差异不是微调级别的,而是会实质影响训练成败的量级。
而这项工作留下的开放问题也很清楚:扩散范式最诱人的那个承诺——并行生成带来的速度优势——还需要在这样的规模上被兑现和量化。放大规律解决的是「能不能训得起来、训得够好」,而这条路线最终能否成为主流,还取决于它在推理端能兑现多少。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
扩散语言模型(dLLM)为自回归(AR)语言建模提供了一条替代路径,但混合专家(MoE)dLLM 的放大行为仍缺乏刻画。本文系统表征优化超参数、算力分配与架构三个维度上的放大规律,并识别其与既有 AR 放大趋势的定量差异。
作者提出三个层层递进的问题:(1) 最优批量与学习率如何随算力变化;(2) 固定算力预算应如何在激活的模型侧计算与训练 token 之间分配;(3) 所得激活预算应如何分解为路由稀疏度、专家颗粒度与共享容量。其总体判断是:AR 经验提供了有用的先验,但需要 dLLM 特定的重新标定。
研究的最终检验是规模化验证:依据所得规律从零训练 LLaDA MoE v2(30B-A3B,23.5T tokens),并在与同规模 AR MoE 强模型的对比中评估该范式的可行性。
I. Theoretical Framework & Hypotheses(理论框架与假设)
算力度量的选择:稠密模型研究常用 C ≈ 6ND(N 为非嵌入参数量,D 为训练 token 数),其前提是所有参数参与处理每个 token。该假设对 MoE 不成立,故本文遵循既有 MoE 放大研究采用 C = MD,其中 M 为每 token 激活的非嵌入训练 FLOPs。
dLLM 特有的监督稀释(贯穿全文的核心机制):AR 训练在因果前缀上优化下一 token 预测,而 dLLM 以掩码去噪目标在部分可观测序列上训练。由于每次更新仅监督被采样的掩码位置,名义 token 批量并不直接对应预测目标数量——在常见的均匀时间步采样下,期望仅有一半 token 被预测。作者据此预判:有效监督的降低将改变梯度噪声水平、优化稳定性与学习率敏感性。
| 维度 | 发现 | 与 AR 的关系 |
|---|---|---|
| 优化 | 最优批量随算力增长更陡 | 定量不同 |
| 最优学习率随算力衰减更快 | 定量不同 | |
| 算力分配 | 近乎均衡但略偏数据侧 | 方向一致,程度不同 |
| MoE dLLM 前沿比稠密 dLLM 更偏数据 | 叠加效应 | |
| MoE 架构 | 规模越大越偏好低激活比 | 趋势一致 |
中等颗粒度 G = 8–16 稳健 | 非主要放大方向 | |
最优共享专家比 S = 33.3% 跨尺度不变 | 与 AR 经验相反 |
三个架构维度的定义:激活比 A 控制路由稀疏度并因而决定路由专家池规模;专家颗粒度 G 在路由多样性与单专家容量之间权衡;共享专家比 S 决定分配给共享通路的激活容量比例。作者强调 dLLM 的架构设计问题具有特殊性,因为路由器作用于随噪声水平与掩码模式而变的掩码去噪状态,而非因果前缀。
M. Materials & Methods(材料与方法)
- 超参数放大实验:在 158M 至 3.6B 的代表性模型尺度上,于
10¹⁸至3×10²⁰FLOPs 的算力预算范围内,对名义 token 批量与学习率做联合搜索,拟合幂律B*(C)与η*(C)。 - 外推验证:将联合搜索由
3×10²⁰继续推进至6×10²⁰FLOPs,检查二维超参平面上的损失网格。结果显示拟合推荐值接近实测最优配置,且邻域损失未显示存在显著更优的替代方案——该步骤是放大规律可用性的关键检验。 - IsoFLOP 分配实验:在
10¹⁷至10²⁰训练 FLOPs 的固定预算下扫描M与D的配比,取各预算内损失最低的分配点(M*(C), D*(C)),并拟合两条前沿。 - 架构受控扫描:对每个参考算力尺度
C,固定激活的模型侧预算为M*(C),然后每次只扫描一个架构维度而固定其余两个,分别考察A、G、S。 - 规模化模型配置:LLaDA MoE v2 总参数 30B、每 token 激活 3B。依放大分析取
(A, G, S) = (9.09%, 8, 33.3%)。具体实现为每层 128 个细粒度路由专家 + top-8 路由 + 1 个宽度为4·d_expert的共享专家(n_s = 4),由此A = (8+4)/(128+4) = 9.09%,S = 4/(8+4) = 33.3%。 - 训练规模:从零训练于 23.5T tokens,为 SDAR Sci 的 37.05T 的 63%、Qwen3 的 36T 的 65%。
- 后训练:仅施加标准监督微调(SFT),未使用强化学习阶段。
R. Results(结果)
- R1 · 优化超参:方向一致,标定不同。最优批量随算力次线性增长、最优学习率随算力下降,方向与 AR 一致。但定量校准存在系统性差异:在
C = 10²⁰FLOPs 处,DeepSeek 的 AR 律预测学习率9.86×10⁻⁴而本文拟合为8.27×10⁻⁴(接近),但最优批量为 1.02M vs 3.43M tokens(相差逾三倍)。作者明确将该批量差异归因于前述「每名义 token 的有效监督减少」,形成机制与观测的闭环。结论:AR 放大律可作先验,但在趋势分歧处不能替代 dLLM 特定标定。
算力分配前沿的跨研究对照
| 放大规律 | 建模 | 架构 | 模型侧指数 | 数据侧指数 |
|---|---|---|---|---|
| Kaplan | AR | Dense | 0.73 | 0.27 |
| Chinchilla | AR | Dense | 0.49 | 0.51 |
| DeepSeek LLM | AR | Dense | 0.5243 | 0.4757 |
| Llama 3 | AR | Dense | 0.463 | 0.537 |
| Ling | AR | Dense | 0.5422 | 0.4578 |
| Ling | AR | MoE | 0.5095 | 0.4905 |
| SMDM | AR | Dense | 0.644 | 0.356 |
| SMDM | Diffusion | Dense | 0.634 | 0.366 |
| Quokka | Diffusion | Dense | 0.514 | 0.486 |
| DLMs | Diffusion | Dense | 0.566 | 0.434 |
| 本文 | Diffusion | MoE | 0.475 | 0.525 |
- R2 · 分配前沿:
M*(C) = 0.5152·C^0.475,D*(C) = 1.9411·C^0.525。两指数均接近 0.5,但数据侧略大,即最优 token 预算的增长快于激活的模型侧计算。IsoFLOP 曲线呈 U 形:小模型即使见到更多 token 仍受容量限制,大模型则因同预算下 token 更少而受数据限制。 - R3 · 两组单变量对照解释了该倾斜(本文最具方法论价值之处):(i) Ling 在同为 AR 下比较稠密与 MoE,指数由
0.5422/0.4578移至0.5095/0.4905——稀疏激活推动前沿偏向数据;(ii) SMDM 在同为稠密下比较 AR 与 dLLM,指数由0.644/0.356移至0.634/0.366——扩散目标同向。本文兼具稀疏激活与扩散目标,其 0.525 的数据侧指数高于所有既有稠密 dLLM 前沿,与两项分别的数据偏好倾向一致。实践规则:MoE dLLM 的边际算力更值得投入额外训练 token,而非提高每 token 激活 FLOPs。 - R4 · 激活比:固定
M*(C)下降低A普遍降低训练损失,且收益随算力增大而更显著。作者如实报告了一个例外:在最小预算处,次稀疏设置略优于最稀疏设置——并解释为极稀疏路由暴露更大的路由专家池,需足够算力方能被有效优化。 - R5 · 专家颗粒度:
G跨算力尺度无单调趋势,作者据此判定其并非主要放大方向,而主要体现路由多样性与单专家容量之间的权衡。经验稳健区间为G = 8–16,但确切最优不随算力系统性变化。 - R6 · 共享专家比(与 AR 经验相反的发现):所有算力尺度上损失曲线均为 U 形且最小值稳定落在
S = 33.3%。对照 AR MoE 设计:DeepSeekMoE 采用S = 25%,Qwen3 不使用共享专家,Ling 报告最优比由16.7%递减至8.3%并据此提出「固定一个共享专家」的启发式。本文的 dLLM 扫描相反地支持共享通路容量随激活模型预算按比例增长,而非其相对贡献随规模递减。由此导出 dLLM 特定规则:每两单位路由激活容量,配约一单位共享激活容量。 - R7 · 规模化验证:LLaDA MoE v2(30B-A3B,23.5T tokens)在多项知识、推理与编程基准上逼近 Qwen3 30B-A3B,而预训练 token 仅约其 65%(少约 35%);并以其若干分之一的训练算力匹配一个未经此类指导开发的既有 MoE dLLM。
- R8 · SFT 后表现:仅经标准监督微调,即在八项推理与编程基准中的七项上超过 SDAR Chat 30B-A3B,并在多项基准上与 Qwen3 保持竞争力——尽管 Qwen3 另有一个额外的 RL 阶段(作者主动指出该不对等)。
a / D. Discussion & Conclusion(讨论与结论)
- 贡献的性质(评注):本文未提出新架构或新训练目标——扩散语言建模、MoE 结构、放大规律方法论均为既有。其重要性在于回答一个范式层面的经验问题:非自回归生成范式能否在规模上成立。该问题无法由论证解决,只能由「按规律训出规模化模型并与同规模 AR 强模型对比」来回答,这正是本文所做的。
- 工程价值:在本文之前,试图训练大规模 dLLM 的团队只能参考全部来自 AR 的放大律,且不知偏差幅度。本文测得的三倍以上批量差异表明该偏差并非可忽略的小量——照搬 AR 推荐值将使大规模训练从一开始就运行在明显次优配置上,而这类错误的发现成本极高。
- 最具信息量的发现:
S = 33.3%的跨尺度稳定性之所以重要,不仅因其给出数值,更因其方向与 AR 主流经验相反。作者的机制解释是 dLLM 路由器的输入性质根本不同——AR 路由器面对确定的因果前缀,而 dLLM 路由器面对随噪声水平与掩码模式变化的受损状态;这种输入多变性可能正是需要一条容量按比例增长的稳定共享通路的原因。需注意该解释目前属合理推断而非经验证的机制。 - 方法论亮点:跨研究对照表通过两组单变量受控比较(AR 下的稠密 vs MoE;稠密下的 AR vs 扩散),将「我们的指数偏向数据侧」由孤立测量转化为有方向、有机制、可预期的结论。这显著强于仅报告自身拟合值。
- 报告的克制与诚实:主张用词为「逼近(approaches)」而非「超越」;主动披露 Qwen3 额外的 RL 阶段;主动报告最小预算下激活比的例外情形;并将幂律指数明确置于跨研究语境中而非单独宣称。
- 局限(评注):(1) dLLM 范式最受期待的并行解码推理加速并未成为本文评测重点——本文主题为训练侧放大规律,推理侧收益的规模化兑现仍待验证;(2) 超参数放大律的拟合范围为 158M–3.6B 与
10¹⁸–3×10²⁰FLOPs,而验证模型为 30B-A3B / 23.5T tokens,存在相当幅度的外推(作者以推进至6×10²⁰的检验部分缓解了该顾虑);(3) 扩散式模型在同等规模上尚未全面超越成熟 AR 模型。
🧠 IRMaD 思维导图
mindmap
root((扩散语言模型的放大规律))
I 引言
主流模型逐词接龙生成
扩散式同时猜多个位置
并行生成是其潜在优势
规模放大规律尚属空白
现有规律全来自自回归
R 问题
训练旋钮该怎么调
算力该给模型还是数据
专家结构该怎么切分
放大后能否追上主流
M 方法
多尺度模型超参搜索
推到搜索范围外验证外推
固定算力扫描配比
跨研究单变量对照
每次只改一个架构维度
按规律从零训练验证
R 结果
最优批量比自回归大三倍
学习率反而差别不大
归因于有效监督减半
数据侧指数略高于模型侧
稀疏激活与扩散同向叠加
激活越稀疏规模越受益
专家颗粒度并非主要方向
共享专家占比稳定在三分之一
与自回归经验方向相反
微调后八项中七项胜出
a 讨论
未提新架构却回答范式问题
照搬旧规律代价高昂
路由器面对的输入性质不同
仅逼近而非超越
推理加速尚未被兑现
D 结论
为扩散路线画出可靠地图
六成半数据量逼近同规模
差异大到会影响训练成败
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。