🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
今天的大语言模型在生成文字时,每写完一个字,上一步在脑子里算出的全部结果都会被丢掉,只剩下那个被说出口的字传给下一步。
这听起来有点浪费,事实也确实如此。作者把模型的计算方向拆成两条轴:横轴是沿着已经写出来的字往回看,纵轴是从模型底层一路算到顶层。横轴上,注意力机制让每个新字都能读到前面所有字留下的记录,可以说是宽得不能再宽;可纵轴上,两步之间的通道却窄得可怜。
窄到什么程度?模型顶层算出来的是一个上千维的向量,里面装着它对下一步的判断、犹豫、半成品结论;而真正传给下一步的,只是从这个向量里采样出来的一个词。一个词能携带的信息,上限就是词表大小取对数那么多比特,其余的全被压没了。
更麻烦的是,那些没被说出口的中间计算并没有消失——它们还躺在缓存里——但它们被冻在了自己出生的那一层。第五层算出来的东西,只有第六层往上能读到,永远没机会回到第一层被重新加工一遍。
所以现在流行的思维链其实是在做一件相当笨拙的事:模型必须把心里的草稿一个字一个字念出来,这些内容才能重新进入自己的底层。念出来,是信息回流的唯一通道。
再加上一个现实压力:高质量的独特语料正在见底,靠堆数据继续变强这条路越走越窄。于是问题变成了——能不能从同一份数据里榨出更多东西?
② 研究问题(要回答什么?)
这篇论文想问的是,能不能把那条被压到只剩一个词的回流通道,拓宽成一整条隐状态。
它把这个大问题拆成了三问。
- 问题一 · 能不能接上:把上一步顶层的隐状态直接喂回下一步的输入,同时不改架构、不动缓存、不换训练目标,做得到吗?做得到的话,现有的服务系统就一行都不用重写。
- 问题二 · 能不能训得动:这样一接,模型就变成了沿字序列展开的循环结构,而循环是没法并行训练的。可 Transformer 之所以能做大,靠的恰恰是所有位置一起算。这个矛盾怎么解?
- 问题三 · 值不值:多花的这点计算,能不能真的换来相当于更多训练数据的效果?模型会不会因为心里能装住东西,就少说几句废话?
还藏着一个更根本的追问:如果模型真的可以不说出口也把想法带到下一步,那我们一直相信的「让模型把推理过程写出来」,会不会只是一种受限于通道宽度的权宜之计?
③ 研究方法(怎么做的?)
解决办法说穿了只有一句话:让上一步的顶层隐状态,和这一步采样出来的词,合成一个输入再送进模型。
怎么合?作者用了一个叫门控线性单元的小零件。打个比方:隐状态是一桶水,词是一张有洞的筛网。水从筛网漏下去,筛网决定哪里能漏、漏多少。落到算式上,就是把隐状态做一次线性变换当「水」,把词向量做一次线性变换再压到零一之间当「阀门」,两者逐位相乘。
这里有个故意设计的不对称。如果改成「词 + 隐状态」这种加法式融合,模型会耍滑头:把隐状态那一路的权重压到零,输入就退化回普通的词,照样能拿到不错的损失,宽通道就白修了。而用乘法门,把水倒掉就什么都不剩了——读隐状态从「可选」变成了「必须」。
怎么训?这才是真正的难点。融合输入得等上一个位置算完才能拿到,而 Transformer 训得快全靠所有位置并行。作者的招数是多遍前向:第一遍照常跑,把每个位置的顶层状态存下来;第二遍把这些状态整体右移一位,和词融合之后再并行跑一遍全模型;第三遍再来一次。跑几遍,就等于把这个反馈动作训练了几步的跨度。顺序性从「跨几千个词」被压缩成了「跨三遍」。
怎么省?多跑一遍就是多一倍计算,所以作者只在训练中后期才把它掺进来:七成五的批次照常单遍跑,两成二跑两遍,剩下三个百分点跑三遍。就这三个百分点,是全文最反直觉的一笔。
另外还有两道保险:一是前缀混入,训练时随机挑一个位置,前面用普通词向量、后面才用融合输入,好让模型习惯推理时「提示词是普通的、生成部分才是融合的」这种半半结构;二是一组稳态技巧——深度缩放、对融合输入做归一化、词嵌入与输出层共享权重、给隐状态加一点小抖动噪声。
④ 结果(发现了什么?)
结果相当漂亮,只训练四千亿词元的全带宽模型就追平甚至超过了训练更多词元的标准模型,而每生成一个词多付的代价还不到百分之一。
在验证损失和五样本选择题评测上,训练了 1000 亿词元的全带宽模型多跑两遍反馈,就达到标准模型训练 2000 亿词元的水平;2000 亿的全带宽模型则达到标准模型 4000 亿词元的水平。换算下来大约是两倍的预训练数据效率。
在 2000 亿词元的基座模型上,MATH-500 的正确率从 0.27 升到 0.37,越过了训练满一万亿词元的标准基线;HumanEval 从 0.31 升到 0.34,MBPP 从 0.38 升到 0.40。四个任务上没有一个变差。
4000 亿词元的全带宽模型在 GSM8K 上从 67.90 提到 71.80,MATH-500 从 46.00 提到 48.40,两项都越过了一万亿词元的标准模型(70.13 与 47.40)。
而且它话变少了。在基座模型上开启潜在反馈之后,模型的推理过程明显变短,准确率却持平甚至更高。这正是「宽通道」理论预言的现象——原本必须一个词一个词念出来的中间步骤,现在可以骑在隐状态上走。不过作者也老实指出,这个效果在指令微调之后消失了:微调数据本身就是标准逐词推理写出来的,模型等于又被教回了啰嗦的说话方式。
那三个百分点有多要紧?只用单遍加两遍训练出来的模型,一旦反馈次数超过训练时见过的深度,验证损失就急剧上升,隐状态的变化幅度来回震荡,说明它跑飞了。而只要掺进三个百分点的三遍批次,验证损失在三十步反馈之内都是平的,隐状态变化衰减到一个小平台——学到的映射从发散变成了收敛到不动点,作者甚至在一千次反馈下都没看到崩溃。
最直接的证据在探针实验里。作者造了两个人工任务,答案完全由冒号之前的内容决定。标准方式下,模型第零层的线性探针准确率接近瞎猜;而把上一个位置的顶层状态融合进来之后,第零层探针的准确率跳到 99.6% 和 100%。全局信息真的被一条捷径直送到了最浅的那一层。
⑤ 讨论(这些发现说明什么?)
这项工作真正动的不是某个模块,而是大家默认的扩展方向。
过去多年,模型变强的公式基本是「参数更多 + 数据更多」。但高质量的独特语料是有限的,芯片规模和墙上时钟也是有限的。作者指出,当每个参数能分到的词元数和可用语料都被卡死之后,再堆数据就不再是唯一出路;另一条轴是——在同一份数据上花更多的计算。潜在反馈就是这条轴上一个很具体的做法。
第二层意义关于思维链。我们一直把「把推理过程写出来」当成模型变聪明的办法。这篇论文提示,写出来可能只是因为没有别的路可走。一旦纵向通道被拓宽,一部分思考就不必再被翻译成文字。这对「模型写出来的推理是否忠实反映了它真实的计算」这类可解释性问题,是个不太舒服的消息:能力上去了,可看见的部分反而少了。
作者自己划的几条界线,值得照抄:
- 它不是循环神经网络。循环网络每一步都把压缩后的状态覆盖掉,而这里过去的状态仍然完整躺在缓存里,随时可读,没有任何一个「会被写坏的寄存器」。
- 它没有加深解码时的串行深度。开不开反馈,每生成一个词都还是走一遍模型,总代价的量级不变,变的只是通道的宽度。
- 探针读得出,不等于模型用得上。作者特意强调,第零层能线性解码出答案只说明信息在那里,不说明模型真的拿它做了决定;只有下游任务的成绩才说明后一件事。
- 规模只做到十亿参数。更深的模型顶层状态更丰富,作者猜收益会更大,但没验证过。反馈遍数的调度也还是一套经验手法,没有理论依据。
还有一个不能忽略的背景:同期至少有三四个团队在往同一个方向走。作者很坦白地承认,这些做法「在精神上相似」,究竟哪种回灌方式在大规模下最好,他们没有资源去验证。这篇论文的独占性更多来自两点——融合位置选在了模型之外因而完全不改架构,以及迄今为止最大的验证规模。
⑥ 结论(最终结论 + 启示)
这篇论文给出的结论是,自回归模型两步之间的那条通道,本来就不必只装得下一个词。
把上一步的顶层隐状态通过一个门控单元融进下一步的输入,就能让「没被说出口的计算」带着全新的深度预算重新进入网络。代价小得惊人:多两次矩阵乘法,每个词不到百分之一的开销,架构、缓存、服务栈一行都不用改,连主流推理框架都能直接适配。
换回来的是相当于一倍到数倍训练数据的效果、更短的推理过程,以及一个可以并行训练的循环结构——最后这一条,恰恰是过去十年里循环模型输给 Transformer 的原因。
对做工程的人,这提供了一条不必扩参数、不必扩语料的升级路径;对做研究的人,它把「语言化」从必经之路降格成了一个可选项——而这可能才是更值得琢磨的那一半。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。自回归 Transformer 的计算沿两条轴展开:横向跨越已生成词元,纵向穿过模型深度。稠密注意力使横向带宽近乎饱和——生成第 t 个词元时,第 ℓ 层状态可读取此前所有位置的缓存表示;纵向则受因果与深度双重约束,可达集合为 R_std(t,ℓ) = {(t',ℓ') : t'<t, ℓ'<ℓ}。这意味着浅层只能看到被部分加工过的历史,而同一批位置更深、更完整的表示虽已算出并驻留于 KV 缓存,却永远无法回流至栈底(作者称之为 depth-frozen),且最深的顶层输出根本不进缓存。
文献空白。解码步之间唯一的回流通道是采样词元本身,每步至多携带 log₂|V| 比特。思维链(Wei et al., 2022;Li et al., 2024b)正是靠把中间状态外化为语言绕开这一限制,代价是模型必须逐词叙述中间态,或在每个位置从零重算。既往拓宽该通道的尝试各有短板:Feedback Transformer(Fan et al., 2020)训练沿词元串行,无法规模化;T²MLR(Cai et al., 2026)与 Latent Recurrent Transformer(Huang et al., 2026)需改动架构,分别引入 5D² 与 L·D² 量级的额外参数,且评测局限于合成状态追踪或非自由生成任务;Coconut、Soft Thinking 等潜在推理工作集中于后训练,且以隐状态替代离散词元,难以监督;PonderLM-2(Zeng et al., 2025)的多遍训练思路最为接近,但其输入长度与 KV 缓存双双翻倍。
本研究贡献。(i)提出潜在反馈解码(latent feedback decoding),以门控线性单元融合上一步顶层隐状态与当前词元嵌入,使可达集合扩张为 R_lf(t,ℓ) = {(t',ℓ') : t'<t, 任意 ℓ'},而架构、KV 缓存布局、语言建模目标全部不变,仅新增 2D² 参数、每词元开销 <1%;(ii)提出时间并行(temporal parallelism)的多遍前向目标与反馈遍数调度,在保住并行 teacher forcing 的前提下训练这一循环;(iii)在 10 亿参数、最多 4000 亿词元的真实预训练规模上完成验证,并以线性探针给出机制层面的因果线索。
I. Theoretical Framework & Hypotheses(理论框架与假设)
| 编号 | 形式化表述 | 理论含义 |
|---|---|---|
| F1 标准解码 | h_t^L = f_θ(e_t; C),e_t ← Decode(h_{t-1}^L) | 跨步仅传递采样词元,纵向带宽上限 log₂|V| 比特 |
| F2 标准可达集 | R_std(t,ℓ) = {(t',ℓ') : t'<t, ℓ'<ℓ} | 深度冻结:第 ℓ 层产物只对其上层可读,不可下行重算 |
| F3 潜在反馈解码 | h_t^L = f_θ(e_t ⊗ h_{t-1}^L; C) | 跨步传递整条隐状态;标准解码是其特例 |
| F4 门控融合 | e_t ⊗ h_{t-1} = W^U·h_{t-1} ⊙ σ(W^G·e_t),W^U, W^G ∈ R^{D×D} | 隐状态占值通路、词元仅作乘性门;刻意非对称以封死退化捷径 |
| F5 反馈可达集 | R_lf(t,ℓ) = {(t',ℓ') : t'<t, 任意 ℓ'} | 解除深度限制,包括第 0 层在内的每一层都读到被全栈加工过的历史 |
| F6 多遍递推 | h_t^(k) = f_θ(e_t ⊗ h_{t-1}^(k-1); C^(k)) | Jacobi 式更新:第 k 遍把第 k−1 遍的状态右移一位再全位置并行重跑 |
| F7 训练目标 | L^K(θ) = Σ_t −log p_θ(x_{t+1}|e_{1:t}) + λ·(1/(K−1))·Σ_{k=2}^K Σ_t −log p_θ(x_{t+1}|e_{1:t}^(k)) | 保留首遍无反馈损失以维持普通前向模式;λ = 1 未作调参 |
| F8 噪声正则 | h_t^L = f_θ(e_t ⊗ h_{t-1}^L + ε; C),ε ~ Uniform[−σ, σ]^D | 把反馈映射暴露在训练状态的邻域内,抑制长程自复合下的误差累积 |
四条理论主张(作者自我设限,构成本文的边界条件)。
- C1 · 增益是计算性的而非信息性的:由于
z_{t+1}是x_{1:t+1}的确定性函数,它不携带上下文尚未决定的任何信息。收益全部来自 F5 的可及性提升,而非新增信息量。 - C2 · 潜在反馈提供隐式草稿纸:状态维护从「仅沿序列轴」扩展到「也沿深度轴」,中间结果可经由
z在栈内更新而不必延长词元序列,故预测更短的推理轨迹(4.3 验证)。 - C3 · 没有可变寄存器:与 RNN / 状态空间模型每步覆写压缩状态不同,此处过去状态仍完整存于 KV 缓存,每个更早的状态都对当前词元直接可读。它「形式上循环、实质上非覆写」。
- C4 · 解码串行深度不变:开启与否,单步计算图深度均为
O(L),T个词元仍为O(TL)。改变的是通道带宽——一条离散语言通道与一条连续通道并行演化。额外深度只在可选的多遍预填充中购买。
M. Materials & Methods(材料与方法)
- M1 · 架构家族与规模:标准 decoder-only 因果语言模型(非 MoE、非 Diffusion、非 Mamba),10 亿参数量级。
24层,残差维度D = 1536,前馈块为6656维 SiLU-GLU;词表与输出头权重共享,规模100,352;门控分组查询注意力16个 query 头、8个共享 key/value 头,带 headwise gate 与 QK RMSNorm,RoPE 位置编码,上下文8192;多数层使用2048滑动窗口,每第六层为全注意力;每个残差块前后与最终输出均施 RMSNorm。 - M2 · 新增参数极少:融合仅引入两个
D×D线性投影,共2D²参数,对照 T²MLR 的5D²、LRT 的L·D²。因融合保持输入维度D不变,架构、KV 缓存布局与服务栈完全未改,解码循环只多两行代码;每词元额外开销<1%,且与上下文长度和模型深度无关。 - M3 · 并行训练方案(temporal parallelism):按 F6 递推做
k遍前向。首遍即普通无反馈前向(h_t^(1) ≡ h_t);其后每遍将上一遍全部位置的顶层状态右移一位、与词元嵌入融合后全位置并行重跑整栈。k遍训练的是k−1个词元步的反馈跨度,把长度T的循环展开压缩为k次并行前向,算力约为标准 teacher forcing 的k倍。不做梯度截断,后续遍的损失回传至更早遍的隐状态(代价是显存占用上升)。 - M4 · 反馈遍数调度:遍数的选择准则是迭代反馈映射是否抵达稳定不动点——再加遍数既不显著改变隐状态也不改善损失即可停。引入时机上,绝大部分训练用单遍目标,中后期先掺两遍批次、再掺少量更多遍批次,使整条训练线可以从一个普通预训练 checkpoint 起步。
- M5 · 前缀混入(prefix mixin):推理时序列是异质的(提示词是普通嵌入、生成部分是融合输入),而纯多遍训练里首位置之后全是融合输入,边界处存在分布错配。做法是在每一遍中随机采样前缀长度
p,将t ≤ p的位置还原为普通嵌入、只融合后缀。替代方案是对提示词再跑一遍融合预填充;二者对应摘要所称的「预填充成本相同或翻倍」两种口径,本文两者皆支持。 - M6 · 长程稳定性配方:(a)深度缩放(Yang et al., 2024;Noci et al., 2022)使
‖h_t^L‖ ~ O(1)而非O(L),并对融合输入施 RMSNorm;(b)嵌入与读出层权重绑定,令词嵌入空间与顶层隐状态空间保持同一基底,减轻融合权重学习大幅旋转的负担;(c)抖动噪声(F8),全实验σ = 0.02。 - M7 · 优化与数据:矩阵参数用 NorMuon(Li et al., 2026),
lr = 1×10⁻²、wd = 0.01;其余参数用 Adam,lr = 5×10⁻⁴、不加权重衰减。WSD 学习率调度,200步 warmup +25%cooldown 衰减至零;cooldown 期加系数1×10⁻⁵的 z-loss,并按 AdamC(Defazio, 2025)令权重衰减随学习率同步衰减。数据混合沿用 Phi-4 配方,上下文8192,全局批大小300K词元(1T 词元的无反馈基线用1.2M)。 - M8 · 训练运行与等效算力:等效算力 = 训练词元 × 每批平均前向遍数。
| 运行 | 反馈遍数配比 | 训练词元 | 等效算力 |
|---|---|---|---|
| 10B | 100% 三遍 | 10B | 40B |
| 100B | 75% 单遍 · 25% 三遍 | 100B | 150B |
| 200B | 75% 单遍 · 22% 两遍 · 3% 三遍 | 200B | 256B |
| 400B | 75% 单遍 · 22% 两遍 · 3% 三遍 | 400B | 512B |
- M9 · 后训练:对 200B 与 400B 两个模型做长上下文扩展(
12B词元,8K → 32K)与指令微调(6B词元)。因这两段远短于预训练,全程用三遍前向而不套用预训练的遍数调度。 - M10 · 三种解码模式(核心对照设计):Standard(单遍预填充 + 纯词元嵌入生成,即把全带宽模型当普通 Transformer 用,用于度量反馈训练本身的代价);Soft(单遍预填充 + 生成位置走 F3 融合,与 Standard 预填充成本相同,每词元只多两次
D×D乘法);Fused(提示词先多跑一遍融合预填充再按 Soft 生成,预填充成本翻倍、解码成本不变)。 - M11 · 评测基准:五样本 LM Eval 覆盖 RTE、TruthfulQA-MC2、ARC-Easy、ARC-Challenge、BoolQ、PIQA、WinoGrande、OpenBookQA、COPA、MMLU 共
10项;自由生成覆盖 GSM8K、MATH-500、HumanEval、MBPP。数学报 Pass@1,代码报 Pass@3(每题10次采样估计,温度在{0.3, 0.5, 0.7}上按解码模式分别网格搜索,不使用 top-k / top-p)。 - M12 · 机制验证的探针设计:构造配对合成样本,标签完全由共享末尾冒号之前的内容决定,并追加
0/8/32/128/256次语义空转更新以在不改标签的前提下拉长序列。三类任务——完成度追踪(比较 required 与 completed 两计数器是否相等)、延迟记忆(在无关扰动后回忆初始二元状态)、多寄存器最新写入追踪(查询某寄存器的最近赋值)。在每一层残差流上训练L2正则线性分类器,采用四折分组交叉验证(按数对组 / 扰动上下文组整体留出)。样本量:完成度1,600例 /80组,记忆1,280例 /128组;寄存器数扫描m ∈ {1,2,4,8}时每种预填充条件3,840例(统一 padding 到 180 词元);覆写强度扫描固定m = 8、每寄存器写2/4/8次,各2,048例 /128组,对应180 / 276 / 468词元长度。另设递归后缀控制:只对末尾k ∈ {1,2,4}个词元做融合预填充。
R. Results(结果)
R1 · 融合预填充:少量推理算力换到约两倍预训练数据效率(Fig. 4)。横轴为预填充阶段施加的反馈遍数,第 0 步即普通预填充。三点发现:(a)增益前置——绝大部分改善出现在第一遍融合预填充,即顶层隐状态首次出现在输入端之时,此后收益递减,符合「潜在反馈等价于为提示词增加有效深度」的解释;(b)不用也不亏——在第 0 步按普通 Transformer 评测时,全带宽模型相对标准基线只损失极小的验证损失,而平均 LM Eval 准确率已经更高,说明该训练配方对不打算启用融合预填充的部署同样有价值;(c)两遍反馈顶一倍数据——1000 亿词元的全带宽模型达到 2000 亿词元标准基线,2000 亿词元的全带宽模型达到 4000 亿词元标准基线。
R2 · 自由生成:三种解码模式的完整对照(Table 1,长上下文扩展 + 指令微调后,零样本)。
| 模型 · 解码模式 | GSM8K Pass@1 | MATH-500 Pass@1 | HumanEval Pass@3 | MBPP Pass@3 |
|---|---|---|---|---|
| 全带宽 200B · Standard | 64.52 | 43.80 | 42.54 | 38.39 |
| 全带宽 200B · Soft | 67.93 | 45.60 | 45.06 | 39.80 |
| 全带宽 200B · Fused | 67.55 | 45.60 | 45.92 | 41.22 |
| 全带宽 400B · Standard | 67.90 | 46.00 | 46.50 | 40.50 |
| 全带宽 400B · Soft | 71.00 | 45.40 | 47.20 | 40.60 |
| 全带宽 400B · Fused | 71.80 | 48.40 | 47.60 | 41.70 |
| 标准 Transformer · 200B | 62.93 | 42.40 | 37.16 | 38.61 |
| 标准 Transformer · 400B | 68.39 | 46.40 | 44.85 | 40.28 |
| 标准 Transformer · 1T | 70.13 | 47.40 | 50.01 | 41.93 |
- 关键 delta:400B 全带宽 + Fused 在 GSM8K(71.80 vs 70.13)与 MATH-500(48.40 vs 47.40)上越过了训练量为其 2.5 倍的 1T 词元标准模型;200B 全带宽在四项任务上全面胜过同词元量的 200B 标准基线(最大差距为 HumanEval 的 45.92 vs 37.16,+8.76)。MBPP 上 Fused 已逼平 1T 基线(41.22 vs 41.93)。唯一未追上的是 HumanEval 对 1T 基线(47.60 vs 50.01)。
- 基座模型(Fig. 5,未经后训练):Soft 在每一项任务、两个训练规模上都优于 Standard,且权重完全相同——增益纯粹来自解码方式。模式偏好随任务而异:数学偏好 Soft(MATH-500 上 200B 模型由 0.27 → 0.37,越过 1T 无反馈基线),代码偏好 Fused(HumanEval 0.31 → 0.34;MBPP 0.38 → 0.40),与「代码更吃提示词的深层表示、数学更吃跨步携带的状态」一致。200B 反馈模型在若干任务上接近或超过训练量为其 2–5 倍的无反馈基线。Pass@3 与 Pass@1 同步提升,说明以隐状态为条件生成没有压垮采样多样性。
- R3 · 反馈遍数调度是稳定性的关键(Fig. 3,1B / 200B 词元):仅用 75% 单遍 + 25% 两遍训练的模型,在训练深度内表现良好但无法外推——超出该深度后验证损失急剧上升,隐状态增量
‖h^(k) − h^(k−1)‖来回震荡而不衰减,表明迭代已离开训练状态分布。仅掺入 3% 三遍批次(75% / 22% / 3%)即定性改变行为:验证损失在 30 步反馈内保持平坦,隐状态增量衰减至小平台,学到的映射表现为向不动点收敛的压缩映射;在k = 1000遍反馈下仍观察到同样的稳定性,上百词元的实际 rollout 亦无崩溃迹象。 - R4 · 更短的推理轨迹(Fig. 6 / 8):基座模型上 Soft 解码常给出明显更短的推理轨迹,而准确率持平或更好,正是 C2 的预言。但该效应在指令微调后消失;作者归因于微调数据相对潜在反馈解码是 off-policy 的——目标轨迹由标准逐词推理产生并模仿其冗长风格,拟合它等于把冗长文风重新强加回来。建议的补救是在潜在反馈下做 on-policy 后训练,留待未来工作。
- R5 · 带宽的直接机制证据(Sec. 4.4):标准预填充下,末尾冒号处的第 0 层线性探针准确率接近随机——因 F2 的可达性约束,浅层残差只能读到层级匹配的部分加工前缀。改用一步递归预填充(将前一词元顶层状态按 F4 融入该位置输入)后,第 0 层探针准确率升至完成度追踪 99.6%、延迟记忆 100%。作者同时给出反向警示:可解码性提升不等于输出改善——线性可恢复只证明信息在场,不证明模型用它决定了下一个词元,后者只能由 Sec. 4 的下游成绩回答。
- R6 · 同规模横向对照(Table 2,零样本 LM Eval 平均):全带宽 1B / 200B 词元在 0 遍反馈下均值 52.66,1 遍反馈下 53.58;对照 OPT 1.3B(300B 词元)49.87、Pythia 1.4B(300B)49.34、EvoLM 1B(320B)52.49、TinyLlama 1B(2T)53.23、Llama3.2 1B(9T)55.31、Qwen3 1.7B(36T)57.30。即以 200B 词元基本追平 2T 词元的 TinyLlama,但仍低于 9T / 36T 量级的现代小模型。
a / D. Discussion & Conclusion(讨论与结论)
- D1 · 理论意义:改写的是自回归解码的信息流结构。本文把「纵向带宽」确立为一个可独立操纵的设计变量:可达集合由
ℓ'<ℓ放宽为任意 ℓ',使未被语言化的计算能带着全新的深度预算重入栈底。其直接推论是「语言化」从信息回流的唯一通道降格为可选通道——这动摇了思维链作为串行计算唯一载体的前提,也与 Li et al. (2024b) 关于 CoT 提供串行深度的结论形成互补而非冲突(C4:串行深度未变,变的是带宽)。 - D2 · 训练范式意义:为非线性循环找回并行 teacher forcing。「循环结构无法并行训练」长期是循环模型输给 Transformer 的根因。Mamba / Gated DeltaNet 走的是线性化路线并需与标准层混合;ParaRNN 走的是牛顿迭代解耦路线。本文反向操作——在 Transformer 上构造循环,用 Jacobi 式多遍更新把「跨 T 个位置的顺序性」换成「跨 k 遍的顺序性」,并以遍数调度把成本压到可承受。「3% 三遍批次即把发散迭代变为收敛到不动点」这一发现,其价值超出本文本身:它提示算力昂贵的辅助目标可以只在训练后期少量引入。
- D3 · 消融与设计论证:(a)融合形式——作者论证对称的
e_t + W·h_{t-1}会留下退化捷径(压制状态通路即可恢复普通词元输入并达到原预训练损失,宽通道形同虚设),尤其当训练自标准 checkpoint 起步时诱惑最大;F4 的乘性门使读取状态成为强制项;(b)反馈层选择——引用 Feedback Transformer 的消融佐证取顶层是对的(仅取最顶层几乎等同全层混合,取首层则不优于标准 Transformer);(c)遍数调度见 R3;(d)解码模式三分对照见 R2;(e)前缀混入 vs 双遍预填充两条路线均被实现并对应不同的预填充成本口径。 - D4 · 与并行工作的差异:T²MLR、Latent Recurrent Transformer 在训练手法与动机上相近,差异在再注入的位置——本文的注入发生在模型外部(只改输入的构造方式),故零架构改动,且额外参数最少(
2D²vs5D²vsL·D²);更大的差异在实证范围:本文做到 4000 亿词元预训练并验证真实推理时的收益,而 LRT 只做非自由生成评测、T²MLR 只做合成状态追踪与数学语料微调后的 GSM8K。相较 PonderLM-2,本文不加长输入、不加大 KV 缓存。相较 loop transformer,本文在解码时不重复调用整栈,只复用已算出的顶层状态加一次轻量融合。作者的坦白:鉴于诸法「精神相似」,究竟哪种隐状态回灌形式在大规模下最优仍不清楚,他们没有资源验证。 - D5 · 局限(作者自陈两条 + 本文观察):(i)规模止于 10 亿参数,未在更大模型上验证——作者推测更深模型的顶层状态更丰富、收益应更大,但这是推测;(ii)遍数调度基于启发式,循环训练阶段的长度与反馈步数缺乏原则性判据,建议引入 Zeng et al. (2025) 的 Jacobi 迭代收敛诊断;(iii)多遍训练不截断梯度,显存占用上升,长序列训练的可扩展性未讨论;(iv)Fig. 4–8 的具体数值多由正文叙述转述,图内读数未公开。
- D6 · 实践启示:由于不改架构、不改 KV 缓存、不改语言建模目标,潜在反馈可被任何现成 Transformer 继承;作者已给出 vLLM 适配方案——沿用 EAGLE / MTP 的设计模式,把每个请求最新的主干隐状态就地复制进固定地址的持久缓冲区,使 CUDA graph 能捕获融合门;patch 过的
GPUModelRunner._model_forward以请求 ID 为键保存 detach 后的隐状态,用query_start_loc把打包行映射回请求并清理已完成请求。与 EAGLE / MTP 的本质差别是:状态回灌进模型自身以定义真实的下一词元分布,而非送给独立的草稿模型。对算力充裕而高质量语料见底的团队,这是一条以训练算力换数据的可行路径。 - D7 · 结论:全带宽 Transformer 表明,自回归解码步之间的通道不必被压缩成单个词元。以
2D²的参数代价与每词元<1%的开销,换来相当于 1.5–5 倍训练词元的效果、更短的推理轨迹,以及一个可并行训练的循环结构。它同时打开了一条新的扩展轴——在同一份独特语料上花更多计算——在高质量数据、GPU pod 规模与墙上时钟共同构成硬约束的当下,这条轴的价值只会上升。
🧠 IRMaD 思维导图
mindmap
root((全带宽潜在反馈))
I 引言
横轴注意力已满带宽
纵轴跨步通道极窄
仅采样词元回流栈底
中间计算被深度冻结
高质量独特语料见底
R 问题
能否回灌顶层隐状态
不改架构与 KV 缓存
循环如何并行训练
算力能否换数据效率
能否缩短推理轨迹
M 方法
门控线性单元融合
隐状态走值通路
词元仅作乘性门
多遍前向时间并行
状态右移一位重跑
调度 75/22/3 三档
前缀混入对齐推理
深度缩放与抖动噪声
R 结果
预填两遍顶一倍数据
MATH500 由 0.27 到 0.37
GSM8K 400B 达 71.80
两项越过 1T 基线
3% 三遍换来不动点
1000 遍反馈仍稳定
第零层探针 99.6%
基座推理轨迹更短
a 讨论
新扩展轴每词元算力
语言化由必需变可选
非循环网络无覆写
解码串行深度不变
可解码不等于被使用
D 结论
仅新增 2D2 参数
每词元开销低于 1%
vLLM 可直接适配
规模止于十亿参数
遍数调度仍属启发式
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。