arXiv 预印本 · 2026-08 · 10 亿参数 / 4000 亿词元全量预训练 · 沿用 Phi-4 数据配方 · 附 vLLM 实现

全带宽 Transformer:用潜在反馈拓宽自回归解码的垂直通道

Xi Wang, Ziyang Cai, Zheng Zhan 等 8 人 · arXiv preprint · 2026 · DOI: 10.48550/arXiv.2608.08888 · arXiv: 2608.08888
原题:Full-bandwidth transformer
Open Access 新颖度 0.87

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

今天的大语言模型在生成文字时,每写完一个字,上一步在脑子里算出的全部结果都会被丢掉,只剩下那个被说出口的字传给下一步。

这听起来有点浪费,事实也确实如此。作者把模型的计算方向拆成两条轴:横轴是沿着已经写出来的字往回看,纵轴是从模型底层一路算到顶层。横轴上,注意力机制让每个新字都能读到前面所有字留下的记录,可以说是宽得不能再宽;可纵轴上,两步之间的通道却窄得可怜。

窄到什么程度?模型顶层算出来的是一个上千维的向量,里面装着它对下一步的判断、犹豫、半成品结论;而真正传给下一步的,只是从这个向量里采样出来的一个词。一个词能携带的信息,上限就是词表大小取对数那么多比特,其余的全被压没了。

更麻烦的是,那些没被说出口的中间计算并没有消失——它们还躺在缓存里——但它们被冻在了自己出生的那一层。第五层算出来的东西,只有第六层往上能读到,永远没机会回到第一层被重新加工一遍。

所以现在流行的思维链其实是在做一件相当笨拙的事:模型必须把心里的草稿一个字一个字念出来,这些内容才能重新进入自己的底层。念出来,是信息回流的唯一通道

再加上一个现实压力:高质量的独特语料正在见底,靠堆数据继续变强这条路越走越窄。于是问题变成了——能不能从同一份数据里榨出更多东西

② 研究问题(要回答什么?)

这篇论文想问的是,能不能把那条被压到只剩一个词的回流通道,拓宽成一整条隐状态。

它把这个大问题拆成了三问。

还藏着一个更根本的追问:如果模型真的可以不说出口也把想法带到下一步,那我们一直相信的「让模型把推理过程写出来」,会不会只是一种受限于通道宽度的权宜之计

③ 研究方法(怎么做的?)

解决办法说穿了只有一句话:让上一步的顶层隐状态,和这一步采样出来的词,合成一个输入再送进模型。

怎么合?作者用了一个叫门控线性单元的小零件。打个比方:隐状态是一桶水,词是一张有洞的筛网。水从筛网漏下去,筛网决定哪里能漏、漏多少。落到算式上,就是把隐状态做一次线性变换当「水」,把词向量做一次线性变换再压到零一之间当「阀门」,两者逐位相乘。

这里有个故意设计的不对称。如果改成「词 + 隐状态」这种加法式融合,模型会耍滑头:把隐状态那一路的权重压到零,输入就退化回普通的词,照样能拿到不错的损失,宽通道就白修了。而用乘法门,把水倒掉就什么都不剩了——读隐状态从「可选」变成了「必须」。

怎么训?这才是真正的难点。融合输入得等上一个位置算完才能拿到,而 Transformer 训得快全靠所有位置并行。作者的招数是多遍前向:第一遍照常跑,把每个位置的顶层状态存下来;第二遍把这些状态整体右移一位,和词融合之后再并行跑一遍全模型;第三遍再来一次。跑几遍,就等于把这个反馈动作训练了几步的跨度。顺序性从「跨几千个词」被压缩成了「跨三遍」

怎么省?多跑一遍就是多一倍计算,所以作者只在训练中后期才把它掺进来:七成五的批次照常单遍跑,两成二跑两遍,剩下三个百分点跑三遍。就这三个百分点,是全文最反直觉的一笔。

另外还有两道保险:一是前缀混入,训练时随机挑一个位置,前面用普通词向量、后面才用融合输入,好让模型习惯推理时「提示词是普通的、生成部分才是融合的」这种半半结构;二是一组稳态技巧——深度缩放、对融合输入做归一化、词嵌入与输出层共享权重、给隐状态加一点小抖动噪声。

④ 结果(发现了什么?)

结果相当漂亮,只训练四千亿词元的全带宽模型就追平甚至超过了训练更多词元的标准模型,而每生成一个词多付的代价还不到百分之一。

① 读提示词时:多跑一遍顶一倍数据
在验证损失和五样本选择题评测上,训练了 1000 亿词元的全带宽模型多跑两遍反馈,就达到标准模型训练 2000 亿词元的水平;2000 亿的全带宽模型则达到标准模型 4000 亿词元的水平。换算下来大约是两倍的预训练数据效率。
② 生成时:数学和代码全面变好
在 2000 亿词元的基座模型上,MATH-500 的正确率从 0.27 升到 0.37,越过了训练满一万亿词元的标准基线;HumanEval 从 0.31 升到 0.34,MBPP 从 0.38 升到 0.40。四个任务上没有一个变差
③ 指令微调之后依然领先
4000 亿词元的全带宽模型在 GSM8K 上从 67.90 提到 71.80,MATH-500 从 46.00 提到 48.40,两项都越过了一万亿词元的标准模型(70.13 与 47.40)。

而且它话变少了。在基座模型上开启潜在反馈之后,模型的推理过程明显变短,准确率却持平甚至更高。这正是「宽通道」理论预言的现象——原本必须一个词一个词念出来的中间步骤,现在可以骑在隐状态上走。不过作者也老实指出,这个效果在指令微调之后消失了:微调数据本身就是标准逐词推理写出来的,模型等于又被教回了啰嗦的说话方式。

那三个百分点有多要紧?只用单遍加两遍训练出来的模型,一旦反馈次数超过训练时见过的深度,验证损失就急剧上升,隐状态的变化幅度来回震荡,说明它跑飞了。而只要掺进三个百分点的三遍批次,验证损失在三十步反馈之内都是平的,隐状态变化衰减到一个小平台——学到的映射从发散变成了收敛到不动点,作者甚至在一千次反馈下都没看到崩溃。

最直接的证据在探针实验里。作者造了两个人工任务,答案完全由冒号之前的内容决定。标准方式下,模型第零层的线性探针准确率接近瞎猜;而把上一个位置的顶层状态融合进来之后,第零层探针的准确率跳到 99.6%100%。全局信息真的被一条捷径直送到了最浅的那一层。

⑤ 讨论(这些发现说明什么?)

这项工作真正动的不是某个模块,而是大家默认的扩展方向

过去多年,模型变强的公式基本是「参数更多 + 数据更多」。但高质量的独特语料是有限的,芯片规模和墙上时钟也是有限的。作者指出,当每个参数能分到的词元数和可用语料都被卡死之后,再堆数据就不再是唯一出路;另一条轴是——在同一份数据上花更多的计算。潜在反馈就是这条轴上一个很具体的做法。

第二层意义关于思维链。我们一直把「把推理过程写出来」当成模型变聪明的办法。这篇论文提示,写出来可能只是因为没有别的路可走。一旦纵向通道被拓宽,一部分思考就不必再被翻译成文字。这对「模型写出来的推理是否忠实反映了它真实的计算」这类可解释性问题,是个不太舒服的消息:能力上去了,可看见的部分反而少了

作者自己划的几条界线,值得照抄:

还有一个不能忽略的背景:同期至少有三四个团队在往同一个方向走。作者很坦白地承认,这些做法「在精神上相似」,究竟哪种回灌方式在大规模下最好,他们没有资源去验证。这篇论文的独占性更多来自两点——融合位置选在了模型之外因而完全不改架构,以及迄今为止最大的验证规模。

⑥ 结论(最终结论 + 启示)

这篇论文给出的结论是,自回归模型两步之间的那条通道,本来就不必只装得下一个词。

把上一步的顶层隐状态通过一个门控单元融进下一步的输入,就能让「没被说出口的计算」带着全新的深度预算重新进入网络。代价小得惊人:多两次矩阵乘法,每个词不到百分之一的开销,架构、缓存、服务栈一行都不用改,连主流推理框架都能直接适配。

换回来的是相当于一倍到数倍训练数据的效果、更短的推理过程,以及一个可以并行训练的循环结构——最后这一条,恰恰是过去十年里循环模型输给 Transformer 的原因。

对做工程的人,这提供了一条不必扩参数、不必扩语料的升级路径;对做研究的人,它把「语言化」从必经之路降格成了一个可选项——而这可能才是更值得琢磨的那一半。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。自回归 Transformer 的计算沿两条轴展开:横向跨越已生成词元,纵向穿过模型深度。稠密注意力使横向带宽近乎饱和——生成第 t 个词元时,第 ℓ 层状态可读取此前所有位置的缓存表示;纵向则受因果与深度双重约束,可达集合为 R_std(t,ℓ) = {(t',ℓ') : t'<t, ℓ'<ℓ}。这意味着浅层只能看到被部分加工过的历史,而同一批位置更深、更完整的表示虽已算出并驻留于 KV 缓存,却永远无法回流至栈底(作者称之为 depth-frozen),且最深的顶层输出根本不进缓存

文献空白。解码步之间唯一的回流通道是采样词元本身,每步至多携带 log₂|V| 比特。思维链(Wei et al., 2022;Li et al., 2024b)正是靠把中间状态外化为语言绕开这一限制,代价是模型必须逐词叙述中间态,或在每个位置从零重算。既往拓宽该通道的尝试各有短板:Feedback Transformer(Fan et al., 2020)训练沿词元串行,无法规模化;T²MLR(Cai et al., 2026)与 Latent Recurrent Transformer(Huang et al., 2026)需改动架构,分别引入 5D²L·D² 量级的额外参数,且评测局限于合成状态追踪或非自由生成任务;CoconutSoft Thinking 等潜在推理工作集中于后训练,且以隐状态替代离散词元,难以监督;PonderLM-2(Zeng et al., 2025)的多遍训练思路最为接近,但其输入长度与 KV 缓存双双翻倍

本研究贡献。(i)提出潜在反馈解码(latent feedback decoding),以门控线性单元融合上一步顶层隐状态与当前词元嵌入,使可达集合扩张为 R_lf(t,ℓ) = {(t',ℓ') : t'<t, 任意 ℓ'},而架构、KV 缓存布局、语言建模目标全部不变,仅新增 2D² 参数、每词元开销 <1%;(ii)提出时间并行(temporal parallelism)的多遍前向目标与反馈遍数调度,在保住并行 teacher forcing 的前提下训练这一循环;(iii)在 10 亿参数、最多 4000 亿词元的真实预训练规模上完成验证,并以线性探针给出机制层面的因果线索。

I. Theoretical Framework & Hypotheses(理论框架与假设)

编号形式化表述理论含义
F1 标准解码h_t^L = f_θ(e_t; C)e_t ← Decode(h_{t-1}^L)跨步仅传递采样词元,纵向带宽上限 log₂|V| 比特
F2 标准可达集R_std(t,ℓ) = {(t',ℓ') : t'<t, ℓ'<ℓ}深度冻结:第 ℓ 层产物只对其上层可读,不可下行重算
F3 潜在反馈解码h_t^L = f_θ(e_t ⊗ h_{t-1}^L; C)跨步传递整条隐状态;标准解码是其特例
F4 门控融合e_t ⊗ h_{t-1} = W^U·h_{t-1} ⊙ σ(W^G·e_t)W^U, W^G ∈ R^{D×D}隐状态占值通路、词元仅作乘性门;刻意非对称以封死退化捷径
F5 反馈可达集R_lf(t,ℓ) = {(t',ℓ') : t'<t, 任意 ℓ'}解除深度限制,包括第 0 层在内的每一层都读到被全栈加工过的历史
F6 多遍递推h_t^(k) = f_θ(e_t ⊗ h_{t-1}^(k-1); C^(k))Jacobi 式更新:第 k 遍把第 k−1 遍的状态右移一位再全位置并行重跑
F7 训练目标L^K(θ) = Σ_t −log p_θ(x_{t+1}|e_{1:t}) + λ·(1/(K−1))·Σ_{k=2}^K Σ_t −log p_θ(x_{t+1}|e_{1:t}^(k))保留首遍无反馈损失以维持普通前向模式;λ = 1 未作调参
F8 噪声正则h_t^L = f_θ(e_t ⊗ h_{t-1}^L + ε; C)ε ~ Uniform[−σ, σ]^D把反馈映射暴露在训练状态的邻域内,抑制长程自复合下的误差累积

四条理论主张(作者自我设限,构成本文的边界条件)。

M. Materials & Methods(材料与方法)

运行反馈遍数配比训练词元等效算力
10B100% 三遍10B40B
100B75% 单遍 · 25% 三遍100B150B
200B75% 单遍 · 22% 两遍 · 3% 三遍200B256B
400B75% 单遍 · 22% 两遍 · 3% 三遍400B512B

R. Results(结果)

R1 · 融合预填充:少量推理算力换到约两倍预训练数据效率(Fig. 4)。横轴为预填充阶段施加的反馈遍数,第 0 步即普通预填充。三点发现:(a)增益前置——绝大部分改善出现在第一遍融合预填充,即顶层隐状态首次出现在输入端之时,此后收益递减,符合「潜在反馈等价于为提示词增加有效深度」的解释;(b)不用也不亏——在第 0 步按普通 Transformer 评测时,全带宽模型相对标准基线只损失极小的验证损失,而平均 LM Eval 准确率已经更高,说明该训练配方对不打算启用融合预填充的部署同样有价值;(c)两遍反馈顶一倍数据——1000 亿词元的全带宽模型达到 2000 亿词元标准基线,2000 亿词元的全带宽模型达到 4000 亿词元标准基线。

R2 · 自由生成:三种解码模式的完整对照(Table 1,长上下文扩展 + 指令微调后,零样本)。

模型 · 解码模式GSM8K
Pass@1
MATH-500
Pass@1
HumanEval
Pass@3
MBPP
Pass@3
全带宽 200B · Standard64.5243.8042.5438.39
全带宽 200B · Soft67.9345.6045.0639.80
全带宽 200B · Fused67.5545.6045.9241.22
全带宽 400B · Standard67.9046.0046.5040.50
全带宽 400B · Soft71.0045.4047.2040.60
全带宽 400B · Fused71.8048.4047.6041.70
标准 Transformer · 200B62.9342.4037.1638.61
标准 Transformer · 400B68.3946.4044.8540.28
标准 Transformer · 1T70.1347.4050.0141.93

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((全带宽潜在反馈))
    I 引言
      横轴注意力已满带宽
      纵轴跨步通道极窄
      仅采样词元回流栈底
      中间计算被深度冻结
      高质量独特语料见底
    R 问题
      能否回灌顶层隐状态
      不改架构与 KV 缓存
      循环如何并行训练
      算力能否换数据效率
      能否缩短推理轨迹
    M 方法
      门控线性单元融合
      隐状态走值通路
      词元仅作乘性门
      多遍前向时间并行
      状态右移一位重跑
      调度 75/22/3 三档
      前缀混入对齐推理
      深度缩放与抖动噪声
    R 结果
      预填两遍顶一倍数据
      MATH500 由 0.27 到 0.37
      GSM8K 400B 达 71.80
      两项越过 1T 基线
      3% 三遍换来不动点
      1000 遍反馈仍稳定
      第零层探针 99.6%
      基座推理轨迹更短
    a 讨论
      新扩展轴每词元算力
      语言化由必需变可选
      非循环网络无覆写
      解码串行深度不变
      可解码不等于被使用
    D 结论
      仅新增 2D2 参数
      每词元开销低于 1%
      vLLM 可直接适配
      规模止于十亿参数
      遍数调度仍属启发式

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。