arXiv 预印本 · cs.LG / cs.AI · 2026-09 · 750M 与 1.3B 参数匹配对照预训练

卡尔曼德尔塔网络:具备不确定性意识的联想记忆

Ngoc Bui, Tinglin Huang, Rex Ying · arXiv preprint · 2026 · DOI: 10.48550/arXiv.2609.07816 · arXiv: 2609.07816
原题:Kalman Delta Networks: Uncertainty-aware Associative Memory
Open Access 新颖度 0.86

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

当下的大模型要读很长的文章,可它们的记忆本子只有固定那么几页,写满了就得擦掉旧的才能写新的。你有没有过这种经历:考前抄了一整页知识点,纸写满了,再遇到新考点就只能把某一行涂掉重写——涂错了行,后面就全乱了。今天的大语言模型正卡在这个难题上。

标准的注意力机制其实很奢侈:它把读过的每一个词都原样留着,随时可以回头翻。好处是什么都不会丢,坏处是读得越长,要存的东西越多,翻一遍的代价还要按长度的平方涨。于是有人提出线性注意力:不留原文,只留一个大小固定的“记忆板”,每读一个词就往板上写一笔,读的时候从板上取。这样解码时占用的内存是恒定的,速度也快得多。

但固定大小意味着必须做取舍。每来一个词,模型都得当场决定:这一笔写多重?写轻了,过期的旧信息赖着不走;写重了,有用的老记忆被一把抹掉。麻烦在于,这个决定必须在还不知道后面会问什么的时候就做出来。

目前最好的一类做法叫德尔塔规则:先看看记忆板对当前这个“钥匙”给出的答案是什么,只把答对与答错之间的差额补上去。这比无脑叠加聪明多了。可是它有个说不过去的地方——写多重,是模型看着当前这一个词临时拍脑袋定的,完全不管板上那条记忆已经被多少次证据支持过。一条被反复确认了几十遍的事实,和一条只写过一次的猜测,在它眼里写起来一样容易被覆盖。

② 研究问题(要回答什么?)

这篇论文想问的是,往固定大小的记忆里写东西时,到底该按什么原则决定每一笔写多重。以前大家是“设计”出一个写入强度的公式,然后拿实验挑一个好用的;作者想反过来,先问清楚什么才是理论上最优的写法,再看现有做法离它有多远。

具体拆成四个问题。

能把这四问一起答上,才算真的给这个领域换了个地基,而不只是又调出一个好一点的配方。

③ 研究方法(怎么做的?)

作者的核心动作,是把“记忆板”换了一种身份来看:它不再是一块随便涂改的白板,而是对一个看不见的真相的估计

打个比方。假设你在追踪一个朋友现在住在哪个城市。这件事本身会变(他可能搬家),你收到的消息也不一定准(可能是道听途说)。这正是工程上经典的滤波问题——六十多年前卡尔曼就给出了答案,阿波罗登月的导航用的就是它。

把这套话搬到记忆板上:

有了这三样,写多重就不用再猜了,它由公式直接算出来:把握小就多听新证据,把握大就顶住不改。这个权重就是卡尔曼增益

最妙的一步在后面。精确解要维护一张很大的方阵,而且必须一步接一步地算,没法并行,等于不能用。作者于是只保留每个通道一个把握值(对角版),或者干脆整个头共用一个(各向同性版)。这一简化后,把握值的递推正好落进数学上一类叫莫比乌斯映射的变换——它可以写成两个数的比值,每一步就是乘一个二乘二的小矩阵。而矩阵连乘是可结合的,于是整条序列可以像求前缀和那样折半并行算完。并行的能力就这样被救了回来。

④ 结果(发现了什么?)

在两种规模的同等条件预训练下,新模型在困惑度、常识问答平均分和长文检索三类指标上都超过了所有参与对比的线性注意力基线。所有模型用同一批数据、同一套骨干、同一个优化配方,参数量对齐到万分之三以内,所以比较是干净的。

① 语言建模变好了
在 13 亿参数、1000 亿词元这一档,对角版把维基文本困惑度从最强基线的 15.40 降到 15.04,LAMBADA 困惑度从 10.09 降到 9.75。7.5 亿参数那一档同样全面领先。
② 六项常识问答平均分领先
13 亿档对角版拿到 60.45,高于最强基线的 60.28;7.5 亿档拿到 54.97,而最好的基线是 54.39。提升不大,但两个规模方向一致。
③ 真正拉开差距的是“在长文里找东西”
7.5 亿档的“大海捞针”测试里,上下文拉到 8K 时,对角版还是满分 100.0,而同规模最强基线掉到 82.6,另一条主流路线更是塌到 33.2

检索才是最有说服力的证据。这一点很重要,因为它不是“分数普涨”,而是恰好涨在理论预测的地方。作者的理论说:跟踪把握度能保护已经写好的记忆不被后来的词误伤。那么最该受益的,就是“信息写进去之后要扛住一大段干扰、最后还能被取出来”的任务。结果正是如此——在最难的三针检索上,7.5 亿档对角版拿 32.2,最强基线只有 13.6,接近两倍半。换成六项真实世界检索任务(含维基问答、表格抽取、阅读理解),13 亿档对角版平均 34.86,最强基线 33.76

作者还抓出了自己方法的一个毛病并修好了它。把那张大方阵压成一串独立的数,会让模型对每个通道过度自信,结果是同一把钥匙再来一次时下手过猛,几乎把旧值整个换掉。他们用一个叫信息标度的常数把这个劲道压下去:实测下来,训练后的平均覆盖强度从 0.943 降到 0.805,而当前这一笔写入完全不受影响——它只削弱以后的覆盖。这是一处很漂亮的“保护”与“写入”解耦。

⑤ 讨论(这些发现说明什么?)

这项工作真正的分量,不在那零点几分的提升,而在它解释了为什么现有方法长成现在这样

作者证明了一件很干净的事:如果你把“把握度”这本账扔掉不记,强行假设所有方向的把握都一样大,那么最优的卡尔曼写法会自动退化成现有的德尔塔规则。三个主流模型的区别,也只剩下遗忘方式的不同:一个完全不忘,一个整块按同一速率忘,一个每个通道各忘各的。换句话说,过去几年这条线上的进展,全都是在同一个公式的同一个位置上做文章,而另一个位置——写入强度该由谁决定——从来没被正经动过。这篇论文动的就是那个位置。

还有一层意义是把两条一直各说各话的技术路线接上了。此前,“记忆怎么衰减”被当作状态空间模型的问题,“该写多少”被当作在线优化(相当于做一步梯度下降)的问题,两边用的完全是两套语言。在滤波的框架下,这两件事成了同一个循环里的预测更新两步。这种把分头发展的分支收进一个母体的能力,通常比多一两个点的成绩更能推动一个领域。

但要老实说清楚局限。第一,最大只做到 13 亿参数、1000 亿词元,离前沿模型的规模还差得远,这个优势能不能一路保持到几百亿参数,论文没法回答。第二,在“循环层与注意力层混搭”的架构里,好处就没那么齐整了——各向同性版的常识问答平均分反而略低于同样混搭的最强基线。第三,消融实验坦承,学出来的噪声参数并不总比固定成常数更好,信息标度的影响作者自己形容为“不大且随指标而异”。第四,对角版因为多跑一遍把握度扫描,速度是要付出代价的。作者在结论里也主动承认,这两个版本只是朝向卡尔曼联想记忆的一步,还不是它本身。

⑥ 结论(最终结论 + 启示)

把不确定性当成循环记忆的一等公民来跟踪,是这篇论文留下的最核心的主张。在此之前,“写多重”是一个设计出来的旋钮;在此之后,它是一个从模型自己的置信度里推导出来的量。

三点值得记住。其一,一个几十年前的经典结果(卡尔曼滤波)被证明正是这个新问题的最优解,而现有方法是它丢掉一本账之后的特例——老工具照进新领域,照出了别人没看见的空缺。其二,理论上最优往往跑不动,作者没有因此妥协掉原理,而是找到莫比乌斯映射这个数学结构,让近似解既保留了不确定性,又保住了并行。其三,也是最诚实的一点:他们预判了自己近似方案会过度自信,提前设计了补救手段,还用实测数据验证了补救确实生效。

对普通读者来说,这件事可以这样理解——我们正在教机器一种此前它并不具备的素质:知道自己哪里知道得牢,哪里只是将信将疑。一个清楚自己把握有多大的记忆,才谈得上在该坚持的时候坚持、该更新的时候更新。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。自注意力通过保留全部词元历史实现基于内容的检索,但自回归 KV 缓存随上下文线性增长、成对交互随序列长度平方增长。线性注意力改为把前缀压缩进固定大小的循环状态 St ∈ Rdk×dv,写入 St = St-1 + ktvtT,读出 ot = StTqt,从而获得常数显存解码与扫描并行训练。代价是注意力退化为一个在线记忆管理问题:每个词元必须在不知道未来查询的前提下编辑压缩摘要。

既往进路与空白。DeltaNet 以误差校正的 delta 规则取代加性写入,只写入残差 βtkt(vt − St-1Tkt)T,通常被解读为对快权重记忆瞬时平方损失做一步在线梯度下降。Gated DeltaNet 与 KDA 保留该残差写入,并加入 Mamba 式状态衰减(标量 / 通道级)。由此,转移写入长期被置于两种互不相通的解释框架下:前者是状态空间动力学,后者是在线优化。更关键的是,三者的写入增益均由当前词元表示预测,而非源自对已存关联的显式置信度,因而无法区分“一条被反复确认的关联”与“一条试探性关联”。

本研究贡献。作者提出三项贡献:(1)原理层面——将 delta 规则重述为线性–高斯状态空间模型中的新息更新,证明 DeltaNet / Gated DeltaNet / KDA 分别对应恒等、标量、对角转移的定增益卡尔曼滤波器,即丢弃协方差递推、以各向同性代理 t ≈ b̂tI 替换预测协方差的特例;(2)算法层面——给出硬件高效的 Diagonal 与 Isotropic KDN,其不确定性递推为 Möbius 映射,支持对数并行深度的结合性扫描,每头辅助状态分别为 O(dk)O(1);(3)分析层面——识别对角近似导致的键方向保护不足,引入信息标度控制未来覆盖,并在 750M / 1.3B 两个规模上给出参数匹配的对照证据。

I. Theoretical Framework & Hypotheses(理论框架与假设)

生成模型。设潜在联想映射 t 为记忆所追踪的对象,构造线性–高斯状态空间模型:

t = Dtt-1 + Wt, Wt ~ Ncol(0, Ωt)(状态转移,式 9)
vt = S̃tTkt + et, et ~ N(0, rtIdv)(观测,式 10)

其中 Dt 是过程模型(形式化“遗忘”,对应信息漂移与话题漂移),Ωt 是确定性衰减无法刻画的漂移不确定性,ktT 是观测算子,rt 刻画该词元取值作为记忆目标的可靠程度。初始条件 0 ~ Ncol(0, I)

估计目标。在平方误差损失下,最优点估计为后验均值 St = argminS E[‖S̃t − S‖F2 | Ft] = E[S̃t | Ft](式 11)。

命题内容地位
Prop. 3.2线性–高斯假设下卡尔曼滤波精确计算式 (11),且增益 κt 为最小 MSE 唯一极小点最优性基准(附录 A.1 证)
§3.3弃协方差 + 各向同性代理 ⇒ κt ≈ βtkt,退化为 delta 家族共享的定增益残差写入统一性结论
Prop. 4.1反向 KL 投影到对角均场族,唯一解保持精确一步后验均值,方差取 pt,i = (p̂t,i-1 + kt,i2/rt)-1可并行近似(附录 A.2 证)
Prop. C.1各向同性反向 KL 解为后验协方差特征值的调和平均O(1) 变体

统一命题。三个既有模型仅在过程模型上有别:DeltaNet: Dt = IGDN: Dt = αtIKDA: Dt = diag(αt)(式 20)。三者共享同一观测模型与残差写入,差异仅在写入前如何预测记忆,且一律以定方向 βtkt 冻结不确定性动力学。

M. Materials & Methods(材料与方法)

R. Results(结果)

表 1 · 语言建模与常识推理(parameter-matched,recurrent-only)

模型Wiki. PPL ↓LMB. PPL ↓六项零样本均值 ↑
750M / 50B
DeltaNet19.7820.1751.10
Gated DeltaNet19.5018.0852.71
KDA18.8515.0653.87
Mamba-3 (MIMO)18.9915.6754.39
GDN-221.2017.8851.45
Isotropic KDN18.4214.6854.41
Diagonal KDN18.6414.1554.97
1.3B / 100B
KDA15.4010.0960.28
Mamba-3 (SISO)15.9411.9858.20
Mamba-3 (MIMO)15.6310.4959.85
GDN-216.1511.2958.51
Isotropic KDN15.309.9860.35
Diagonal KDN15.049.7560.45

表 4 · 信息标度消融(750M)

μWiki. PPL ↓LMB. PPL ↓均值 ↑
118.6915.5154.12
√dk18.9315.1054.20
dk18.6414.1554.97
4dk18.9713.9154.92
Learned18.5114.6854.62

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((卡尔曼德尔塔网络))
    I 引言
      线性注意力固定记忆
      每步须决定写多重
      德尔塔规则不看置信
      写强度来自当前词元
      转移与写入两套语言
    R 问题
      能否统一递归写入原理
      不确定性是缺失状态吗
      最优递归估计子是谁
      精确滤波能否并行
      近似会否引发过度覆盖
    M 方法
      线性高斯状态空间
      卡尔曼增益定写强
      对角与各向同性近似
      在线均场变分投影
      莫比乌斯映射并行扫描
      信息标度抑制覆盖
      分块增益扫描加 WY
    R 结果
      七点五亿与十三亿参数
      维基困惑度 15.04
      六项零样本均分 60.45
      长文检索显著领先
      对角版吞吐有代价
    a 讨论
      德尔塔规则是特例
      证据越多越难被改写
      机制证据强于均分
      混合架构收益不齐
      更大规模尚未验证
    D 结论
      不确定性成一等公民
      统一德尔塔与曼巴谱系
      仍非精确卡尔曼记忆
      未来可加阻尼旋转

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。