🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
当下的大模型要读很长的文章,可它们的记忆本子只有固定那么几页,写满了就得擦掉旧的才能写新的。你有没有过这种经历:考前抄了一整页知识点,纸写满了,再遇到新考点就只能把某一行涂掉重写——涂错了行,后面就全乱了。今天的大语言模型正卡在这个难题上。
标准的注意力机制其实很奢侈:它把读过的每一个词都原样留着,随时可以回头翻。好处是什么都不会丢,坏处是读得越长,要存的东西越多,翻一遍的代价还要按长度的平方涨。于是有人提出线性注意力:不留原文,只留一个大小固定的“记忆板”,每读一个词就往板上写一笔,读的时候从板上取。这样解码时占用的内存是恒定的,速度也快得多。
但固定大小意味着必须做取舍。每来一个词,模型都得当场决定:这一笔写多重?写轻了,过期的旧信息赖着不走;写重了,有用的老记忆被一把抹掉。麻烦在于,这个决定必须在还不知道后面会问什么的时候就做出来。
目前最好的一类做法叫德尔塔规则:先看看记忆板对当前这个“钥匙”给出的答案是什么,只把答对与答错之间的差额补上去。这比无脑叠加聪明多了。可是它有个说不过去的地方——写多重,是模型看着当前这一个词临时拍脑袋定的,完全不管板上那条记忆已经被多少次证据支持过。一条被反复确认了几十遍的事实,和一条只写过一次的猜测,在它眼里写起来一样容易被覆盖。
② 研究问题(要回答什么?)
这篇论文想问的是,往固定大小的记忆里写东西时,到底该按什么原则决定每一笔写多重。以前大家是“设计”出一个写入强度的公式,然后拿实验挑一个好用的;作者想反过来,先问清楚什么才是理论上最优的写法,再看现有做法离它有多远。
具体拆成四个问题。
- 问题一:能不能用一套语言把现有模型全部装进去?现在的德尔塔家族有三个代表,它们彼此的差别看着像是零散的工程改良,有没有一个共同的母体?
- 问题二:这些模型到底缺了什么?作者的猜想是,它们缺的不是更花哨的门控,而是一个从来没被跟踪过的状态量——记忆自己对自己有多少把握。
- 问题三:最优解能不能真的跑起来?就算推导出理论上最优的写法,如果它必须一步一步串着算,那在显卡上就是废的——现代训练靠的是把整条序列摊开并行。
- 问题四:近似之后会不会反而更糟?为了能并行,必然要对精确解做简化。简化会带来什么副作用,能不能提前预判并补救?
能把这四问一起答上,才算真的给这个领域换了个地基,而不只是又调出一个好一点的配方。
③ 研究方法(怎么做的?)
作者的核心动作,是把“记忆板”换了一种身份来看:它不再是一块随便涂改的白板,而是对一个看不见的真相的估计。
打个比方。假设你在追踪一个朋友现在住在哪个城市。这件事本身会变(他可能搬家),你收到的消息也不一定准(可能是道听途说)。这正是工程上经典的滤波问题——六十多年前卡尔曼就给出了答案,阿波罗登月的导航用的就是它。
把这套话搬到记忆板上:
- 真相会漂移。上一刻的记忆到这一刻会衰减、会变化。这正好对应现有模型里的“遗忘门”——只不过现在它有了名分,叫过程模型。
- 观测有噪声。每个词提供的“钥匙—取值”对,并不是一条干净的事实。它混着语法、位置、层间串扰。所以模型要学一个量,表示这个词有多可信。
- 关键的新东西:记账记到什么程度。除了记住答案,还要记住对这个答案有多少把握。某个方向被反复观测过,就很有把握;很久没人问过,把握就随着漂移慢慢变小。
有了这三样,写多重就不用再猜了,它由公式直接算出来:把握小就多听新证据,把握大就顶住不改。这个权重就是卡尔曼增益。
最妙的一步在后面。精确解要维护一张很大的方阵,而且必须一步接一步地算,没法并行,等于不能用。作者于是只保留每个通道一个把握值(对角版),或者干脆整个头共用一个(各向同性版)。这一简化后,把握值的递推正好落进数学上一类叫莫比乌斯映射的变换——它可以写成两个数的比值,每一步就是乘一个二乘二的小矩阵。而矩阵连乘是可结合的,于是整条序列可以像求前缀和那样折半并行算完。并行的能力就这样被救了回来。
④ 结果(发现了什么?)
在两种规模的同等条件预训练下,新模型在困惑度、常识问答平均分和长文检索三类指标上都超过了所有参与对比的线性注意力基线。所有模型用同一批数据、同一套骨干、同一个优化配方,参数量对齐到万分之三以内,所以比较是干净的。
在 13 亿参数、1000 亿词元这一档,对角版把维基文本困惑度从最强基线的 15.40 降到 15.04,LAMBADA 困惑度从 10.09 降到 9.75。7.5 亿参数那一档同样全面领先。
13 亿档对角版拿到 60.45,高于最强基线的 60.28;7.5 亿档拿到 54.97,而最好的基线是 54.39。提升不大,但两个规模方向一致。
7.5 亿档的“大海捞针”测试里,上下文拉到 8K 时,对角版还是满分 100.0,而同规模最强基线掉到 82.6,另一条主流路线更是塌到 33.2。
检索才是最有说服力的证据。这一点很重要,因为它不是“分数普涨”,而是恰好涨在理论预测的地方。作者的理论说:跟踪把握度能保护已经写好的记忆不被后来的词误伤。那么最该受益的,就是“信息写进去之后要扛住一大段干扰、最后还能被取出来”的任务。结果正是如此——在最难的三针检索上,7.5 亿档对角版拿 32.2,最强基线只有 13.6,接近两倍半。换成六项真实世界检索任务(含维基问答、表格抽取、阅读理解),13 亿档对角版平均 34.86,最强基线 33.76。
作者还抓出了自己方法的一个毛病并修好了它。把那张大方阵压成一串独立的数,会让模型对每个通道过度自信,结果是同一把钥匙再来一次时下手过猛,几乎把旧值整个换掉。他们用一个叫信息标度的常数把这个劲道压下去:实测下来,训练后的平均覆盖强度从 0.943 降到 0.805,而当前这一笔写入完全不受影响——它只削弱以后的覆盖。这是一处很漂亮的“保护”与“写入”解耦。
⑤ 讨论(这些发现说明什么?)
这项工作真正的分量,不在那零点几分的提升,而在它解释了为什么现有方法长成现在这样。
作者证明了一件很干净的事:如果你把“把握度”这本账扔掉不记,强行假设所有方向的把握都一样大,那么最优的卡尔曼写法会自动退化成现有的德尔塔规则。三个主流模型的区别,也只剩下遗忘方式的不同:一个完全不忘,一个整块按同一速率忘,一个每个通道各忘各的。换句话说,过去几年这条线上的进展,全都是在同一个公式的同一个位置上做文章,而另一个位置——写入强度该由谁决定——从来没被正经动过。这篇论文动的就是那个位置。
还有一层意义是把两条一直各说各话的技术路线接上了。此前,“记忆怎么衰减”被当作状态空间模型的问题,“该写多少”被当作在线优化(相当于做一步梯度下降)的问题,两边用的完全是两套语言。在滤波的框架下,这两件事成了同一个循环里的预测和更新两步。这种把分头发展的分支收进一个母体的能力,通常比多一两个点的成绩更能推动一个领域。
但要老实说清楚局限。第一,最大只做到 13 亿参数、1000 亿词元,离前沿模型的规模还差得远,这个优势能不能一路保持到几百亿参数,论文没法回答。第二,在“循环层与注意力层混搭”的架构里,好处就没那么齐整了——各向同性版的常识问答平均分反而略低于同样混搭的最强基线。第三,消融实验坦承,学出来的噪声参数并不总比固定成常数更好,信息标度的影响作者自己形容为“不大且随指标而异”。第四,对角版因为多跑一遍把握度扫描,速度是要付出代价的。作者在结论里也主动承认,这两个版本只是朝向卡尔曼联想记忆的一步,还不是它本身。
⑥ 结论(最终结论 + 启示)
把不确定性当成循环记忆的一等公民来跟踪,是这篇论文留下的最核心的主张。在此之前,“写多重”是一个设计出来的旋钮;在此之后,它是一个从模型自己的置信度里推导出来的量。
三点值得记住。其一,一个几十年前的经典结果(卡尔曼滤波)被证明正是这个新问题的最优解,而现有方法是它丢掉一本账之后的特例——老工具照进新领域,照出了别人没看见的空缺。其二,理论上最优往往跑不动,作者没有因此妥协掉原理,而是找到莫比乌斯映射这个数学结构,让近似解既保留了不确定性,又保住了并行。其三,也是最诚实的一点:他们预判了自己近似方案会过度自信,提前设计了补救手段,还用实测数据验证了补救确实生效。
对普通读者来说,这件事可以这样理解——我们正在教机器一种此前它并不具备的素质:知道自己哪里知道得牢,哪里只是将信将疑。一个清楚自己把握有多大的记忆,才谈得上在该坚持的时候坚持、该更新的时候更新。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。自注意力通过保留全部词元历史实现基于内容的检索,但自回归 KV 缓存随上下文线性增长、成对交互随序列长度平方增长。线性注意力改为把前缀压缩进固定大小的循环状态 St ∈ Rdk×dv,写入 St = St-1 + ktvtT,读出 ot = StTqt,从而获得常数显存解码与扫描并行训练。代价是注意力退化为一个在线记忆管理问题:每个词元必须在不知道未来查询的前提下编辑压缩摘要。
既往进路与空白。DeltaNet 以误差校正的 delta 规则取代加性写入,只写入残差 βtkt(vt − St-1Tkt)T,通常被解读为对快权重记忆瞬时平方损失做一步在线梯度下降。Gated DeltaNet 与 KDA 保留该残差写入,并加入 Mamba 式状态衰减(标量 / 通道级)。由此,转移与写入长期被置于两种互不相通的解释框架下:前者是状态空间动力学,后者是在线优化。更关键的是,三者的写入增益均由当前词元表示预测,而非源自对已存关联的显式置信度,因而无法区分“一条被反复确认的关联”与“一条试探性关联”。
本研究贡献。作者提出三项贡献:(1)原理层面——将 delta 规则重述为线性–高斯状态空间模型中的新息更新,证明 DeltaNet / Gated DeltaNet / KDA 分别对应恒等、标量、对角转移的定增益卡尔曼滤波器,即丢弃协方差递推、以各向同性代理 P̂t ≈ b̂tI 替换预测协方差的特例;(2)算法层面——给出硬件高效的 Diagonal 与 Isotropic KDN,其不确定性递推为 Möbius 映射,支持对数并行深度的结合性扫描,每头辅助状态分别为 O(dk) 与 O(1);(3)分析层面——识别对角近似导致的键方向保护不足,引入信息标度控制未来覆盖,并在 750M / 1.3B 两个规模上给出参数匹配的对照证据。
I. Theoretical Framework & Hypotheses(理论框架与假设)
生成模型。设潜在联想映射 S̃t 为记忆所追踪的对象,构造线性–高斯状态空间模型:
S̃t = DtS̃t-1 + Wt, Wt ~ Ncol(0, Ωt)(状态转移,式 9)vt = S̃tTkt + et, et ~ N(0, rtIdv)(观测,式 10)
其中 Dt 是过程模型(形式化“遗忘”,对应信息漂移与话题漂移),Ωt 是确定性衰减无法刻画的漂移不确定性,ktT 是观测算子,rt 刻画该词元取值作为记忆目标的可靠程度。初始条件 S̃0 ~ Ncol(0, I)。
估计目标。在平方误差损失下,最优点估计为后验均值 St = argminS E[‖S̃t − S‖F2 | Ft] = E[S̃t | Ft](式 11)。
| 命题 | 内容 | 地位 |
|---|---|---|
| Prop. 3.2 | 线性–高斯假设下卡尔曼滤波精确计算式 (11),且增益 κt 为最小 MSE 唯一极小点 | 最优性基准(附录 A.1 证) |
| §3.3 | 弃协方差 + 各向同性代理 ⇒ κt ≈ βtkt,退化为 delta 家族共享的定增益残差写入 | 统一性结论 |
| Prop. 4.1 | 反向 KL 投影到对角均场族,唯一解保持精确一步后验均值,方差取 pt,i = (p̂t,i-1 + kt,i2/rt)-1 | 可并行近似(附录 A.2 证) |
| Prop. C.1 | 各向同性反向 KL 解为后验协方差特征值的调和平均 | O(1) 变体 |
统一命题。三个既有模型仅在过程模型上有别:DeltaNet: Dt = I;GDN: Dt = αtI;KDA: Dt = diag(αt)(式 20)。三者共享同一观测模型与残差写入,差异仅在写入前如何预测记忆,且一律以定方向 βtkt 冻结不确定性动力学。
M. Materials & Methods(材料与方法)
- 精确递推(Kalman Associative Memory)。预测步
Ŝt = DtSt-1, P̂t = DtPt-1DtT + Ωt;新息δt = vt − ŜtTkt;增益κt = P̂tkt / (rt + ktTP̂tkt);更新St = Ŝt + κtδtT, Pt = (I − κtktT)P̂t。障碍:每头需稠密dk×dk协方差,且Pt服从状态依赖的 Riccati 递推,破坏扫描所需的St = AtSt-1 + bt结构。 - Diagonal KDN。限定
Pt, Ωt ∈ D++dk、Dt = diag(αt),则预测协方差p̂t = αt2 ⊙ pt-1 + ωt仍在对角族内,且条件于该对角先验的卡尔曼增益仍精确:κt = (p̂t ⊙ kt) / (rt + Σi p̂t,ikt,i2)(式 24)。精确后验Pt*因秩一修正而稠密,故每步用在线均场变分投影回对角族(Prop. 4.1)。 - Möbius 结合性扫描。令
ut = μ(kt ⊙ kt)/rt,则pt,i = (αt,i2pt-1,i + ωt,i) / (ut,iαt,i2pt-1,i + 1 + ut,iωt,i)为 Möbius 映射,以齐次坐标[nt,i, dt,i]T表示后每步即左乘一个 2×2 矩阵,复合化为矩阵乘法 ⇒ 结合性前缀扫描、对数并行深度,不确定性状态由dk×dk稠密阵降为dk个标量。 - 信息标度 μ。反向 KL 均场继承坐标级过自信,导致重复键触发过强残差写入。定义有效写入强度
βteff = ktTκt,对等能量 m 通道键有Vproj(μ) = mrp/(mr + μp),故μ = m匹配精确一步方向方差,满支撑时即μ = dk。由于增益在标度更新之前算出,∂κt/∂μt = 0, ∂St/∂μt = 0,而∂βt+1eff/∂μt ≤ 0——纯未来保护、不改当前写入。 - Isotropic KDN。进一步取
Pt ≈ btI。该族对通道级转移不封闭,故预测后按 Frobenius 最近(Πiso(X) = Trace(X)I/dk,保留平均特征值)、条件后按反向 KL 各投影一次,at = Σiαt,i2/dk, b̂t = atbt-1 + ωt, βt = b̂t/(rt + b̂t‖kt‖22)。形式与 delta 家族相同,但βt由累积证据而非独立词元门σ(wβTxt + bβ)决定。 - 分块内核(附录 D)。两阶段:Möbius 增益扫描(块长
Cg = 256,三趟——块内 2×2 汇总、汇总前缀扫描、并行回放发射 κt;fp32 按最大幅值重归一化防溢出),随后增益固定,记忆递推退化为 input-only 非对称 delta 规则,用紧凑 WY 变换求解。 - 实验协议。骨干沿用 GDN-2 的 recurrent-only 与 hybrid 架构;KDN mixer 基于 KDA,以过程噪声 ωt 与观测噪声 rt 取代其 βt 门。750M / 1.3B 分别为 16 / 18 层、
dmodel = 2048 / 2304、16 / 18 个头、头维 128;FFN 宽度调至非嵌入参数量互差 0.03% 以内;Mamba-3 基线亦对齐循环状态总量。1.3B hybrid 为 9 循环层与 9 个 2K 窗口 SWA 层交替。训练:FineWeb-Edu,AdamW,峰值 lr4×10-4,β = (0.9, 0.95),weight decay 0.1,梯度裁剪 1.0,cosine 调度 + 1% 词元预算预热(0.5B / 1B),全局批 0.5M 词元,序列长 4K,同比较内固定数据种子;rmin = 0.01,Wω = 0初始化,每头学一个标量初始协方差c0,h,主实验固定μ = dk。 - 评测。困惑度:WikiText、LAMBADA。零样本六项:LAMBADA、PIQA、HellaSwag、WinoGrande、ARC-e、ARC-c。长上下文检索:RULER 的 S-NIAH-1/2/3 与 MK-NIAH-1,共 14 格。真实检索(JRT 完形格式六项):SWDE、SQuAD、FDA、TriviaQA、NQ、DROP。吞吐:单张 H200,
B = 4,BF16,30 次中位数,仅测 mixer 层而非端到端。
R. Results(结果)
表 1 · 语言建模与常识推理(parameter-matched,recurrent-only)
| 模型 | Wiki. PPL ↓ | LMB. PPL ↓ | 六项零样本均值 ↑ |
|---|---|---|---|
| 750M / 50B | |||
| DeltaNet | 19.78 | 20.17 | 51.10 |
| Gated DeltaNet | 19.50 | 18.08 | 52.71 |
| KDA | 18.85 | 15.06 | 53.87 |
| Mamba-3 (MIMO) | 18.99 | 15.67 | 54.39 |
| GDN-2 | 21.20 | 17.88 | 51.45 |
| Isotropic KDN | 18.42 | 14.68 | 54.41 |
| Diagonal KDN | 18.64 | 14.15 | 54.97 |
| 1.3B / 100B | |||
| KDA | 15.40 | 10.09 | 60.28 |
| Mamba-3 (SISO) | 15.94 | 11.98 | 58.20 |
| Mamba-3 (MIMO) | 15.63 | 10.49 | 59.85 |
| GDN-2 | 16.15 | 11.29 | 58.51 |
| Isotropic KDN | 15.30 | 9.98 | 60.35 |
| Diagonal KDN | 15.04 | 9.75 | 60.45 |
- 检索是差距最大处(RULER,750M / 50B)。S-NIAH-1 @8K:Diagonal KDN 100.0 vs KDA 82.6、GDN-2 47.2、Mamba-3 SISO 33.2。S-NIAH-2 @4K:71.2 vs KDA 63.2。S-NIAH-3 @4K:32.2 vs KDA 13.6(约 2.4 倍)、DeltaNet 17.6。MK-NIAH-1 @4K:29.6 vs KDA 24.2。1.3B 档 S-NIAH-3 @4K:48.6 vs KDA 43.2;MK-NIAH-1 @1K:62.2 vs 次优 Mamba-3 MIMO 51.6。
- 14 格 RULER 聚合。Diagonal KDN 在两个规模均为 recurrent-only 最高;750M 档 14 格均值约 70.3(Mamba-3 MIMO 约 60.0),1.3B 档约 76.5(GDN-2 约 71.0)。
- 真实世界检索(JRT 六项完形,1.3B recurrent-only)。Diagonal KDN 均值 34.86(最优),领先 FDA 30.61(KDA 27.97)、TriviaQA 62.56、DROP 24.10;Isotropic KDN 33.40,KDA 33.76,GDN-2 32.09,Mamba-3 SISO 31.50。
- Hybrid(1.3B,9 循环 + 9 SWA)结果不齐整。零样本均值:Diagonal KDN+SWA 60.11 > KDA+SWA 59.94 > Isotropic KDN+SWA 59.38,即各向同性版在混合架构下反被 KDA 超过;且 Diagonal KDN+SWA (60.11) 低于其 recurrent-only 自身 (60.45)。所有混合模型均优于纯注意力 Transformer(2K SWA,均值 56.23)。JRT 六项上则是 Isotropic KDN+SWA 均值 45.94 居首,Diagonal KDN+SWA 45.55,KDA+SWA 45.09,Transformer 40.02。
表 4 · 信息标度消融(750M)
| μ | Wiki. PPL ↓ | LMB. PPL ↓ | 均值 ↑ |
|---|---|---|---|
| 1 | 18.69 | 15.51 | 54.12 |
| √dk | 18.93 | 15.10 | 54.20 |
| dk | 18.64 | 14.15 | 54.97 |
| 4dk | 18.97 | 13.91 | 54.92 |
| Learned | 18.51 | 14.68 | 54.62 |
- 噪声消融(表 5,固定 μ=1)。可学
rt, ωt:18.69 / 15.51 / 54.12;固定rt=1:18.46 / 15.72 / 53.77;两者均固定为 1:18.64 / 15.84 / 53.87。作者结论:两种约束都未能一致改善短上下文质量——即可学噪声的收益并不干净。 - 覆盖强度实证(附录 B)。池化平均
βeff随 μ 单调下降。随机初始化:0.842 → 0.743 → 0.630 → 0.580;训练后:0.943 → 0.891 → 0.826 → 0.805;固定权重干预:0.886 → 0.873 → 0.862 → 0.857(μ = 1, √dk, dk, 4dk)。与∂βt+1eff/∂μt ≤ 0的理论预测一致。 - 吞吐(Fig. 4)。Isotropic KDN 紧贴 KDA;Diagonal KDN 因通道级不确定性扫描额外付出开销,但接近 GDN-2 且保持线性标度;Mamba-3 SISO 在长上下文领先;全因果注意力随长度急剧劣化。
a / D. Discussion & Conclusion(讨论与结论)
- 理论意义一:归约既有家族。本文给出的不是又一个 mixer,而是一个母体——DeltaNet / Gated DeltaNet / KDA 被精确刻画为定增益卡尔曼滤波器,三者仅在
Dt上分化(I/αtI/diag(αt)),而共同丢失了协方差递推这一状态量。这把“为什么 delta 规则长这样”从经验设计变成了可推导结论。 - 理论意义二:弥合两条解释路线。此前转移由状态空间动力学解释、写入由在线优化(快权重一步梯度)解释,二者语言不通。滤波框架把它们统一为同一递推的 predict 与 update 两步,并明确 Mamba 谱系与 delta 谱系的真实分界:前者是 control-driven 加性写入
Btxt,后者是键条件残差校正——但都用词元预测的增益而非协方差导出的增益。 - 方法论意义:可并行性不是靠牺牲原理换来的。精确 Riccati 递推与扫描不相容,作者没有退回启发式,而是识别出不确定性递推的 Möbius 结构,用 2×2 齐次表示恢复结合性,取得对数并行深度与
O(dk)/O(1)辅助状态。这一处理手法本身可迁移到其它有理递推。 - 机制证据强于聚合证据。零样本均值的增量仅 0.17–0.58 分,但检索类指标(S-NIAH-3、MK-NIAH、FDA)增幅显著,而这恰是理论预测最该受益的位置——通道级不确定性在干扰下保护已存关联。机制与指标对齐,比单纯的困惑度下降更有说服力。
- 局限一:规模。最大 1.3B / 100B,远低于前沿模型;优势能否随规模保持未被验证。作者亦指出循环层与注意力层的最佳配比需专门消融(如 Kimi Linear 对 KDA 所做),本文沿用 GDN-2 配置,自承“这一受控选择未必最优”。
- 局限二:混合架构收益不齐。Isotropic KDN+SWA 零样本均值(59.38)低于 KDA+SWA(59.94);Diagonal KDN+SWA(60.11)低于其自身 recurrent-only(60.45)。论文的强结论主要成立于 recurrent-only 设定。
- 局限三:部件收益边际。作者自述信息标度的整体效应“小且随指标而异”,噪声消融显示两种固定约束均未一致改善短上下文质量,即“可学噪声”的必要性并未被干净证成。Diagonal KDN 另有吞吐开销。
- 局限四:与并行工作的边界。Kalman Linear Attention 同样做扫描并行的贝叶斯滤波,但在时不变 OU 动力学下按特征/状态扩展坐标分解信念;Preconditioned DeltaNet 的精确更新被本文刻画为 Kalman Associative Memory 的静态定噪声极限。因此“不确定性进入线性注意力”并非本文独有,本文的差异在于对联想矩阵做键条件向量值观测,统一范围更广。
- 作者自陈与未来方向。结论明言这两个变体是“朝向而非完整实现”Kalman Associative Memory——精确滤波需稠密键空间协方差与状态依赖 Riccati 更新。拟议方向为把对角衰减扩展为 Mamba-3 式阻尼旋转,使已存关联可旋转而不仅是衰减;如何让更丰富的转移与协方差更新保持扫描高效仍是开放问题。
🧠 IRMaD 思维导图
mindmap
root((卡尔曼德尔塔网络))
I 引言
线性注意力固定记忆
每步须决定写多重
德尔塔规则不看置信
写强度来自当前词元
转移与写入两套语言
R 问题
能否统一递归写入原理
不确定性是缺失状态吗
最优递归估计子是谁
精确滤波能否并行
近似会否引发过度覆盖
M 方法
线性高斯状态空间
卡尔曼增益定写强
对角与各向同性近似
在线均场变分投影
莫比乌斯映射并行扫描
信息标度抑制覆盖
分块增益扫描加 WY
R 结果
七点五亿与十三亿参数
维基困惑度 15.04
六项零样本均分 60.45
长文检索显著领先
对角版吞吐有代价
a 讨论
德尔塔规则是特例
证据越多越难被改写
机制证据强于均分
混合架构收益不齐
更大规模尚未验证
D 结论
不确定性成一等公民
统一德尔塔与曼巴谱系
仍非精确卡尔曼记忆
未来可加阻尼旋转
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。