🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
今天的大语言模型几乎都靠同一种办法学本事,那就是看着前面的字去猜下一个字。
这种办法朴素又好用,但有个说不清的地方。你读一篇文章时,脑子里装的并不是一个个孤立的字,而是「这句话在讲一件什么事」「下一段大概要转折」这样的意思块。已有研究发现,大模型内部其实也会自发长出类似的高层抽象,可它们只是猜字练习的副产品——训练时从来没有人直接要求模型「把握接下来几个字合起来想表达什么」。
图像生成领域早就走过类似的一步:潜在扩散模型不再一个像素一个像素地画,而是先在压缩过的「潜空间」里构思,效率和可扩展性都大幅提升。语言模型能不能也这样?此前已有不少尝试:有的把字按固定长度打包(如 MegaByte、Hourglass Transformer),有的按内容动态切块(如 BLT、H-Net),还有的直接去预测整句话的向量(Large Concept Model)。
和本文最接近的,是同一团队今年早些时候提出的 ConceptLM。它首次提出「下一概念预测」这个训练目标,但当时从零训练的模型最大只有 15 亿参数,另在一个现成的 80 亿参数模型上做过继续预训练。换句话说,这条路在小模型上看着有戏,却从没在主流大模型的完整预训练规模上被正面验证过。大家心里的疑问是:规模一上去,这点好处会不会被淹没?
② 研究问题(要回答什么?)
这份报告想弄清楚,在猜下一个字之外再让模型去猜下一个意思块,放到万亿词元级别的正式预训练里还能不能站得住。
作者没有另起炉灶,而是挑了一个非常干净的参照物:数据、训练流程和评测方案都完全公开的开源模型 OLMo-3-7B。这样就能做到「同样的数据、同样的流程,只换模型结构和训练目标」的正面对照。围绕这个对照,报告回答四个问题。
具体如下:
- 问题一 · 学得更快吗:吃完全相同的数据,训练损失能不能降得更快、更低?
- 问题二 · 考得更好吗:损失低了,数学、代码、常识、知识问答等 26 项考试的分数会不会跟着涨?
- 问题三 · 是不是只因为模型变大了:新结构多塞了 8 层,参数和计算都多了一些。如果把普通模型也加到同样大小、或同样算力,好处还在不在?每个新零件各自贡献多少?
- 问题四 · 学到的「概念空间」有没有别的用处:比如只调这一小块去适配数学、代码等特定领域,或者拿它帮忙加速文字生成。
③ 研究方法(怎么做的?)
可以把新模型想成一个三层楼的写作班。
一楼「读字组」(16 层):和普通模型一样一个字一个字地读,给每个位置写下笔记。
二楼「概念组」(8 层):把一楼的笔记每 4 个词元打成一包取平均,变成一个「概念」;然后只看前面已有的概念,去猜下一包讲的是什么。
三楼「写字组」(16 层):拿着一楼的逐字笔记,再加上二楼猜出的「接下来大概要说什么」,最终决定下一个字。
「概念」不能随便乱猜,否则二楼可以编出任何向量来糊弄。作者给概念准备了一本「概念词典」:把每个概念向量切成 32 段,每一段各配一本只有 128 个词条的小词典。这就像邮政编码,每一位的选择不多,但组合起来能表示的地址多到天文数字(128 的 32 次方)。二楼猜概念时,是给每一段打出「像哪个词条」的概率,再按概率把词条加权混合——既被限定在词典范围内,又能顺畅地求导训练。
还有一个防作弊设计:二楼猜出的概念要往后错开一包再交给三楼,保证三楼预测某个字时,绝不会偷看到用这个字本身算出来的概念。
训练时三件事一起算:猜下一个字(主任务)、猜下一个概念、让词典跟上概念的真实分布。楼层之间还装了「可调节的楼梯」——层级残差连接,让每一层能按需取用本楼前面各层、甚至别的楼层的信息。
整个模型约 89 亿参数,完全照搬 OLMo-3-7B 的两阶段数据:第一阶段吃下 5.73 万亿词元,第二阶段再用约 1000 亿词元的精选数据做中期训练。作者还专门训练了同样大小、同样算力的普通模型当陪练,用来排除「只是块头大」的解释。
④ 结果(发现了什么?)
在和原版模型吃完全相同数据的对照里,新模型不但学得更快,最后的考试成绩也更好。
第一阶段只用了 51.3% 的数据,训练损失就追平了 OLMo-3-7B 训完全程的水平,相当于收敛快 1.95 倍;训到最后,损失还比对方低 0.091。第二阶段同样领先:用 66.2% 的数据就追平对方,快 1.51 倍,而且曲线抖动更小。
第一阶段结束时,26 项考试的平均分从 46.59 升到 49.04(高 2.45 分)。数学类进步最大:小学数学应用题 GSM8K 从 39.27 升到 45.26(高 5.99 分);物理常识题 PiQA 更是涨了 8.60 分;代码题 HumanEval 涨了 4.28 分。
作者把普通模型加到同样参数量(40 层)或同样算力(34 层)来比。新模型明显胜过同算力的版本,并且只用前者 85% 的计算就逼近了同参数量的版本。逐个加零件时,概念模块、层级残差、概念预测目标每加一样,损失就再降一截。在多个算力档位上做的缩放实验显示,新结构的计算效率是原版的 1.74 倍。
只调词典和概念预测头这 1700 万参数去学数学,数学平均分提升 4.27 分,通用能力不降反升 0.39 分;训练吞吐是全参数训练的 2.02 倍。把概念信号喂给推测解码里的「草稿模型」,每轮平均被接受的词元数提升 4.17%。
但也有要打折扣的地方。第二阶段结束后,平均分优势缩小到 0.59 分;代码类平均分反而低了 0.65 分(HumanEval 低了 3.69 分),ARC-Challenge 也低了 2.21 分。作者的解释是第二阶段数据里代码只占约一成,模型把整体数据拟合得更好,却牺牲了占比小的领域。
⑤ 讨论(这些发现说明什么?)
这说明「猜意思块」不只是锦上添花的小技巧,而是真能改变模型从同一份数据里学到多少东西。
打个比方:两个学生读同一本书,一个只练「逐字默写」,另一个同时练「预测下一段大意」。后者被迫去抓住文字背后的结构,于是同样的阅读量学得更扎实。报告里损失曲线的差距随训练推进越拉越大,说明这不是开局的小便宜,而是持续的学习效率优势。
第一,损失低不等于本事大。好处在训练损失上非常稳定,但换算到考试分数并不总是等比例。第二阶段作者试过三种数据配方,训练损失越低的,下游分数反而越差。为此作者搭了一个「代理考试」:由一个教师模型生成 177,202 条专家解题轨迹、约一亿词元,只跑一遍前向就能给候选配方排序,排序和真实考试高度一致(与 HumanEval 的拟合度 R² 达 0.999)。
第二,概念词典做领域适配时「学得少、忘得也少」。学知识问答 TriviaQA 时,只调词典提升 9.19 分,远不及全参数训练的 18.00 分。作者认为事实知识主要存在主干的前馈层里,词典碰不到。
第三,工程上有坑。沿用 OLMo-3 的「整层」Q/K 归一化再配 Muon 优化器时,注意力数值会越长越大并引发梯度尖峰,改成「逐头」归一化就能压住;但为了对照公平,主实验仍保留原配置。
第四,还有没做到的。长上下文训练尚未进行;报告里的计算量是理论估算,没算上层级残差带来的额外显存与访存开销;也没有指令微调或对话版本的评测。
⑥ 结论(最终结论 + 启示)
这份报告证明,让语言模型在猜字之外同时猜意思块,在万亿词元级别的预训练里确实行得通,而且划算。
它交出的成绩单是:同样的数据,用一半左右就学到原版的水平;全程学完,平均分高出 2.45 分;多出的计算不多,缩放实验里却换来 1.74 倍的计算效率。学到的概念空间还能拿来做轻量领域适配和加速生成。
作者把各阶段模型权重、推理脚本、训练配方以及每 10 万步的中间检查点都公开了,别人可以直接接着研究。他们的定位是:潜空间预测不只是一个辅助损失,而是下一代基础模型的一种高效、可扩展的架构蓝图。
不过也要冷静看待:中期训练后分数优势明显缩小,代码能力还有回落,长上下文尚未验证。这是一份「架构预览」,证明了路走得通,但离「全面替代猜字」还有距离。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。生成式 AI 的进展表明,模型学习所在的表征空间与参数规模同等重要:视觉合成中潜在扩散把生成从像素迁移到紧凑连续表示,显著提升建模效率与可扩展性(Rombach et al., 2022;Blattmann et al., 2023)。语言模型隐状态中同样会涌现语义概念与潜在世界表征(Gurnee & Tegmark, 2024;Li et al., 2023;Park et al., 2024),但在标准 NTP 下这些抽象只是间接副产品——监督严格限于细粒度词元,缺乏引导语义结构如何跨多词元展开的显式目标。
文献空白。既往工作可沿两维区分:潜表示如何形成——Hourglass Transformer、ContextLM、MegaByte 使用固定层级或字节块,BLT、DLCM、H-Net 使用动态/输入自适应分块;训练去表示什么——Large Concept Model 在独立编码器定义的连续句向量空间中预测,ConceptLM 在习得的离散概念词表上预测。JEPA 路线(I-JEPA、V-JEPA、V-JEPA 2)已在图像与视频上验证潜空间预测,但语言建模中显式以潜目标学习仍欠探索;MTP 虽监督多个未来位置,其损失仍绑定表层词元。直接前身 ConceptLM(Liu et al., 2026)提出 NCP,但从零训练仅至 1.5B 参数,8B 规模仅以继续预训练方式加入 NCP。
本报告贡献。(1)以 OLMo-3-7B 为骨干构建 8.94B 参数的 NCP-ArchPreview,NCP 自预训练起点全程激活,完成 5.73T 词元 Stage-1 与 Stage-2 中期训练,作者称其为迄今规模最大的潜空间语言模型验证;(2)提出由 IRC 与 CRC 构成的层级残差路由;(3)以同数据基线、参数对齐与算力对齐基线、渐进式组件消融和 IsoFLOP 缩放阶梯隔离增益来源;(4)展示概念空间作为 17M 参数领域适配接口及块并行推测解码增强信号的价值;(5)分析 Muon 与 layer-wise QK 归一化的数值不稳定,并提出基于能力分解代理指标的中期训练配方筛选;(6)开放模型权重、推理脚本、训练配方、每 100,000 步的 Stage-1 检查点、Drafter 模型与最终 Stage-1/Stage-2 检查点。
I. Theoretical Framework & Hypotheses(理论框架与假设)
理论出发点是把 JEPA 式「在潜空间直接预测未来表示以捕获不变语义结构」的原则迁移到自回归语言建模,同时保留标准词元级输入输出与解码接口。与 LCM 不同,预测空间不由外部编码器定义,而是由语言模型自身的中间隐状态经量化习得;与 MTP 不同,监督目标是跨多词元的潜概念而非表层词元。报告的核心设计命题与检验方式整理如下:
| 编号 | 设计命题 | 依据 | 检验方式 |
|---|---|---|---|
| P1 | 在 NTP 之外显式监督多词元跨度的概念级依赖,可提升优化效率与下游能力 | JEPA 潜目标预测;MTP 仍绑定表层词元 | 与 OLMo-3-7B 同数据的 Stage-1/Stage-2 损失曲线、追平所需词元比例、26 项下游基准 |
| P2 | 以 VQ 码本加权组合约束预测空间,优于无约束连续回归 | 无约束回归只规定到目标的距离,不规定何为有效概念表示 | 渐进消融 +CM → +Residual → +NCP |
| P3 | 增益源于潜层级与 NCP,而非额外参数或计算 | Concept Module 每块参数约为 Pblk,计算不足 Fblk 的四分之一 | size-aligned(40 块)与 computation-aligned(34 块)基线;IsoFLOP 缩放 |
| P4 | 三模块深度与序列粒度各异,需跨深度、跨模块的动态稠密连接 | MUDDFormer 单流动态稠密连接 | 1B 规模、150B 词元的残差变体对比 |
| P5 | 习得的离散概念空间是可复用的下游接口 | FFN 作为键值记忆;概念表示含多词元预测信息 | VQ 适配 vs Full/LoRA;3B 规模 NCP 与 MTP 叠加;Drafter 概念注入 |
因果性约束是框架成立的前提:预测概念需重复 k 次并右移 Δ=k 个位置(前 Δ 位补零),ConceptModule→TokenDecoder 的跨模块残差遵循同一偏移,确保 NTP 损失永不以由其监督目标词元本身计算出的概念为条件。梯度分工方面:VQ 损失对连续概念做 stop-gradient,只移动码本;NCP 损失的目标 detach,Token Encoder 只经由历史概念接收 NCP 梯度,从而被鼓励保留对预测下一概念有用的信息;NTP 为全部参数提供稠密监督。
M. Materials & Methods(材料与方法)
- 架构家族:decoder-only Transformer(OLMo-3-7B 骨干)改造的三模块潜空间自回归模型——16 层 Token Encoder → 8 层 Concept Module → 16 层 Token Decoder。hidden 4,096,FFN 11,008,32 头(KV 组 32,头维 128),词表 100,278,SwiGLU,RMSNorm ε=10-6,layer-wise QK RMSNorm,RoPE base 500,000,词元级局部注意力窗口 4,096、每第四层为全注意力,最大训练长度 8,192,dropout 0,总参数 8.94B,参数精度原文记为 BF16。
- 概念词表构造:Encoder 输出 h1:T,按压缩因子 k=4 均值池化
c_m = (1/k)·Σ_{i=1..k} h_{(m-1)k+i},M=⌊T/k⌋;乘积量化把 cm 切为 S=32 段,每段码本 N=128 个码字、码字维度 128,最近邻分配n_m^s = argmin_n ||c_m^s − e_n^s||²,拼接得 dm;潜词表容量 NS = 12832。 - Concept Module 预测:
u_m = ConceptModule(c_1..c_{m-1});每段专属预测头π_m^s = softmax(Head_s(u_m));取期望ĉ_m^s = Σ_n π_{m,n}^s · e_n^s后拼接得 ĉm。不取 argmax、不采样,预测路径全程可微且被限制在码本线性组合内。训练时输入连续概念历史,推理时自回归回灌已预测概念。 - 概念回灌 token 级:预测概念重复 k 次并因果右移 Δ=k,
b_t = 0 (t 小于 Δ);b_t = ĉ_{⌊(t−Δ)/k⌋+2} (t ≥ Δ);与词元隐状态同维直接相加h̃_t = h_t + b_t,Token Decoder 在融合状态上自回归预测下一词元;概念表示经归一化残差在每个 decoder 层注入。 - 层级残差:IRC——候选集 {H1, H1+R1, …, Hℓ+Rℓ},由作用于块输出 Rℓ 的轻量 MLP 产生未归一化(可带符号)系数,初始化为 [0,…,0,1] 即退化为标准残差;CRC——对源模块各深度表示先按粒度分块或重复对齐、LN 后以作用于目标状态的 MLP 输出 softmax 系数加权,再经小值初始化的对角缩放 D∈ℝd 加入目标流;共三条:Encoder→CM、Encoder→Decoder、CM→Decoder。
- 训练目标(端到端联合):
L_total = L_NTP + α·L_NCP + β·L_VQ;L_VQ = (1/MS)·ΣΣ ||sg(c_m^s) − d_m^s||²;L_NCP = (1/(M−1))·Σ_{m=2..M} ||ĉ_m − sg(c_m)||²(MSE);L_NTP = −(1/(T−1))·Σ log p(x_{t+1} | h̃_1..h̃_t)。码本、Encoder、CM、Decoder 同步更新。报告未给出 α、β 的具体取值。 - 优化:矩阵参数用 Moonlight Muon(
W_t = W_{t−1} − η_t(λ_Muon·O_t·√max(d_in,d_out) + λ_wd·W_{t−1})),嵌入、偏置等非矩阵参数用 AdamW;学习率 6×10-5,与 OLMo-3-7B 相同的余弦调度。 - 数据规模:严格沿用 OLMo-3 分阶段课程——Stage-1 为 Dolma 3 Mix,共 5.73T 词元;Stage-2 为 Dolma 3 Dolmino(局限节称 100B 词元中期训练)。基线 OLMo-3-7B 使用完全相同的数据。
- 评测协议:OLMo-Core 实现,26 项计分基准分六组(MMLU 四域 + MMLU-Pro;GSM8K、GSM-Symbolic、Minerva、MATH-500;BigCodeBench、HumanEval、DS-1000、MBPP、MultiPL-E 两项;ARC-E/C;PiQA、CSQA、SIQA;HellaSwag、WinoGrande、LAMBADA 两项、MedMCQA、MedQA),Overall AVG 为 26 项非加权均值;另报 10 项 BPB 似然基准。MMLU 5-shot;GSM8K 8-shot 单样本 pass@1;MATH-500 4-shot 32 样本 pass@1;HumanEval/MBPP 3-shot 32 样本执行 pass@1;全局随机种子 42,提示模板与打分实现在各模型间固定。
- 对照与消融设计:以单个 OLMo-3-7B 块的参数 Pblk、计算 Fblk 计量——NCP 为 40Pblk/34Fblk,Vanilla 32/32,size-aligned 40/40,computation-aligned 34/34;六条曲线在同一配方下训练前 200B 词元(47.7k 步)。残差变体在 1B 规模 NCP 模型上训练 150B 词元、取最后 200 个记录步平均损失。缩放阶梯取 1e19、3e19、5e19、8e19、1e20 FLOPs 五档,因 CM 每块只对每个分块计算一次,不用 6ND 近似而用
C = F_tok·D,每档先在代表模型上搜学习率与批大小,再在邻域内搜其余模型。 - 附加实验:(a)VQ 适配——冻结词元主干、只训码本与概念预测头(17M),对比 Full(8.9B)与参数匹配 LoRA(17M),数据为 Magicoder、Orca-Math、TriviaQA-RC;(b)3B 规模 MTP——NCP 为 8/4/7 层,基线 OLMo-3-3B 的 16 层按 8/1/7 分组并加同样残差,各配一层 MTP(预测 t+2,权重 0.3),训练 150B 词元;(c)块并行 Drafter——1.1B 参数,融合 DFlash2 双抽头动态卷积与 top-16 路径选择、DFlare 五路 Target 隐状态加权,概念注入
s̃ = s + tanh(g) ⊙ RMSNorm(c_{⌊t/k⌋}),门控零初始化,新增 0.04M 参数;序列 8,192、每序列 512 锚点、全局批 512、5B 词元子集重复 10 轮,提议长度 16,指标为平均接受长度 MAL。
R. Results(结果)
- 训练损失:Stage-1 全程低于 OLMo-3-7B,差距随训练扩大,末段 Δloss = 0.091;以 51.3% 词元达到基线最终损失(收敛加速 1.95×)。Stage-2 最终损失低 0.027,以 66.2% 词元追平(1.51×),波动更小。
- 下游(Table 1,分组均值):
| 类别 | S1 Vanilla | S1 NCP | Δ | S2 Vanilla | S2 NCP | Δ |
|---|---|---|---|---|---|---|
| MMLU AVG | 54.50 | 56.73 | +2.24 | 58.32 | 59.94 | +1.62 |
| MATH AVG | 20.79 | 24.54 | +3.75 | 55.63 | 57.39 | +1.76 |
| Code AVG | 25.15 | 27.79 | +2.64 | 39.42 | 38.77 | −0.65 |
| MC-STEM AVG | 84.47 | 86.93 | +2.47 | 89.65 | 88.67 | −0.98 |
| MC-Non-STEM AVG | 70.08 | 74.71 | +4.63 | 76.85 | 77.76 | +0.91 |
| GenQA AVG | 54.29 | 54.76 | +0.47 | 53.49 | 54.04 | +0.55 |
| Overall AVG | 46.59 | 49.04 | +2.45 | 56.98 | 57.57 | +0.59 |
| BPB AVG(越低越好) | 0.824 | 0.811 | −0.014 | 0.793 | 0.763 | −0.030 |
- 关键单项:S1 GSM8K 39.27→45.26(+5.99)、PiQA +8.60、MultiPL-E MBPP +5.29、HumanEval +4.28、MMLU-Humanities +3.55、ARC-C +3.58,HellaSwag 持平(66.05);S2 GSM8K 79.68→83.02(+3.34),但 HumanEval 49.31→45.62(−3.69)、ARC-C 85.49→83.28(−2.21)、BigCodeBench −1.16;S2 BPB 中 CoQA +0.040、MT-MBPP Gold +0.025、GSM8K Gold +0.024 变差。作者将 S2 代码回落归因于 Stage-2 仅约 10% 代码数据。Stage-1 轨迹上 Overall AVG 由 100K 步的 39.64 单调抬升至最终 49.04。
- 参数/算力对齐(前 200B 词元):NCP 显著优于 Vanilla 与 computation-aligned,以 34/40 = 85% 计算逼近 size-aligned;渐进消融中 +CM、+Residual、+NCP 依次降低损失(逐项数值仅见图示)。
- 缩放:compute-optimal 训练下相对 OLMo-3 计算效率 1.74×;阶梯中 1e20 FLOPs 档最优点为 H=1,792、8/8/8 层、D=18.516B、验证损失 2.449。
- 层级残差(1B,150B 词元):
| 变体 | Avg LM loss | Δ loss | Δ FLOPs |
|---|---|---|---|
| 无层级残差(参照) | 2.2588 | 0.0000 | 0.000% |
| IRC + CRC | 2.2265 | −0.0323 | +0.051% |
| IRC only | 2.2315 | −0.0273 | +0.024% |
| IRC + 输入级跨模块连接 | 2.2292 | −0.0296 | +0.024% |
| IRC + 全阶段 softmax | 2.2295 | −0.0294 | +0.024% |
| Block AttnRes(S=4)+ 跨模块 | 2.2409 | −0.0180 | +0.026% |
- NCP 与 MTP(3B,150B 词元,Table 8):OLMo-3-3B+Residual 2.3805(3.245×1021 FLOPs);+MTP 2.3739(−0.0065,FLOPs +15.55%);NCP 2.3707(−0.0098,FLOPs −0.57%);NCP+MTP 2.3664(−0.0141,FLOPs +14.98%)。NCP 在约第 2,285 次更新处稳定反超 Residual+MTP,二者增益可叠加。
- 稳定性:Muon + layer-wise QK norm 出现注意力 logit 持续增长、少数离群头主导与梯度范数尖峰;Muon 基线即可复现,per-head QK norm 可同时压制 Q/K 范数离群与 logit 增长(主实验未采用)。
- 领域适配(自 Stage-1 起,括号为相对各自起点):
| 设置 | 代码 Avg | 通用 Δ | 数学 Avg | 通用 Δ | TriviaQA EM | 通用 Δ |
|---|---|---|---|---|---|---|
| NCP 起点 | 30.04 | — | 30.56 | — | 40.28 | — |
| NCP +Full(8.9B) | 28.43(−1.61) | −0.48 | 36.72(+6.16) | −0.97 | 58.28(+18.00) | −0.29 |
| NCP +LoRA(17M) | 31.38(+1.34) | −0.11 | 33.71(+3.15) | −0.42 | 57.76(+17.48) | −0.14 |
| NCP +VQ(17M) | 32.69(+2.65) | −0.42 | 34.83(+4.27) | +0.39 | 49.47(+9.19) | +0.03 |
| OLMo-3-7B 起点 | 28.11 | — | 26.34 | — | 48.49 | — |
| OLMo +Full | 27.62(−0.49) | −0.63 | 36.54(+10.20) | −1.10 | 57.02(+8.53) | −1.04 |
| OLMo +LoRA | 24.43(−3.68) | −0.68 | 31.05(+4.71) | −0.81 | 56.55(+8.06) | −1.80 |
- 代码适配中 Full 在 MBPP+ 上 −22.49,是 VQ 为唯一四项全升设置的主因;8 卡、micro-batch 1 时吞吐 VQ 15,632 / LoRA 10,400 / Full 7,739 tokens/s/GPU(1.50×、2.02×),显存占用 32.4% / 49.0% / 90.3%;单卡 micro-batch 2 时 VQ 51.6%、LoRA 87.9%、Full OOM。
| Drafter MAL | Baseline | +Concept | 相对增益 |
|---|---|---|---|
| GSM8K | 6.351 | 6.537 | +2.93% |
| MATH | 6.105 | 6.240 | +2.22% |
| HumanEval | 5.432 | 5.845 | +7.59% |
| MBPP | 5.844 | 6.099 | +4.37% |
| 宏平均 | 5.933 | 6.180 | +4.17% |
- 中期训练代理指标(附录 C):由 Qwen3.7-Plus 教师生成 177,202 条专家轨迹、63 个来源、六个领域、约 100M 教师后缀词元;V1/V2/V3 在四个自由生成能力叶上的 NLL 排序与下游完全一致,Stage-2 拟合 R²:HumanEval 0.999、MBPP 0.906、MATH-500 0.885、Minerva 0.892、MMLU-STEM 0.962、BBH 0.531;V1 相对 V3 在 HumanEval +5.64、MATH-500 +6.52。
a / D. Discussion & Conclusion(讨论与结论)
- 理论意义:结果支持「语言模型自身习得的潜表示可在万亿词元规模上作为一等预测目标」。与仅改变计算粒度的层级模型(MegaByte、BLT、H-Net)不同,NCP-ArchPreview 改变的是预训练监督目标本身,并以码本加权组合给潜目标提供结构化约束,避免连续回归目标漂移。
- 增益归因:同数据、参数对齐(40 块)、算力对齐(34 块)与 IsoFLOP 缩放(1.74×)四重对照,加上 CM→Residual→NCP 渐进消融,较有说服力地排除了「仅靠额外容量」的解释;3B 规模上 NCP 以略少 FLOPs 超过 MTP,且二者可叠加,说明概念级监督与多词元表层监督互补。
- 概念空间作为接口:VQ 适配以零新增参数实现「学得少、忘得少」的领域适配,并在吞吐与显存上优于 LoRA;但知识类适配增益(+9.19)远低于 Full(+18.00),作者以 FFN 键值记忆解释——VQ 无法改写主干中编码的事实关联。概念注入 Drafter 在不增加 Target 计算下提升 MAL,表明分块概念表示携带超出词元级特征的预测上下文。
- 局限(作者自述):(1)未含长上下文训练,而压缩序列上的概念通路恰可能在长上下文中更有利;(2)损失优势向下游转化依赖训练分布与评测领域——Stage-1 +2.45,Stage-2 仅 +0.59 且代码 −0.65、HumanEval −3.69,Stage-2 三种配方训练损失越低下游越差;(3)分析 FLOPs 未计入源状态物化、访存、归约操作与小核启动开销,层级残差的实际运行与显存成本可能更高。
- 局限(阅读补充):(4)报告未披露 α、β 取值、训练硬件规模与墙钟时间;(5)组件消融仅覆盖前 200B 词元,残差对比在 1B 规模,缩放阶梯最高 1e20 FLOPs、训练词元不超过 41.375B,与主模型量级相差甚远;(6)主实验保留已知在 Muon 下不稳定的 layer-wise QK norm;(7)仅评测基座模型,无指令微调、对话或长链推理评测;(8)NCP Stage-1 在 TriviaQA 起点(40.28)低于 OLMo-3-7B(48.49),知识类能力并非全面领先;(9)适配实验表中的 Stage-1 基线分数与 Table 1 口径不一致。
- 实践启示:同数据下约一半词元达到基线损失,对算力受限团队有直接价值;VQ 适配为多领域轻量定制提供了不增参数的新选项;以 100M 词元代理集单次前向筛选中期训练配方,可替代反复运行完整下游评测。
- 结论:NCP-ArchPreview 以 8.94B 参数、5.73T 词元验证了词元与概念联合建模在前沿规模上的可行性与可扩展性,作者将其定位为下一代基础模型的高效架构蓝图;后续方向是长上下文训练,以及让优化优势更稳定地转化为下游能力(中期训练配方、能力感知数据选择、结合代理评测的检查点选择)。
- 资源与机构:The Intern-NCP Team(上海人工智能实验室;上海交通大学 LUMIA Lab);权重见 Hugging Face ArchSpace-Collection,推理基于 lmdeploy,评测代码 LUMIA-Group/ncp_olmo_eval。报告未列资助信息。
🧠 IRMaD 思维导图
mindmap
root((下一概念预测))
I 引言
NTP只监督单个词元
高层抽象仅是副产品
ConceptLM仅小规模
潜空间预测少验证
R 问题
同数据能否学得更快
下游分数能否提升
增益是否来自算力
概念空间有无他用
M 方法
16加8加16三模块
每4词元池化成概念
32段乘积量化词表
码本加权预测概念
因果偏移回灌解码器
IRC与CRC层级残差
5.73T词元同数据对照
R 结果
51.3%词元追平损失
平均分高2.45
GSM8K高5.99
85%算力逼近40层
计算效率1.74倍
中期训练后仅高0.59
a 讨论
损失与下游不同步
中期训练代码回落
VQ适配忘得少
NCP与MTP可叠加
Muon需逐头QK归一
D 结论
潜表示可作预测目标
可扩展架构蓝图
长上下文待验证
权重与检查点开源
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。