arXiv 技术报告 · cs.CL · 2026-09 · 上海人工智能实验室 × 上海交大 LUMIA Lab · 8.94B 参数 / 5.73T 词元 · 开放权重与检查点

NCP-ArchPreview 技术报告:以下一概念预测迈向潜空间语言模型

The Intern-NCP Team, Jiaqi Cao, Chiyu Chen 等 28 人 · arXiv preprint (cs.CL) · Technical Report · 2026 · DOI: 10.48550/arXiv.2609.10715 · arXiv: 2609.10715
原题:NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
Open Access 新颖度 0.86

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

今天的大语言模型几乎都靠同一种办法学本事,那就是看着前面的字去猜下一个字。

这种办法朴素又好用,但有个说不清的地方。你读一篇文章时,脑子里装的并不是一个个孤立的字,而是「这句话在讲一件什么事」「下一段大概要转折」这样的意思块。已有研究发现,大模型内部其实也会自发长出类似的高层抽象,可它们只是猜字练习的副产品——训练时从来没有人直接要求模型「把握接下来几个字合起来想表达什么」。

图像生成领域早就走过类似的一步:潜在扩散模型不再一个像素一个像素地画,而是先在压缩过的「潜空间」里构思,效率和可扩展性都大幅提升。语言模型能不能也这样?此前已有不少尝试:有的把字按固定长度打包(如 MegaByte、Hourglass Transformer),有的按内容动态切块(如 BLT、H-Net),还有的直接去预测整句话的向量(Large Concept Model)。

和本文最接近的,是同一团队今年早些时候提出的 ConceptLM。它首次提出「下一概念预测」这个训练目标,但当时从零训练的模型最大只有 15 亿参数,另在一个现成的 80 亿参数模型上做过继续预训练。换句话说,这条路在小模型上看着有戏,却从没在主流大模型的完整预训练规模上被正面验证过。大家心里的疑问是:规模一上去,这点好处会不会被淹没?

② 研究问题(要回答什么?)

这份报告想弄清楚,在猜下一个字之外再让模型去猜下一个意思块,放到万亿词元级别的正式预训练里还能不能站得住。

作者没有另起炉灶,而是挑了一个非常干净的参照物:数据、训练流程和评测方案都完全公开的开源模型 OLMo-3-7B。这样就能做到「同样的数据、同样的流程,只换模型结构和训练目标」的正面对照。围绕这个对照,报告回答四个问题。

具体如下:

③ 研究方法(怎么做的?)

可以把新模型想成一个三层楼的写作班

一楼「读字组」(16 层):和普通模型一样一个字一个字地读,给每个位置写下笔记。
二楼「概念组」(8 层):把一楼的笔记每 4 个词元打成一包取平均,变成一个「概念」;然后只看前面已有的概念,去猜下一包讲的是什么。
三楼「写字组」(16 层):拿着一楼的逐字笔记,再加上二楼猜出的「接下来大概要说什么」,最终决定下一个字。

「概念」不能随便乱猜,否则二楼可以编出任何向量来糊弄。作者给概念准备了一本「概念词典」:把每个概念向量切成 32 段,每一段各配一本只有 128 个词条的小词典。这就像邮政编码,每一位的选择不多,但组合起来能表示的地址多到天文数字(128 的 32 次方)。二楼猜概念时,是给每一段打出「像哪个词条」的概率,再按概率把词条加权混合——既被限定在词典范围内,又能顺畅地求导训练。

还有一个防作弊设计:二楼猜出的概念要往后错开一包再交给三楼,保证三楼预测某个字时,绝不会偷看到用这个字本身算出来的概念。

训练时三件事一起算:猜下一个字(主任务)、猜下一个概念、让词典跟上概念的真实分布。楼层之间还装了「可调节的楼梯」——层级残差连接,让每一层能按需取用本楼前面各层、甚至别的楼层的信息。

整个模型约 89 亿参数,完全照搬 OLMo-3-7B 的两阶段数据:第一阶段吃下 5.73 万亿词元,第二阶段再用约 1000 亿词元的精选数据做中期训练。作者还专门训练了同样大小、同样算力的普通模型当陪练,用来排除「只是块头大」的解释。

④ 结果(发现了什么?)

在和原版模型吃完全相同数据的对照里,新模型不但学得更快,最后的考试成绩也更好。

① 学得快将近一倍
第一阶段只用了 51.3% 的数据,训练损失就追平了 OLMo-3-7B 训完全程的水平,相当于收敛快 1.95 倍;训到最后,损失还比对方低 0.091。第二阶段同样领先:用 66.2% 的数据就追平对方,快 1.51 倍,而且曲线抖动更小。
② 考试平均分更高
第一阶段结束时,26 项考试的平均分从 46.59 升到 49.04(高 2.45 分)。数学类进步最大:小学数学应用题 GSM8K 从 39.27 升到 45.26(高 5.99 分);物理常识题 PiQA 更是涨了 8.60 分;代码题 HumanEval 涨了 4.28 分。
③ 不是靠「块头大」
作者把普通模型加到同样参数量(40 层)或同样算力(34 层)来比。新模型明显胜过同算力的版本,并且只用前者 85% 的计算就逼近了同参数量的版本。逐个加零件时,概念模块、层级残差、概念预测目标每加一样,损失就再降一截。在多个算力档位上做的缩放实验显示,新结构的计算效率是原版的 1.74 倍
④ 概念词典的副业
只调词典和概念预测头这 1700 万参数去学数学,数学平均分提升 4.27 分,通用能力不降反升 0.39 分;训练吞吐是全参数训练的 2.02 倍。把概念信号喂给推测解码里的「草稿模型」,每轮平均被接受的词元数提升 4.17%

但也有要打折扣的地方。第二阶段结束后,平均分优势缩小到 0.59 分;代码类平均分反而低了 0.65 分(HumanEval 低了 3.69 分),ARC-Challenge 也低了 2.21 分。作者的解释是第二阶段数据里代码只占约一成,模型把整体数据拟合得更好,却牺牲了占比小的领域。

⑤ 讨论(这些发现说明什么?)

这说明「猜意思块」不只是锦上添花的小技巧,而是真能改变模型从同一份数据里学到多少东西。

打个比方:两个学生读同一本书,一个只练「逐字默写」,另一个同时练「预测下一段大意」。后者被迫去抓住文字背后的结构,于是同样的阅读量学得更扎实。报告里损失曲线的差距随训练推进越拉越大,说明这不是开局的小便宜,而是持续的学习效率优势。

第一,损失低不等于本事大。好处在训练损失上非常稳定,但换算到考试分数并不总是等比例。第二阶段作者试过三种数据配方,训练损失越低的,下游分数反而越差。为此作者搭了一个「代理考试」:由一个教师模型生成 177,202 条专家解题轨迹、约一亿词元,只跑一遍前向就能给候选配方排序,排序和真实考试高度一致(与 HumanEval 的拟合度 R² 达 0.999)。

第二,概念词典做领域适配时「学得少、忘得也少」。学知识问答 TriviaQA 时,只调词典提升 9.19 分,远不及全参数训练的 18.00 分。作者认为事实知识主要存在主干的前馈层里,词典碰不到。

第三,工程上有坑。沿用 OLMo-3 的「整层」Q/K 归一化再配 Muon 优化器时,注意力数值会越长越大并引发梯度尖峰,改成「逐头」归一化就能压住;但为了对照公平,主实验仍保留原配置。

第四,还有没做到的。长上下文训练尚未进行;报告里的计算量是理论估算,没算上层级残差带来的额外显存与访存开销;也没有指令微调或对话版本的评测。

⑥ 结论(最终结论 + 启示)

这份报告证明,让语言模型在猜字之外同时猜意思块,在万亿词元级别的预训练里确实行得通,而且划算。

它交出的成绩单是:同样的数据,用一半左右就学到原版的水平;全程学完,平均分高出 2.45 分;多出的计算不多,缩放实验里却换来 1.74 倍的计算效率。学到的概念空间还能拿来做轻量领域适配和加速生成。

作者把各阶段模型权重、推理脚本、训练配方以及每 10 万步的中间检查点都公开了,别人可以直接接着研究。他们的定位是:潜空间预测不只是一个辅助损失,而是下一代基础模型的一种高效、可扩展的架构蓝图

不过也要冷静看待:中期训练后分数优势明显缩小,代码能力还有回落,长上下文尚未验证。这是一份「架构预览」,证明了路走得通,但离「全面替代猜字」还有距离。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。生成式 AI 的进展表明,模型学习所在的表征空间与参数规模同等重要:视觉合成中潜在扩散把生成从像素迁移到紧凑连续表示,显著提升建模效率与可扩展性(Rombach et al., 2022;Blattmann et al., 2023)。语言模型隐状态中同样会涌现语义概念与潜在世界表征(Gurnee & Tegmark, 2024;Li et al., 2023;Park et al., 2024),但在标准 NTP 下这些抽象只是间接副产品——监督严格限于细粒度词元,缺乏引导语义结构如何跨多词元展开的显式目标。

文献空白。既往工作可沿两维区分:潜表示如何形成——Hourglass Transformer、ContextLM、MegaByte 使用固定层级或字节块,BLT、DLCM、H-Net 使用动态/输入自适应分块;训练去表示什么——Large Concept Model 在独立编码器定义的连续句向量空间中预测,ConceptLM 在习得的离散概念词表上预测。JEPA 路线(I-JEPA、V-JEPA、V-JEPA 2)已在图像与视频上验证潜空间预测,但语言建模中显式以潜目标学习仍欠探索;MTP 虽监督多个未来位置,其损失仍绑定表层词元。直接前身 ConceptLM(Liu et al., 2026)提出 NCP,但从零训练仅至 1.5B 参数,8B 规模仅以继续预训练方式加入 NCP。

本报告贡献。(1)以 OLMo-3-7B 为骨干构建 8.94B 参数的 NCP-ArchPreview,NCP 自预训练起点全程激活,完成 5.73T 词元 Stage-1 与 Stage-2 中期训练,作者称其为迄今规模最大的潜空间语言模型验证;(2)提出由 IRC 与 CRC 构成的层级残差路由;(3)以同数据基线、参数对齐与算力对齐基线、渐进式组件消融和 IsoFLOP 缩放阶梯隔离增益来源;(4)展示概念空间作为 17M 参数领域适配接口及块并行推测解码增强信号的价值;(5)分析 Muon 与 layer-wise QK 归一化的数值不稳定,并提出基于能力分解代理指标的中期训练配方筛选;(6)开放模型权重、推理脚本、训练配方、每 100,000 步的 Stage-1 检查点、Drafter 模型与最终 Stage-1/Stage-2 检查点。

I. Theoretical Framework & Hypotheses(理论框架与假设)

理论出发点是把 JEPA 式「在潜空间直接预测未来表示以捕获不变语义结构」的原则迁移到自回归语言建模,同时保留标准词元级输入输出与解码接口。与 LCM 不同,预测空间不由外部编码器定义,而是由语言模型自身的中间隐状态经量化习得;与 MTP 不同,监督目标是跨多词元的潜概念而非表层词元。报告的核心设计命题与检验方式整理如下:

编号设计命题依据检验方式
P1在 NTP 之外显式监督多词元跨度的概念级依赖,可提升优化效率与下游能力JEPA 潜目标预测;MTP 仍绑定表层词元与 OLMo-3-7B 同数据的 Stage-1/Stage-2 损失曲线、追平所需词元比例、26 项下游基准
P2以 VQ 码本加权组合约束预测空间,优于无约束连续回归无约束回归只规定到目标的距离,不规定何为有效概念表示渐进消融 +CM → +Residual → +NCP
P3增益源于潜层级与 NCP,而非额外参数或计算Concept Module 每块参数约为 Pblk,计算不足 Fblk 的四分之一size-aligned(40 块)与 computation-aligned(34 块)基线;IsoFLOP 缩放
P4三模块深度与序列粒度各异,需跨深度、跨模块的动态稠密连接MUDDFormer 单流动态稠密连接1B 规模、150B 词元的残差变体对比
P5习得的离散概念空间是可复用的下游接口FFN 作为键值记忆;概念表示含多词元预测信息VQ 适配 vs Full/LoRA;3B 规模 NCP 与 MTP 叠加;Drafter 概念注入

因果性约束是框架成立的前提:预测概念需重复 k 次并右移 Δ=k 个位置(前 Δ 位补零),ConceptModule→TokenDecoder 的跨模块残差遵循同一偏移,确保 NTP 损失永不以由其监督目标词元本身计算出的概念为条件。梯度分工方面:VQ 损失对连续概念做 stop-gradient,只移动码本;NCP 损失的目标 detach,Token Encoder 只经由历史概念接收 NCP 梯度,从而被鼓励保留对预测下一概念有用的信息;NTP 为全部参数提供稠密监督。

M. Materials & Methods(材料与方法)

R. Results(结果)

类别S1 VanillaS1 NCPΔS2 VanillaS2 NCPΔ
MMLU AVG54.5056.73+2.2458.3259.94+1.62
MATH AVG20.7924.54+3.7555.6357.39+1.76
Code AVG25.1527.79+2.6439.4238.77−0.65
MC-STEM AVG84.4786.93+2.4789.6588.67−0.98
MC-Non-STEM AVG70.0874.71+4.6376.8577.76+0.91
GenQA AVG54.2954.76+0.4753.4954.04+0.55
Overall AVG46.5949.04+2.4556.9857.57+0.59
BPB AVG(越低越好)0.8240.811−0.0140.7930.763−0.030
变体Avg LM lossΔ lossΔ FLOPs
无层级残差(参照)2.25880.00000.000%
IRC + CRC2.2265−0.0323+0.051%
IRC only2.2315−0.0273+0.024%
IRC + 输入级跨模块连接2.2292−0.0296+0.024%
IRC + 全阶段 softmax2.2295−0.0294+0.024%
Block AttnRes(S=4)+ 跨模块2.2409−0.0180+0.026%
设置代码 Avg通用 Δ数学 Avg通用 ΔTriviaQA EM通用 Δ
NCP 起点30.0430.5640.28
NCP +Full(8.9B)28.43(−1.61)−0.4836.72(+6.16)−0.9758.28(+18.00)−0.29
NCP +LoRA(17M)31.38(+1.34)−0.1133.71(+3.15)−0.4257.76(+17.48)−0.14
NCP +VQ(17M)32.69(+2.65)−0.4234.83(+4.27)+0.3949.47(+9.19)+0.03
OLMo-3-7B 起点28.1126.3448.49
OLMo +Full27.62(−0.49)−0.6336.54(+10.20)−1.1057.02(+8.53)−1.04
OLMo +LoRA24.43(−3.68)−0.6831.05(+4.71)−0.8156.55(+8.06)−1.80
Drafter MALBaseline+Concept相对增益
GSM8K6.3516.537+2.93%
MATH6.1056.240+2.22%
HumanEval5.4325.845+7.59%
MBPP5.8446.099+4.37%
宏平均5.9336.180+4.17%

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((下一概念预测))
    I 引言
      NTP只监督单个词元
      高层抽象仅是副产品
      ConceptLM仅小规模
      潜空间预测少验证
    R 问题
      同数据能否学得更快
      下游分数能否提升
      增益是否来自算力
      概念空间有无他用
    M 方法
      16加8加16三模块
      每4词元池化成概念
      32段乘积量化词表
      码本加权预测概念
      因果偏移回灌解码器
      IRC与CRC层级残差
      5.73T词元同数据对照
    R 结果
      51.3%词元追平损失
      平均分高2.45
      GSM8K高5.99
      85%算力逼近40层
      计算效率1.74倍
      中期训练后仅高0.59
    a 讨论
      损失与下游不同步
      中期训练代码回落
      VQ适配忘得少
      NCP与MTP可叠加
      Muon需逐头QK归一
    D 结论
      潜表示可作预测目标
      可扩展架构蓝图
      长上下文待验证
      权重与检查点开源

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。