arXiv 预印本 · 2026-07-15 · 微软研究院 · 14B 稠密模型 Codeforces 2048 分 · 首个在 235B MoE 上稳定训练的 GFlowNet 式 RL · 代码将开源

GFlowRL:让分布匹配式强化学习第一次在大模型上稳定跑起来

Xiaodong Liu, Michael Xu, Jack W. Stokes 等 6 人 · arXiv (cs.CL / cs.LG) · Microsoft Research · 2026 · arXiv: 2607.13394
原题:GFlowRL: Scaling Distribution-Matching RL to Large Language Models
Open Access 新颖度 0.86

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

今天最强的那批推理模型,后训练阶段都依赖强化学习。无论是 o1、o3、DeepSeek-R1 还是 Gemini,都不例外。这一步的效果,直接决定了模型在数学、竞赛编程、科学问题和智能体决策上的表现。

但目前主流的强化学习方法有一个共同的性格:它们都在最大化奖励。

这听上去理所当然——谁不想要更高的分数呢?问题出在后果上。一味追求最高分,会让模型把概率质量全部堆在一条它认为最好的解法上,其他同样正确的解法被逐渐抛弃。这个现象叫模式塌缩。

为什么这是个问题?因为在思维链推理里,能走通的路往往不止一条,而保留多条路对泛化和稳健性至关重要。一个只会一种解法的模型,换个题型可能就束手无策。

目前的补救办法——熵奖励、自适应裁剪、词元级探索——都是把多样性当作一个事后的正则项贴上去,核心目标依然是最大化奖励,没有变。

有另一条思路从根上换了目标:不去最大化奖励,而是让模型按奖励的比例去采样。奖励高的解法被采到的概率就高,但奖励次高的也不会被完全抹掉。这条思路来自生成流网络。

② 研究问题(要回答什么?)

这条思路已经有人试过,在数学和代码上也看到了前景。但它一到真正的大模型后训练场景就撑不住。

作者要回答的问题很直接:这条路究竟卡在哪里?

他们描述的困境是这样的:在现代大模型的后训练里,模型规模、推理链长度、奖励噪声、分布式系统复杂度是同时增长的。在这种环境里,前作方法要额外训练一个辅助网络,而这个网络会变成梯度不稳定的来源和工程负担,而不是一个有用的归一化器。

由此引出全文的核心追问:这个此前被当作不可或缺的部件,究竟是不是真的必要?

作者的做法是先做诊断再动手术,而不是先提方法再补解释。

③ 研究方法(怎么做的?)

诊断分两步,两步都很干净利落。

第一步:它有用吗?作者做了一个近乎冒犯的实验——把这个辛苦训练出来的部件整个删掉,换成从一个固定正态分布里随机抽出来的数。如果它真的编码了有用的信息,性能应该显著下降。

第二步:它是良性的吗?作者对比了训练过程中梯度大小的统计量。

基于诊断结果,作者提出的替代方案朴素得出奇。他们注意到一件事:在现有的训练流程里,为了给每道题打分,本来就要采样一组回答。而理论分析表明,这个被删掉的量在最优点处刚好等于一个可以从这组回答里直接算出来的表达式。

于是不需要任何额外的网络、额外的学习率、额外的跨模块同步,直接拿这组现成的回答算一个批内均值就行。这个量以“不回传梯度”的方式接入,只起一个把残差居中的基准作用。

为了把配方补完整,作者加了两个稳定器:一个用于修正采样策略与训练策略之间的漂移,另一个对异常残差做非对称裁剪,思路上借鉴了信赖域方法。此外由于推理回答可能长达数千词元,作者还按回答长度做了归一化,避免长回答主导损失。

④ 结果(发现了什么?)

两步诊断的答案都相当刺眼:那个被认为不可或缺的部件,既没有用,还很有害。

第一个答案:把它换成纯高斯噪声,平均准确率不降反升(36.19 对 35.63)。也就是说,这个被精心设计的部件对策略几乎没有贡献,训练过程实际上把它忽略了。

第二个答案:它严重破坏了训练稳定性。梯度大小的对比触目惊心——本文方法的梯度均值是 0.07、最大值不到 6.2,作为参照的主流方法均值 0.24、最大值 5.9;而前作方法的梯度均值高达 3.2 乘以 10 的 14 次方,最大值到 9.6 乘以 10 的 16 次方,421 步里有 55 步发生了超过一百万的梯度爆炸。

再看性能。在 7B 规模的数学任务上,本文方法的六项平均分是 40.92,比主流基线高 8.44 分,比前作高 5.29 分。在代码任务上各项指标全面领先。

更有分量的是 14B 规模的成绩:Codeforces 达到 2048 分,比同规模最强开源方案高 112 分,比前作高 144 分,比 OpenAI 的 o1 高 157 分,距离 o3-mini 只差 25 分

最能说明问题的是那些前作根本跑不通的场景。在对抗性红队测试上——奖励信号比数学和代码更稀疏、更嘈杂——前作完全无法收敛、产不出可用模型,而本文方法稳定训练,并在两个基准上都取得最高的平均攻击成功率(82.5% 与 79.5%),超过此前的最佳方法。

混合专家架构是更硬的压力测试。前作在所有基准上全部发散。本文方法在 30B 规模上(仅 3B 激活参数)拿到 1999 分的编程成绩,随后不加任何修改地直接搬到 235B 上——参数量涨了 7.8 倍,训练依然全程稳定。值得一提的是,由于显卡受限,这次只训练了 30 步,而对照方法训了 100 步,用约三分之一的步数仍然更优,而且停下来时性能尚未见顶。

⑤ 讨论(这些发现说明什么?)

作者对失败根因的解释非常有说服力,他们称之为学习周期的错配。

这里存在一个根本的不对称:策略网络是从一个预训练好的检查点出发的,几十亿参数里已经装着从数万亿词元中学到的语言与数学先验,后训练只需要在这个强先验上做适度微调,通常只跑几百步梯度更新。而那个辅助部件是从零随机初始化的,却要在同样短的窗口里从头学会一个复杂的、随题目变化的量。

结果就是:在训练的大部分时间里,它实际上只是题目的一个随机函数。于是整个目标函数被方差而不是被奖励信号主导。这也解释了为什么把它换成噪声毫无影响——它本来就在充当噪声。

作者还用一个合成实验坐实了这一点:构造一个由三个高斯分布混合成的目标,前作方法与它的随机版本表现几乎一模一样,都产出接近均匀的样本,未能捕捉多峰结构。由于这个实验只有一百维,说明失败不能简单归咎于规模。

另外有一组数字直接回应了这条技术路线最初的动机——多样性。在同一设定下,两种奖励最大化方法的多样性分别是 1.21 和 1.15,前作是 2.64,而本文方法达到 3.93。换句话说,去掉那个不稳定的部件之后,分布匹配这条路线原本承诺的好处才真正兑现出来。

⑥ 结论(最终结论 + 启示)

这项工作的价值不在于加了什么,而在于证明了可以拿掉什么。

它把一个被认为在理论上必要的部件识别为不稳定的根源,用一个从现有采样中免费得到的估计量替代,从而在保留分布匹配语义的同时,让梯度尺度回到与主流方法同一量级,并且移除了辅助网络及其在分布式训练中的优化器状态与同步开销。整套算法几乎沿用主流方法的基础设施。

结果是,这条路线第一次覆盖了两类方法各自能跑通的场景的并集:在数学和代码上不输甚至更好,在前作发散的嘈杂奖励场景里仍然稳定。

作者据此判断,这个精简后的估计量移除的是一个根本性的扩展瓶颈——证据是同一套配方原封不动地从 30B 迁移到 235B 就能生效。就目前所知,这是第一个在稠密与稀疏两类架构上都能稳定扩展的同类算法。

关于超参数,作者报告调节目标分布锐度的那个参数呈现倒 U 形,在中间取值时最好,但在整个测试范围内的波动很小,说明方法对它并不敏感。代码将开源。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

强化学习已成为当代大语言模型后训练的定义性范式:o1、o3、DeepSeek-R1、Gemini 等最强推理系统均以 RL 为后训练管线的核心组件,该阶段的有效性直接决定模型在数学推理、竞赛编程、科学问题求解与智能体决策上的表现。随着模型规模扩大、推理链变长,RL 算法的选择已成为一阶架构决策

然而主流方法(PPO、GRPO、OMD 及其变体)在本质上都是奖励最大化的:它们把概率质量集中到高奖励模式上,常常压缩解的多样性。在思维链推理中,多条有效解路径对泛化与稳健性至关重要,这构成一项结构性局限。现有缓解手段(熵奖励、自适应裁剪、词元级探索)把多样性当作事后的正则项处理,而核心的奖励最大化目标未被触动

生成流网络(GFlowNets)提供了根本不同的范式:不最大化期望奖励,而是学习按轨迹奖励成比例采样的策略。用于 LLM 后训练时,这一分布匹配视角直接针对模式塌缩,鼓励覆盖全部高奖励推理路径而非集中于其一。FOR 与 FlowRL 是把该思想引入 LLM 推理的最早工作,二者均采用轨迹平衡(TB)目标并学习一个对配分函数 Z_φ(x) 的近似(FlowRL 用提示最终隐状态上的三层 MLP,FOR 用一个跨提示共享的标量)。

扩展难题:即便在稠密骨干上,训练也须在短优化周期、长推理 rollout、大预训练策略与紧张的分布式预算下进行。此时与策略联合训练一个新初始化的配分模型随规模增长而愈发脆弱——梯度尖峰更频繁,辅助模块带来优化器与同步开销,且这个学得的归一化器始终落后于远比它庞大的预训练策略。MoE 路由的非确定性与采样-训练之间的隐式离策略失配会进一步放大问题,但作者明确指出:MoE 应被视为一个更普遍的扩展瓶颈的最严苛压力测试,而非病根本身

I. Theoretical Framework & Hypotheses(理论框架与假设)

把思维链推理形式化为条件生成任务:给定提示 x,策略 π_θ(y|x) 自回归生成含中间推理与最终答案的回答 y,验证器给出标量奖励 r(x,y)(数学为二元正确性,代码为单元测试通过率)。

范式目标后果
奖励最大化(PPO / GRPO)J_RM(θ) = E_{x~D, y~π_θ}[ r(x,y) ]把概率质量集中到回答分布的单一最高奖励模式,导致模式塌缩与解多样性下降
奖励分布匹配(GFlowNet)目标分布 p*(y|x) = exp(β·r(x,y)) / Z(x),其中 Z(x) = Σ_y exp(β·r(x,y))最小化反向 KL D_KL(π_θ ‖ p*) 鼓励策略按比例覆盖全部高奖励模式;β 为控制分布锐度的逆温度

由于 Z(x) 不可解,直接最小化该 KL 不可行,遂有强制同一不动点、并把 Z 作为副产品学习的替代目标。轨迹平衡(TB)损失为:

L_TB(θ, φ; x, y) = ( log Z_φ(x) + log[ π_θ(y|x) / π_ref(y|x) ] − β·r(x,y) )²

本文的核心理论洞察:检视 TB 损失可知,在最优处,对 p* 支撑集中的每一个 ylog Z(x) 都等于 β·r(x,y) + log π_ref(y|x) − log π_θ(y|x)。既然每条轨迹都给出同一个隐式目标,那么它就可以从已有的 rollout 组中被直接估计,而无需学习。这一思路承接 Zhang et al. (2023) 的对数配分方差损失,但作者的处理不同:后者最小化共享条件的轨迹间目标方差(作者在附录中报告该损失在本设定下相对骨干几无改善),本文改取其批内均值,作为一个停梯度基线直接接入策略梯度更新——这与 LLM 后训练中 rollout 组本就是计算单元的事实天然契合。

M. Materials & Methods(材料与方法)

R. Results(结果)

1. 诊断结果(Qwen2.5-7B,六项数学基准均值)

方法梯度范数 最小最大均值中位数标准差爆炸步数(≥10⁶)
FlowRL1.58×10²9.59×10¹⁶3.23×10¹⁴1.14×10³4.89×10¹⁵55 / 421
GRPO1.68×10⁻¹5.900.2380.1990.3370
GFlowRL3.11×10⁻²6.180.06980.0430.3080

2. 稠密模型 · 数学(Qwen2.5-7B,Avg@16)

方法AIME24AIME25AMC23MATH500MinervaOlympiad平均
骨干4.382.0830.7854.4722.3824.0323.02
REINFORCE++11.045.4166.7154.2524.3727.3331.52
PPO9.387.2963.4357.9826.5327.2531.98
GRPO13.549.7964.5357.0523.0626.8832.48
FlowRL15.4110.8354.5366.9631.4134.6135.63
FlowRL-RandomLogZ12.089.3862.6669.4426.2937.3036.19
GFlowRL17.299.7967.6676.8933.6240.2540.92

较 GRPO +8.44,较 FlowRL +5.29

3. 稠密模型 · 代码(DeepSeek-R1-Distill-Qwen-7B)

方法LiveCodeBench Avg@16Pass@16Codeforces Rating百分位HumanEval+
骨干30.6849.46886.6819.4%80.90
GRPO32.7552.321313.8267.1%80.13
FlowRL37.4356.271549.4783.3%83.28
GFlowRL38.6258.061646.2188.0%84.93

两种 GFlowNet 式方法相对 GRPO 在 Codeforces 上拉开 200-330 Elo 的优势;在二者都收敛的每一项基准上,GFlowRL 均超过 FlowRL。

4. 14B 规模与前沿模型对照:GFlowRL 达 2048 Codeforces Elo,超 DeepCoder-14B +112(此前该规模的开源 SOTA,且是带针对性改进的强 GRPO 配方)、超 FlowRL-14B +144、超 OpenAI o1(1891)+157距 o3-mini(2073)仅差 25 分——此前该区间仅由闭源前沿系统触及。

5. 对抗性红队(奖励更稀疏、更嘈杂;ASR@1)——FlowRL 无法收敛,产不出可用的攻击模型;GFlowRL 稳定训练:

攻击方 / 受害模型AdvBenchHarmBench
Qwen2.5-3BLlama-3.1-8BGPT-4.1-mini均值Qwen2.5-3BLlama-3.1-8BGPT-4.1-mini均值
X-Teaming39.424.244.236.045.322.044.737.3
SEMA(此前 SOTA)79.977.283.380.174.570.679.875.0
GFlowRL80.281.286.182.579.973.085.579.5

较 SEMA 分别 +2.4+4.5 点。作者的结论是:移除高方差的 log Z_φ 恢复了稳定优化,把数学 / 代码上的持平变成严格的能力优势——GFlowRL 覆盖了 GFlowNet 式与 GRPO/PPO 式训练各自可行任务的并集

6. MoE 扩展(32K 最大回答长度)——FlowRL 在两个骨干的所有基准上全部发散,产不出可用检查点,作者归因于稀疏路由下其辅助配分网络的不稳定:

骨干 / 方法AIME24AIME25AMC23MATH500MinervaOlympiad平均
Qwen3-30B-A3B 骨干80.8368.3392.5088.5043.4173.5774.52
+ GRPO80.2071.0095.6389.1842.5376.1575.78
+ GFlowRL81.8871.0497.9793.2945.5980.1478.32
Qwen3-235B-A22B 骨干84.5879.1795.7895.6749.8682.7081.29
+ GRPO84.8080.2098.7596.3350.4883.8482.40
+ GFlowRL85.2180.6399.6998.3651.1385.0683.35

7. 消融(Qwen2.5-7B,100 步):逆温度 β ∈ {1, 5, 8, 10, 15} 下平均准确率呈倒 U 形,在 β = 8 时达到峰值 38.2,全范围内波动在 0.5 点以内,说明方法对该超参数不敏感。多样性指标:GRPO 1.21、PPO 1.15、FlowRL 2.64、GFlowRL 3.93——分布匹配路线所承诺的多样性收益,在移除不稳定项后才充分兑现。

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((分布匹配式强化学习的扩展))
    I 引言
      顶级推理模型都靠后训练强化学习
      主流方法本质都在最大化奖励
      奖励最大化导致模式塌缩
      思维链需要保留多条解法
      熵奖励只是事后贴的正则项
      生成流网络改为按奖励比例采样
    R 问题
      这条路一到大模型就撑不住
      辅助网络成了不稳定的来源
      那个部件到底是不是必要
      先诊断再动手术
    M 方法
      把它换成纯高斯噪声试试
      对比梯度范数的统计量
      再用三高斯合成靶验证
      最优点处它等于可算的表达式
      直接用现成rollout组取批内均值
      以停梯度方式充当基线
      按回答长度做归一化
      非对称裁剪流间隙
      重要性采样修正策略漂移
      无需额外参数与跨模块同步
    R 结果
      换成噪声后性能不降反升
      前作梯度均值高达十的十四次方
      四百二十一步里五十五步爆炸
      七B数学平均分达40.92
      十四B在Codeforces拿到2048
      距离o3-mini仅差二十五分
      红队场景前作完全无法收敛
      本文取得82.5与79.5的成功率
      混合专家上前作全部发散
      三十B仅三B激活拿到1999
      两百三十五B原样迁移仍稳定
      多样性由2.64提升到3.93
    a 讨论
      根因是学习周期严重错配
      策略有强先验它却从零学起
      大部分时间它只是随机函数
      合成实验证明不能归咎规模
      混合专家只是放大器不是病根
    D 结论
      价值在于证明可以拿掉什么
      覆盖两类方法可行场景的并集
      移除的是根本性扩展瓶颈
      两百三十五B仅训三十步待验证

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。