研究博客 · 面向大模型推理的强化学习

NIPS26 LPO: 你的 GRPO 更新,其实一直在悄悄追逐一个目标。
LPO 直接瞄准它。

基于组的 RLVR 方法(GRPO、Dr.GRPO、MaxRL 等)看起来只是在优势归一化上做文章。但在底层,它们共享同一个几何动作:在采样得到的一组响应上构造一个目标分布,再朝它迈出一阶近似的一步。列表式策略优化(Listwise Policy Optimization, LPO)把这个动作变得显式而精确。

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji
清华大学自动化系 · 腾讯大模型部 · arXiv,2026 年 5 月
一句话总结

1 · 一组答案,就是一个小宇宙

标准的 RLVR 流程是这样的:给模型一道数学题,采样 $K=8$ 次作答,由验证器判定每个答案的对错,再把模型往好答案的方向推一推。GRPO 用组内相对优势来完成这一推:减去组内平均奖励,再除以组内标准差。

现在换个视角。不再孤立地看每个响应,而是问:在这八个响应之中,当前策略相对于采样它们的那个策略,更偏好哪一个?这就给出了组上的一个分布:

$$P_{\theta,k} \;=\; \mathrm{softmax}(s_\theta)_k,\qquad s_{\theta,k} = \log\frac{\pi_\theta(y_k\mid x)}{\pi_b(y_k\mid x)}.$$

在任何更新之前,$\pi_\theta=\pi_b$,这个分布就是均匀分布,每个响应各占 $1/K$。随着训练推动策略变化,$P_\theta$ 在一个 $(K-1)$ 维单纯形上移动,这就是响应单纯形。整个故事都发生在这个有限的小空间里。

2 · 那个从没被写下来的目标

第一个结论:任取一个零均值的优势向量 $A$,定义 $w^* = \mathrm{softmax}(A)$。那么在同策略(on-policy)点上,

$$\underbrace{\tfrac{1}{K}\textstyle\sum_k A_k\,\nabla_\theta \log\pi_\theta(y_k\mid x)}_{\text{你一直在用的策略梯度}} \;=\; -\nabla_\theta\, D_{\mathrm{KL}}\!\left(P_\theta \,\|\, w^*\right).$$
一步策略梯度,就是朝一个隐藏目标做反向 KL 的一步梯度下降。
……但只在同策略点上严格成立。误差会随异策略漂移而增大。

由于优势的形式都是 $(R_k-\mu)/\tau$,而 softmax 对平移 $\mu$ 不敏感,所以隐藏目标总是 $\mathrm{softmax}(R/\tau)$。纸面上看似不同的方法,其实瞄准的是同一族目标,区别仅在于目标有多“尖锐”:

方法优势隐式目标温度 τ
GRPO / DAPO$(R_k-\mu_G)/\sigma_G$$\mathrm{softmax}(R/\sigma_G)$组内标准差 $\sigma_G$
Dr.GRPO / RLOO$R_k-\mu_G$$\mathrm{softmax}(R)$≈ 1
MaxRL$(R_k-\mu_G)/\mu_G$$\mathrm{softmax}(R/\mu_G)$成功率 $\mu_G$
▶ 动手试试:认识隐藏目标

点击响应,将其标记为正确 ✓ 或错误 ✗,再切换归一化方式。柱状图显示每种方法的隐藏目标在各个响应上分配了多少概率。

均匀 1/K

玩一玩就会发现一个有趣的现象。MaxRL 的目标在难题上会变得极其尖锐:八次里只侥幸成功一次时,τ = 1/8,这个成功响应的权重约是每个失败响应的 3000 倍;而在简单题上,这个倍数会降到约 3 倍。GRPO 则是对称的:它的目标在正确率五五开时最平缓(此时 σ 最大),越往两端越尖锐。归一化方式不只是一个降方差的技巧,它决定了你瞄准哪里。

3 · 从“大致瞄准”到“精确命中”:LPO

经典的“强化学习即推断”方法(REPS、MPO、AWR)同样会构造一个奖励加权的目标,再把策略推向它;但在连续动作空间里,它们处处都得做近似。大模型的 RLVR 恰好有一份结构上的“礼物”:采样得到的响应构成一个有限单纯形,目标和投影都可以用闭式解求出。LPO 正是这样做的,分为两个解耦的步骤:

第一步 · 目标

瞄准什么

在单纯形上最大化期望奖励,并用围绕当前策略的 KL 信赖域加以约束:

$$\max_{w\in\Delta^{K-1}} \textstyle\sum_k w_k R_k - \tau\, D_{\mathrm{KL}}(w\|P_t)$$

它有唯一的闭式解,即列表式 Gibbs 目标:

$$w^*_k = \mathrm{softmax}\!\left(\tfrac{R_k}{\tau} + s_{t,k}\right)$$
第二步 · 投影

如何抵达

最小化目标与列表式策略之间的某种散度。无论选哪种散度,梯度都形如 $\nabla = \sum_k c_k \nabla_\theta\log\pi_\theta(y_k|x)$:

LPOfwd · $D_{\mathrm{KL}}(w^*\|P_\theta)$
$c_k = P_{\theta,k} - w^*_k$

LPOrev · $D_{\mathrm{KL}}(P_\theta\|w^*)$
$c_k = P_{\theta,k}(d_k-\bar d),\ \ d_k = s_{\theta,k}-\phi_k$

由此立刻得到两点好处。在同策略点上,第一步恰好复现了上表中的隐藏目标,只不过现在 $\tau$ 有了真实的含义(信赖域的强度),而不再是归一化的副产品。另外,由于目标和投影被分开,散度本身成了一个设计旋钮,这是策略梯度从未提供过的。

▶ 动手试试:在三响应单纯形上奔向目标

三个采样响应。每个顶点代表“全部概率都在该响应上”,中心代表尚未更新的策略。我们在同一批样本上做多次内部更新(类似 PPO 的多个 epoch),这正是异策略漂移出现的地方。玩具模型:每个响应的对数概率都是自由参数;策略梯度使用不裁剪的重要性比率。

策略梯度 LPOfwd LPOrev ★ 目标 $w^*$
奖励(点击循环切换 0 → 0.5 → 1)
第 0 轮迭代
点击运行一轮迭代。注意灰色路径的第一步恰好落在黄色路径的第一步上:在同策略点上,策略梯度就是反向 KL 投影。此后策略梯度的步长从不缩小(重要性比率甚至会放大它),于是它直接冲过星标,一路冲进顶点。策略梯度的 E[R] = 1.00 看起来很漂亮,但它是靠把全部概率押在三个响应中的一个上、无视信赖域换来的。在真实的大模型里,这正是裁剪机制需要对抗的那种过度自信、导致熵坍缩的更新。LPO 的路径则会逐渐减速,并恰好停在目标上。多运行几轮,就能看到 LPO 一步一个脚印、稳稳地爬向最优响应。

为什么精确投影表现这么好

⚖️

零和

系数之和为 0:推高一个响应,就会自动压低其他响应。无论选择哪种散度,都自带一个控制变量。

📏

有界

对 LPOfwd 而言,$|c_k|\le 1$ 且 $\sum_k|c_k|\le 2$,与奖励尺度无关。一边倒的组也不会引发爆炸式更新。

🎯

自校正

当 $P_\theta\to w^*$ 时系数趋于零。更新自己知道何时已经到达,而不必依赖裁剪来刹车。

此外,反复执行“先定目标、再做投影”可以带来单调改进保证:每轮迭代中,列表式奖励至少提升 $\tau$ 乘以旧策略与目标之间的 Jeffreys 散度,再减去一项不完美投影带来的误差。两种 KL 也各有个性。前向 KL 具有模式覆盖特性:目标所看重的任何响应都能获得有保证的概率下界,相当于一道防止坍缩的对数屏障。反向 KL 则暗含一个熵奖励:它可以分解为目标 logit 的期望加上 $H(P_\theta)$。

“列表式”真的是关键吗?作者做了消融:保持目标不变,但改用加权对数似然逐点拟合(MPO/AWR 的做法)。结果性能大幅下降,优化变得不稳定。在逐点损失中,每个响应都被往上推,只是力度不同,而且这种推力永远不会停止:响应之间没有竞争,也没有内置的控制变量。只有把精确的目标拟合与列表式归一化结合起来,才能真正带来收益。

4 · 效果如何?

比较设置刻意做得很严格。对每个基线(GRPO、Dr.GRPO、MaxRL),LPO 都使用与该基线隐式目标完全相同的温度。唯一变化的是投影方式,因此任何差异都只能归因于精确的列表式投影,而非调参。任务包括 Countdown(逻辑)、MATH(数学)、PRIME(代码)和 Geometry3k(视觉-语言),模型包括 Qwen3 1.7B/4B/8B/14B、Qwen2.5-VL-3B,并在 DeepSeek-R1-Distill、Llama-3.1 和 Mistral 上做了跨家族验证。

13/15
两个 LPO 变体各自在 Pass@1 训练曲线上超过匹配基线的设置数
15/15
LPOfwd 在 Pass@k 上超过策略梯度基线的设置数(LPOrev:11/15)
~70
LPOfwd 追平 GRPO 200 步峰值所需的步数(Qwen3-14B,Polaris)
0
额外计算开销:相同的采样、相同的流程,只改变损失系数
数学基准最终得分

Pass@1 为全部六个基准(AIME24/25、AMC23、MATH500、Minerva、OlympiadBench)的平均;Pass@k 为其中 k>1 的四个基准的平均。每组比较一个策略梯度基线及与其温度匹配的 LPO 变体。坐标轴经过截断以便看清差异。并非每一格都是 LPO 胜出:在 Qwen3-8B 上,Dr.GRPO 自身的 Pass@k 仍然最高。

5 · 更大的图景

用这个视角重新审视,许多 RLVR 的设计争论都会被重新梳理。关于如何归一化优势的争论,变成了关于瞄准哪个目标的讨论;裁剪与信赖域,则变成了如何投影的问题。把两者分开,就打开了一片此前被隐藏的设计空间:

基于组的强化学习,本来就是“先定目标、再做投影”。
LPO 只是不再近似。

引用

@article{qu2026lpo,
  title   = {Listwise Policy Optimization: Group-based RLVR as
             Target-Projection on the LLM Response Simplex},
  author  = {Qu, Yun and Wang, Qi and Mao, Yixiu and Zou, Heming and
             Jiang, Yuhang and Li, Yingyue and Xu, Wutong and Cai, Lizhou and
             Liu, Weijie and Bai, Clive and Yang, Kai and Chen, Yangkun and
             Yang, Saiyong and Ji, Xiangyang},
  journal = {arXiv preprint arXiv:2605.06139},
  year    = {2026}
}