- 对一个提示采样 $K$ 个响应,它们就构成了一个小小的概率单纯形。在这个单纯形上,所有基于组的策略梯度都在隐式地瞄准一个奖励加权的 softmax 分布 $w^* = \mathrm{softmax}(R/\tau)$,其中“温度” $\tau$ 就是优势归一化时所除的那个量。
- 常规的策略梯度更新只是朝该目标做反向 KL 投影的一阶近似,一旦更新进入异策略(off-policy)状态就会产生偏差。
- LPO 把每次更新拆成两个干净的步骤:先以闭式解计算目标,再用任意选定的散度精确投影到目标上。由此得到的梯度有界、零和且能自我校正,并且不增加任何计算开销。
- 在逻辑、数学、代码和多模态几何任务上(1.5B–14B 模型,4 个大模型家族),LPO 在绝大多数设置中都超过了与之匹配的策略梯度基线,同时保持更高的熵和更低的梯度范数。
1 · 一组答案,就是一个小宇宙
标准的 RLVR 流程是这样的:给模型一道数学题,采样 $K=8$ 次作答,由验证器判定每个答案的对错,再把模型往好答案的方向推一推。GRPO 用组内相对优势来完成这一推:减去组内平均奖励,再除以组内标准差。
现在换个视角。不再孤立地看每个响应,而是问:在这八个响应之中,当前策略相对于采样它们的那个策略,更偏好哪一个?这就给出了组上的一个分布:
$$P_{\theta,k} \;=\; \mathrm{softmax}(s_\theta)_k,\qquad s_{\theta,k} = \log\frac{\pi_\theta(y_k\mid x)}{\pi_b(y_k\mid x)}.$$在任何更新之前,$\pi_\theta=\pi_b$,这个分布就是均匀分布,每个响应各占 $1/K$。随着训练推动策略变化,$P_\theta$ 在一个 $(K-1)$ 维单纯形上移动,这就是响应单纯形。整个故事都发生在这个有限的小空间里。
2 · 那个从没被写下来的目标
第一个结论:任取一个零均值的优势向量 $A$,定义 $w^* = \mathrm{softmax}(A)$。那么在同策略(on-policy)点上,
$$\underbrace{\tfrac{1}{K}\textstyle\sum_k A_k\,\nabla_\theta \log\pi_\theta(y_k\mid x)}_{\text{你一直在用的策略梯度}} \;=\; -\nabla_\theta\, D_{\mathrm{KL}}\!\left(P_\theta \,\|\, w^*\right).$$……但只在同策略点上严格成立。误差会随异策略漂移而增大。
由于优势的形式都是 $(R_k-\mu)/\tau$,而 softmax 对平移 $\mu$ 不敏感,所以隐藏目标总是 $\mathrm{softmax}(R/\tau)$。纸面上看似不同的方法,其实瞄准的是同一族目标,区别仅在于目标有多“尖锐”:
| 方法 | 优势 | 隐式目标 | 温度 τ |
|---|---|---|---|
| GRPO / DAPO | $(R_k-\mu_G)/\sigma_G$ | $\mathrm{softmax}(R/\sigma_G)$ | 组内标准差 $\sigma_G$ |
| Dr.GRPO / RLOO | $R_k-\mu_G$ | $\mathrm{softmax}(R)$ | ≈ 1 |
| MaxRL | $(R_k-\mu_G)/\mu_G$ | $\mathrm{softmax}(R/\mu_G)$ | 成功率 $\mu_G$ |
点击响应,将其标记为正确 ✓ 或错误 ✗,再切换归一化方式。柱状图显示每种方法的隐藏目标在各个响应上分配了多少概率。
玩一玩就会发现一个有趣的现象。MaxRL 的目标在难题上会变得极其尖锐:八次里只侥幸成功一次时,τ = 1/8,这个成功响应的权重约是每个失败响应的 3000 倍;而在简单题上,这个倍数会降到约 3 倍。GRPO 则是对称的:它的目标在正确率五五开时最平缓(此时 σ 最大),越往两端越尖锐。归一化方式不只是一个降方差的技巧,它决定了你瞄准哪里。
3 · 从“大致瞄准”到“精确命中”:LPO
经典的“强化学习即推断”方法(REPS、MPO、AWR)同样会构造一个奖励加权的目标,再把策略推向它;但在连续动作空间里,它们处处都得做近似。大模型的 RLVR 恰好有一份结构上的“礼物”:采样得到的响应构成一个有限单纯形,目标和投影都可以用闭式解求出。LPO 正是这样做的,分为两个解耦的步骤:
瞄准什么
在单纯形上最大化期望奖励,并用围绕当前策略的 KL 信赖域加以约束:
$$\max_{w\in\Delta^{K-1}} \textstyle\sum_k w_k R_k - \tau\, D_{\mathrm{KL}}(w\|P_t)$$它有唯一的闭式解,即列表式 Gibbs 目标:
$$w^*_k = \mathrm{softmax}\!\left(\tfrac{R_k}{\tau} + s_{t,k}\right)$$如何抵达
最小化目标与列表式策略之间的某种散度。无论选哪种散度,梯度都形如 $\nabla = \sum_k c_k \nabla_\theta\log\pi_\theta(y_k|x)$:
LPOfwd · $D_{\mathrm{KL}}(w^*\|P_\theta)$
$c_k = P_{\theta,k} - w^*_k$
LPOrev · $D_{\mathrm{KL}}(P_\theta\|w^*)$
$c_k = P_{\theta,k}(d_k-\bar d),\ \ d_k = s_{\theta,k}-\phi_k$
由此立刻得到两点好处。在同策略点上,第一步恰好复现了上表中的隐藏目标,只不过现在 $\tau$ 有了真实的含义(信赖域的强度),而不再是归一化的副产品。另外,由于目标和投影被分开,散度本身成了一个设计旋钮,这是策略梯度从未提供过的。
三个采样响应。每个顶点代表“全部概率都在该响应上”,中心代表尚未更新的策略。我们在同一批样本上做多次内部更新(类似 PPO 的多个 epoch),这正是异策略漂移出现的地方。玩具模型:每个响应的对数概率都是自由参数;策略梯度使用不裁剪的重要性比率。
为什么精确投影表现这么好
零和
系数之和为 0:推高一个响应,就会自动压低其他响应。无论选择哪种散度,都自带一个控制变量。
有界
对 LPOfwd 而言,$|c_k|\le 1$ 且 $\sum_k|c_k|\le 2$,与奖励尺度无关。一边倒的组也不会引发爆炸式更新。
自校正
当 $P_\theta\to w^*$ 时系数趋于零。更新自己知道何时已经到达,而不必依赖裁剪来刹车。
此外,反复执行“先定目标、再做投影”可以带来单调改进保证:每轮迭代中,列表式奖励至少提升 $\tau$ 乘以旧策略与目标之间的 Jeffreys 散度,再减去一项不完美投影带来的误差。两种 KL 也各有个性。前向 KL 具有模式覆盖特性:目标所看重的任何响应都能获得有保证的概率下界,相当于一道防止坍缩的对数屏障。反向 KL 则暗含一个熵奖励:它可以分解为目标 logit 的期望加上 $H(P_\theta)$。
4 · 效果如何?
比较设置刻意做得很严格。对每个基线(GRPO、Dr.GRPO、MaxRL),LPO 都使用与该基线隐式目标完全相同的温度。唯一变化的是投影方式,因此任何差异都只能归因于精确的列表式投影,而非调参。任务包括 Countdown(逻辑)、MATH(数学)、PRIME(代码)和 Geometry3k(视觉-语言),模型包括 Qwen3 1.7B/4B/8B/14B、Qwen2.5-VL-3B,并在 DeepSeek-R1-Distill、Llama-3.1 和 Mistral 上做了跨家族验证。
Pass@1 为全部六个基准(AIME24/25、AMC23、MATH500、Minerva、OlympiadBench)的平均;Pass@k 为其中 k>1 的四个基准的平均。每组比较一个策略梯度基线及与其温度匹配的 LPO 变体。坐标轴经过截断以便看清差异。并非每一格都是 LPO 胜出:在 Qwen3-8B 上,Dr.GRPO 自身的 Pass@k 仍然最高。
- 多样性得以保留。在整个训练过程中,两个 LPO 变体的响应熵都高于策略梯度基线。这正是对 RLVR 中常见的熵坍缩问题的直接解药,也是 Pass@k 提升如此稳健的原因。
- 训练更平稳。梯度范数比策略梯度更低、更稳定,这与有界、自校正系数的理论预测完全一致。
- 前向与反向 KL 各有个性。两者正面对比时,LPOfwd 在 13/15 的设置中的 Pass@k 高于 LPOrev,这得益于其模式覆盖特性,能让更多有效的解题路径保持活跃。LPO 的响应也比策略梯度更长,其中 LPOfwd 的响应最长。
- 小组收益最大。在 $K\in\{2,4,8,16,32\}$ 范围内,组越小,提升越明显,因为此时噪声较大的优势估计对策略梯度的伤害最大。
- 理论得到验证。在严格同策略的设置下(每批数据只更新一次),LPOrev 与 GRPO 的训练曲线几乎完全重合,正如等价性结论所预测的那样。差距在更新进入异策略状态后才会拉开;即便在这个同策略设置中,LPOfwd 在训练早期的样本效率也更高,最终 Pass@k 也更好。
5 · 更大的图景
用这个视角重新审视,许多 RLVR 的设计争论都会被重新梳理。关于如何归一化优势的争论,变成了关于瞄准哪个目标的讨论;裁剪与信赖域,则变成了如何投影的问题。把两者分开,就打开了一片此前被隐藏的设计空间:
- 任意散度。零和梯度对单纯形上任何可微散度都成立,因此 Jensen–Shannon 散度等其他 f-散度都可以一试,也可以做调度(早期用前向 KL 鼓励探索、后期切换到反向 KL 稳定利用,或逐步退火 τ)。
- DPO 是 K=2 的特例。只有两个响应时,LPOfwd 退化为带有软标签(由 τ 控制)的二元交叉熵,相当于 DPO 的一个在线、带信赖域的“近亲”。而当 $K\to\infty$ 时,则恢复为经典的 KL 正则化强化学习。
- 即插即用。DAPO 的动态采样、非对称裁剪等工程技巧与 LPO 相互正交,可以直接叠加使用。论文有意采用最精简的共享流程,以便把收益清楚地归因于投影本身。
- 下一步。面向多轮智能体和过程奖励的步级列表式投影,以及异策略经验回放(此时列表式归一化相当于自归一化重要性采样)。
LPO 只是不再近似。
引用
@article{qu2026lpo,
title = {Listwise Policy Optimization: Group-based RLVR as
Target-Projection on the LLM Response Simplex},
author = {Qu, Yun and Wang, Qi and Mao, Yixiu and Zou, Heming and
Jiang, Yuhang and Li, Yingyue and Xu, Wutong and Cai, Lizhou and
Liu, Weijie and Bai, Clive and Yang, Kai and Chen, Yangkun and
Yang, Saiyong and Ji, Xiangyang},
journal = {arXiv preprint arXiv:2605.06139},
year = {2026}
}