AI-Workshop 文献分享 #8 -- GRPO 与 PPO 算法深度对比:从原理到选型
分享人:ltw | 日期:2026-07-04
主题:GRPO 与 PPO 算法深度研究报告
一、核心结论
PPO 是通用、成熟的 Actor-Critic 策略优化范式;GRPO 是面向可批量采样、可比较奖励的语言模型任务,用组内相对回报替代 Critic 的轻量化方案。
二者解决的问题不同,不能只按新旧或显存单一指标替代选型。
二、从策略梯度到 PPO、GRPO
技术演进逻辑
| 阶段 | 核心问题 | 代表做法 |
|---|---|---|
| REINFORCE | 无偏但方差高 | 用完整回报直接加权 log probability |
| TRPO | 限制策略突变 | 用 KL 约束,二阶优化复杂 |
| PPO(2017) | 简单工程实现近端更新 | 裁剪概率比值,支持多轮 minibatch 更新 |
| GRPO(2024) | LLM 后训练中 Critic 开销高 | 同 prompt 多采样,用组内相对奖励构造优势 |
PPO 与 GRPO 的共性是都对旧策略采集的数据做受约束的策略更新。主要分歧在于优势信号从何而来。
三、PPO:稳定优先的通用范式
核心机制
Actor 负责产生动作;Critic 预测从当前状态出发的预期长期回报。优势为正表示实际结果优于 Critic 预测,为负则相反。
PPO-Clip 目标:
令旧策略为 pi_old,当前策略为 pi,概率比 r_t(theta) = pi(a_t|s_t) / pi_old(a_t|s_t)
L_CLIP = E[ min( r_t * A_t, clip(r_t, 1-eps, 1+eps) * A_t ) ]
- A_t > 0 时提高该动作概率,但超 1+eps 后不再增益
- A_t < 0 时降低该动作概率,但低于 1-eps 后不再增益
GAE 优势估计使用 TD 残差,通过 lambda 参数在偏差与方差间权衡。
典型损失
L = -L_CLIP + c_v * L_VF - c_e * H + beta * KL(pi || pi_ref)
四、GRPO:用组内相对回报替代 Critic
核心机制
对每个 prompt q,从旧策略采样 G 个输出,用奖励函数获得 r_1...r_G。组归一化优势:
A_i = (r_i - mean(r_1:G)) / (std(r_1:G) + delta)
同一道题中比同组答案更好的答案得到正强化,较差答案得到负强化。
需要澄清的细节
- GRPO 不使用 Critic,不代表没有奖励模型
- 组是按同一 prompt 划分的,不是任意混合
- 零方差组没有学习方向
- 不同框架的 GRPO 细节并不完全一致
优点与风险
适配优势:去掉 Critic 降低显存与工程复杂度;组内基线天然消除 prompt 难度差异
主要风险:每题采样 G 个输出加大生成成本;奖励稀疏时训练信号弱;组内相对排名不保证绝对质量提升
五、工程架构对比
| 模块 | PPO Trainer | GRPO Trainer |
|---|---|---|
| 采样器 | 采集轨迹,保存旧 logprob | 每 prompt 生成 G 条 completion |
| 策略模型 | Actor | Policy |
| 价值模型 | Critic 或 value head | 不需要 |
| 奖励层 | 环境奖励 / Reward Model | Reward Model / 规则验证器 |
| 优势模块 | 回报 + Critic + GAE | 同组 reward 中心化或标准化 |
| 约束模块 | clip、KL、熵、value clipping | clip、KL,通常无 value loss |
六、PPO 典型场景
- 机器人与连续控制:动作连续、奖励沿时间展开
- 游戏与仿真控制:可高频交互、易并行采样
- 早期 RLHF:InstructGPT 等经典管线
七、GRPO 典型场景
- 数学推理:答案可通过解析器或规则验证
- 代码生成:运行单元测试自动获得奖励
- 格式化与工具调用:存在严格 schema 或可验证中间状态
不宜直接套用 GRPO 的情形
- 每次生成昂贵且无法批量并行
- 每题只能采样极少答案,组内奖励几乎恒定
- 奖励仅来自噪声很大的偏好模型
- 核心难点是长时序信用分配或连续控制
八、选型决策树
任务是否为长时序交互、连续控制或需逐状态信用分配?
- 是:优先 PPO
- 否:能否对同一输入并行生成多条完整候选并得到可靠奖励?
- 否:优先 PPO / 偏好优化方法
- 是:组内奖励是否有足够区分度?
- 是:优先评估 GRPO
- 否:降低 G、改进奖励粒度,或回到 PPO
九、总结
- PPO:通用、成熟,优势估计依赖 Critic/GAE,适合通用交互式强化学习
- GRPO:将多候选奖励转化为相对优势,去除 Critic,适合可验证推理任务
- 两者共享受约束策略更新的骨架,但数据结构、优势来源和失败模式不同
- 最可信的选型来自统一预算、统一奖励和多随机种子的实验
参考文献
- Schulman et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
- Schulman et al. High-Dimensional Continuous Control Using GAE. ICLR, 2016.
- Ouyang et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS, 2022.
- Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning. arXiv:2402.03300, 2024.
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL. arXiv:2501.12948, 2025.