AI-Workshop 文献分享 2026-07-04 21:30

AI-Workshop 文献分享 #8 — GRPO 与 PPO 算法深度对比:从原理到选型

ltw 深度对比 PPO 与 GRPO 算法——从策略梯度原理、Actor-Critic 架构到组内相对优势的计算差异,分析二者各自的适用场景、工程实现与选型决策。

AI-Workshop 文献分享 PPO GRPO 强化学习 RLHF

AI-Workshop 文献分享 #8 -- GRPO 与 PPO 算法深度对比:从原理到选型

分享人:ltw | 日期:2026-07-04

主题:GRPO 与 PPO 算法深度研究报告


一、核心结论

PPO 是通用、成熟的 Actor-Critic 策略优化范式;GRPO 是面向可批量采样、可比较奖励的语言模型任务,用组内相对回报替代 Critic 的轻量化方案。

二者解决的问题不同,不能只按新旧或显存单一指标替代选型。


二、从策略梯度到 PPO、GRPO

技术演进逻辑

阶段 核心问题 代表做法
REINFORCE 无偏但方差高 用完整回报直接加权 log probability
TRPO 限制策略突变 用 KL 约束,二阶优化复杂
PPO(2017) 简单工程实现近端更新 裁剪概率比值,支持多轮 minibatch 更新
GRPO(2024) LLM 后训练中 Critic 开销高 同 prompt 多采样,用组内相对奖励构造优势

PPO 与 GRPO 的共性是都对旧策略采集的数据做受约束的策略更新。主要分歧在于优势信号从何而来。


三、PPO:稳定优先的通用范式

核心机制

Actor 负责产生动作;Critic 预测从当前状态出发的预期长期回报。优势为正表示实际结果优于 Critic 预测,为负则相反。

PPO-Clip 目标

令旧策略为 pi_old,当前策略为 pi,概率比 r_t(theta) = pi(a_t|s_t) / pi_old(a_t|s_t)

L_CLIP = E[ min( r_t * A_t, clip(r_t, 1-eps, 1+eps) * A_t ) ]

  • A_t > 0 时提高该动作概率,但超 1+eps 后不再增益
  • A_t < 0 时降低该动作概率,但低于 1-eps 后不再增益

GAE 优势估计使用 TD 残差,通过 lambda 参数在偏差与方差间权衡。

典型损失

L = -L_CLIP + c_v * L_VF - c_e * H + beta * KL(pi || pi_ref)


四、GRPO:用组内相对回报替代 Critic

核心机制

对每个 prompt q,从旧策略采样 G 个输出,用奖励函数获得 r_1...r_G。组归一化优势:

A_i = (r_i - mean(r_1:G)) / (std(r_1:G) + delta)

同一道题中比同组答案更好的答案得到正强化,较差答案得到负强化。

需要澄清的细节

  1. GRPO 不使用 Critic,不代表没有奖励模型
  2. 组是按同一 prompt 划分的,不是任意混合
  3. 零方差组没有学习方向
  4. 不同框架的 GRPO 细节并不完全一致

优点与风险

适配优势:去掉 Critic 降低显存与工程复杂度;组内基线天然消除 prompt 难度差异

主要风险:每题采样 G 个输出加大生成成本;奖励稀疏时训练信号弱;组内相对排名不保证绝对质量提升


五、工程架构对比

模块 PPO Trainer GRPO Trainer
采样器 采集轨迹,保存旧 logprob 每 prompt 生成 G 条 completion
策略模型 Actor Policy
价值模型 Critic 或 value head 不需要
奖励层 环境奖励 / Reward Model Reward Model / 规则验证器
优势模块 回报 + Critic + GAE 同组 reward 中心化或标准化
约束模块 clip、KL、熵、value clipping clip、KL,通常无 value loss

六、PPO 典型场景

  • 机器人与连续控制:动作连续、奖励沿时间展开
  • 游戏与仿真控制:可高频交互、易并行采样
  • 早期 RLHF:InstructGPT 等经典管线

七、GRPO 典型场景

  • 数学推理:答案可通过解析器或规则验证
  • 代码生成:运行单元测试自动获得奖励
  • 格式化与工具调用:存在严格 schema 或可验证中间状态

不宜直接套用 GRPO 的情形

  • 每次生成昂贵且无法批量并行
  • 每题只能采样极少答案,组内奖励几乎恒定
  • 奖励仅来自噪声很大的偏好模型
  • 核心难点是长时序信用分配或连续控制

八、选型决策树

任务是否为长时序交互、连续控制或需逐状态信用分配?
- 是:优先 PPO
- 否:能否对同一输入并行生成多条完整候选并得到可靠奖励?
  - 否:优先 PPO / 偏好优化方法
  - 是:组内奖励是否有足够区分度?
    - 是:优先评估 GRPO
    - 否:降低 G、改进奖励粒度,或回到 PPO

九、总结

  1. PPO:通用、成熟,优势估计依赖 Critic/GAE,适合通用交互式强化学习
  2. GRPO:将多候选奖励转化为相对优势,去除 Critic,适合可验证推理任务
  3. 两者共享受约束策略更新的骨架,但数据结构、优势来源和失败模式不同
  4. 最可信的选型来自统一预算、统一奖励和多随机种子的实验

参考文献

  1. Schulman et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
  2. Schulman et al. High-Dimensional Continuous Control Using GAE. ICLR, 2016.
  3. Ouyang et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS, 2022.
  4. Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning. arXiv:2402.03300, 2024.
  5. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL. arXiv:2501.12948, 2025.