用一个例子理解
模型给出几种活动方案,训练过程评估结果,再调整它生成这些回答的倾向。若只一味追逐当前高分,行为可能变得不稳定;PPO 的目标设计旨在让更新更温和。
看图理解把过程看清楚
01旧策略采样
生成回答并取得奖励
02估计优势
结果比预期好多少
03优化裁剪目标
抑制过大的有利概率比变化
再深入一层
策略在这里是选择输出的概率分布。常见 PPO-Clip 用新旧策略对已采样动作的概率比,与优势估计组成替代目标;裁剪去掉继续扩大某些有利变化的额外激励。它仍通过梯度计算和优化器来实际更新参数。
想看得更细
先理解三个量:概率比表示新旧倾向差了多少,优势表示结果相对预期的好坏,裁剪范围控制目标何时停止奖励过大变化。具体公式与例子见原论文第 3 节。
它不能说明什么
裁剪不是所有概率变化的硬性上限,也不保证训练绝对稳定。PPO 不是语言模型专属算法;在 RLHF 中使用它,也不能把算法名称当作答案可靠性的证明。
接下来可以了解
资料依据
- Proximal Policy Optimization Algorithms:第 2—3 节:策略梯度、概率比与裁剪替代目标;裁剪不构成所有概率变化的硬约束。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。