用一个例子理解

模型给出几种活动方案,训练过程评估结果,再调整它生成这些回答的倾向。若只一味追逐当前高分,行为可能变得不稳定;PPO 的目标设计旨在让更新更温和。

看图理解把过程看清楚
01旧策略采样

生成回答并取得奖励

02估计优势

结果比预期好多少

03优化裁剪目标

抑制过大的有利概率比变化

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

策略在这里是选择输出的概率分布。常见 PPO-Clip 用新旧策略对已采样动作的概率比,与优势估计组成替代目标;裁剪去掉继续扩大某些有利变化的额外激励。它仍通过梯度计算和优化器来实际更新参数。

想看得更细

先理解三个量:概率比表示新旧倾向差了多少,优势表示结果相对预期的好坏,裁剪范围控制目标何时停止奖励过大变化。具体公式与例子见原论文第 3 节。

它不能说明什么

裁剪不是所有概率变化的硬性上限,也不保证训练绝对稳定。PPO 不是语言模型专属算法;在 RLHF 中使用它,也不能把算法名称当作答案可靠性的证明。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。