用一个例子理解

例如同一道数学题生成四份答案,检查结果得到 0、1、1、0 的奖励。训练会比较这组结果中的相对表现;这些数字是教学示例,实际任务需设计合理的奖励。

看图理解把过程看清楚
01一个问题

采样一组候选

02组内比较

相对平均奖励的好坏

03更新策略

结合裁剪等目标机制

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

原始 DeepSeekMath 方法使用组内奖励估计基线,从而不需要 PPO 常用的独立价值模型。在结果监督形式中,奖励减去组均值,再按组标准差归一化得到优势;还可使用过程级监督。

它不能说明什么

奖励可以来自模型或可验证规则,不必全部来自人类。全组同分时相对信号有限,实际实现还需处理零方差等情况。GRPO 不是只选出最高分答案展示给用户,也不是每个模型都使用它。

接下来可以了解

资料依据

  • DeepSeekMath · GRPO:第 4.1 节:同一问题的候选组、相对奖励、免独立价值模型;结果监督与过程监督。

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。