用一个例子理解
例如同一道数学题生成四份答案,检查结果得到 0、1、1、0 的奖励。训练会比较这组结果中的相对表现;这些数字是教学示例,实际任务需设计合理的奖励。
看图理解把过程看清楚
01一个问题
采样一组候选
02组内比较
相对平均奖励的好坏
03更新策略
结合裁剪等目标机制
再深入一层
原始 DeepSeekMath 方法使用组内奖励估计基线,从而不需要 PPO 常用的独立价值模型。在结果监督形式中,奖励减去组均值,再按组标准差归一化得到优势;还可使用过程级监督。
它不能说明什么
奖励可以来自模型或可验证规则,不必全部来自人类。全组同分时相对信号有限,实际实现还需处理零方差等情况。GRPO 不是只选出最高分答案展示给用户,也不是每个模型都使用它。
接下来可以了解
资料依据
- DeepSeekMath · GRPO:第 4.1 节:同一问题的候选组、相对奖励、免独立价值模型;结果监督与过程监督。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。