用一个例子理解

对同一备课问题,人类认为答案 A 更贴合年级,答案 B 太笼统。收集很多这样的比较,可以帮助建立评价信号,再让模型更倾向于获得较高奖励的回答。

看图理解把过程看清楚
01人类比较回答

哪些更符合要求

02学习奖励信号

典型流程训练奖励模型

03强化学习更新

例如借助 PPO

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

InstructGPT 是一个经典例子:先用示范做监督微调,再用人类排序训练奖励模型,随后做强化学习。这里的人类反馈常先转为可自动计算的奖励,不需要人工给每个生成词元即时评分。

它不能说明什么

RLHF 是一类训练流程,PPO 是可用于其中的方法。DPO 使用偏好对直接优化,是理解偏好训练的另一条路径。奖励可能学偏,较高奖励也不能直接证明事实正确。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。