用一个例子理解
对同一备课问题,人类认为答案 A 更贴合年级,答案 B 太笼统。收集很多这样的比较,可以帮助建立评价信号,再让模型更倾向于获得较高奖励的回答。
看图理解把过程看清楚
01人类比较回答
哪些更符合要求
02学习奖励信号
典型流程训练奖励模型
03强化学习更新
例如借助 PPO
再深入一层
InstructGPT 是一个经典例子:先用示范做监督微调,再用人类排序训练奖励模型,随后做强化学习。这里的人类反馈常先转为可自动计算的奖励,不需要人工给每个生成词元即时评分。
它不能说明什么
RLHF 是一类训练流程,PPO 是可用于其中的方法。DPO 使用偏好对直接优化,是理解偏好训练的另一条路径。奖励可能学偏,较高奖励也不能直接证明事实正确。
接下来可以了解
资料依据
- Training language models to follow instructions with human feedback:InstructGPT 示例:示范数据、人工排序、通过反馈进行后训练。
- Proximal Policy Optimization Algorithms:第 2—3 节:策略梯度、概率比与裁剪替代目标;裁剪不构成所有概率变化的硬约束。
- Direct Preference Optimization:偏好对上的直接目标;标准形式不需要单独训练奖励模型或 PPO 在线循环。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。