用一个例子理解

同一问题有两个候选答案,教师选择了更适合年级的那份。DPO 学习这类成对偏好,让模型相对于参考模型更倾向于偏好的回答。

看图理解同一个问题,比较两份回答
答案 A · 更偏好

说明年级、活动目标和用时

答案 B

只有笼统的活动建议

01同一个问题

两个候选回答

02成对偏好

标明更偏好的一项

03直接优化目标

调整相对回答倾向

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

训练通常使用问题、优选答案和较差答案,并参考一个固定参考策略。目标比较答案的相对概率,不是把优选答案简单复制成唯一标准答案。内部仍要计算梯度并用优化器更新模型。

它不能说明什么

不用单独奖励模型不代表不需要高质量偏好数据或没有隐含奖励关系。偏好可能有噪声、风格偏差或事实错误。DPO 与 PPO 是可选方法路径,不能画成必须先后执行。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。