用一个例子理解
同一问题有两个候选答案,教师选择了更适合年级的那份。DPO 学习这类成对偏好,让模型相对于参考模型更倾向于偏好的回答。
看图理解同一个问题,比较两份回答
答案 A · 更偏好
说明年级、活动目标和用时
答案 B
只有笼统的活动建议
01同一个问题
两个候选回答
02成对偏好
标明更偏好的一项
03直接优化目标
调整相对回答倾向
再深入一层
训练通常使用问题、优选答案和较差答案,并参考一个固定参考策略。目标比较答案的相对概率,不是把优选答案简单复制成唯一标准答案。内部仍要计算梯度并用优化器更新模型。
它不能说明什么
不用单独奖励模型不代表不需要高质量偏好数据或没有隐含奖励关系。偏好可能有噪声、风格偏差或事实错误。DPO 与 PPO 是可选方法路径,不能画成必须先后执行。
接下来可以了解
资料依据
- Direct Preference Optimization:偏好对上的直接目标;标准形式不需要单独训练奖励模型或 PPO 在线循环。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。