用一个例子理解
能续写教材,并不代表知道你要的是「40 分钟教案」。示范答案可以教格式和任务行为;偏好反馈还可以帮助比较哪种回答更符合要求。
看图理解把不同作用放在一起看
01基础模型
已有通用能力
02示范或反馈
根据目标选择训练信号
03任务行为更合适
还需在实际场景评估
再深入一层
监督微调、偏好优化和强化学习都是可能的组成方式。一个具体训练方案可能组合其中几项,也可能只使用一部分。后训练是阶段和活动的统称,SFT、DPO、PPO、GRPO 的角色应分别理解。
它不能说明什么
后训练不表示永远优于原模型的所有能力,也不自动接入外部工具。图示只表达可以进一步适配,不规定每家公司相同的训练顺序。
接下来可以了解
资料依据
- Training language models to follow instructions with human feedback:InstructGPT 示例:示范数据、人工排序、通过反馈进行后训练。
- Direct Preference Optimization:偏好对上的直接目标;标准形式不需要单独训练奖励模型或 PPO 在线循环。
- DeepSeekMath · GRPO:第 4.1 节:同一问题的候选组、相对奖励、免独立价值模型;结果监督与过程监督。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。