用一个例子理解

能续写教材,并不代表知道你要的是「40 分钟教案」。示范答案可以教格式和任务行为;偏好反馈还可以帮助比较哪种回答更符合要求。

看图理解把不同作用放在一起看
01基础模型

已有通用能力

02示范或反馈

根据目标选择训练信号

03任务行为更合适

还需在实际场景评估

各项是不同角色或可选方式,不表示必须依次执行。

再深入一层

监督微调、偏好优化和强化学习都是可能的组成方式。一个具体训练方案可能组合其中几项,也可能只使用一部分。后训练是阶段和活动的统称,SFT、DPO、PPO、GRPO 的角色应分别理解。

它不能说明什么

后训练不表示永远优于原模型的所有能力,也不自动接入外部工具。图示只表达可以进一步适配,不规定每家公司相同的训练顺序。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。