用一个例子理解
样本可以是:「给初一学生设计一个 10 分钟活动」以及由教师准备的合适答案。模型学习示范中的任务结构、表达方式和内容规律。
看图理解把过程看清楚
01任务输入
年级、目标与时间
02示范答案
人们希望得到的结果
03继续训练
提高示范输出的概率
再深入一层
在语言模型里,常通过预测示范答案的词元来训练。样本设计很重要:指令多样性、示范质量、数据覆盖与评估都会影响效果。SFT 是使用监督示范的训练方式,既可更新大量参数,也可配合 LoRA 更新少量适配参数。
它不能说明什么
普通用户在一次对话里贴几个例子,通常叫上下文示范,不会因此发生 SFT。两者都能影响回答,但是否更新参数是关键区别。
接下来可以了解
资料依据
- Training language models to follow instructions with human feedback:InstructGPT 示例:示范数据、人工排序、通过反馈进行后训练。
- LoRA: Low-Rank Adaptation of Large Language Models:冻结预训练权重,训练低秩矩阵;参数高效适配方法。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。