用一个例子理解

样本可以是:「给初一学生设计一个 10 分钟活动」以及由教师准备的合适答案。模型学习示范中的任务结构、表达方式和内容规律。

看图理解把过程看清楚
01任务输入

年级、目标与时间

02示范答案

人们希望得到的结果

03继续训练

提高示范输出的概率

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

在语言模型里,常通过预测示范答案的词元来训练。样本设计很重要:指令多样性、示范质量、数据覆盖与评估都会影响效果。SFT 是使用监督示范的训练方式,既可更新大量参数,也可配合 LoRA 更新少量适配参数。

它不能说明什么

普通用户在一次对话里贴几个例子,通常叫上下文示范,不会因此发生 SFT。两者都能影响回答,但是否更新参数是关键区别。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。