用一个例子理解
以语言模型为例,给它「上课前,请先打开课本」,让它根据前面的内容预测后面的词元。刚开始预测不准,训练程序会计算误差并调整参数。它学习的是大量样本里的规律,而不只是保存这句话。
看图理解训练的关键,是反复调整参数
一批训练样本:输入及训练目标
01模型预测
用当前参数进行前向计算。
02计算损失
比较预测与训练目标,得到误差信号。
03反向传播
从损失求出各参数的梯度。
04优化器更新
按更新规则调整参数,再用下一批数据计算。
用更新后的参数进入下一批样本
再深入一层
每轮训练通常使用一批数据。模型先做前向计算,损失函数给出可优化的数字,反向传播求出梯度,优化器更新参数,再用下一批数据重复。这里「训练」有明确的参数变化;你在聊天框补充一份材料,通常只是改变本次输入。
它不能说明什么
训练目标、数据质量和评估方法一起决定结果。把损失降得很低,也不等于所有事实、推理和审美都可靠。普通使用者无需先训练模型,才能把任务说清楚。
接下来可以了解
资料依据
- PyTorch · Optimizing Model Parameters:批次、学习率、损失、梯度、SGD 更新与测试集评估。
- Hugging Face · How do Transformers work?:预训练与微调、不同结构与训练目标。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。