用一个例子理解
训练文本里的目标词元是「课本」。模型给它 10% 的概率,通常比给它 60% 的概率受到更大的损失;这样程序知道哪种调整方向更符合这个训练目标。
看图理解把过程看清楚
01预测概率
目标词元目前只有 10%
02已知目标
训练样本给出的正确后续
03损失数值
越不符合目标,惩罚通常越大
再深入一层
常见语言建模目标使用交叉熵。对单个已知目标词元,可以先理解为负对数概率:L = −log p。p 是模型给目标词元的概率;例如自然对数下 p=0.1 时约为 2.30,p=0.6 时约为 0.51。实际训练会对许多位置和样本聚合。
它不能说明什么
数字更小只表示更符合这项数学目标,不直接表示更有审美、更适合课堂或所有事实都正确。任务真正好不好还需要单独评估。
接下来可以了解
资料依据
- PyTorch · Optimizing Model Parameters:批次、学习率、损失、梯度、SGD 更新与测试集评估。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。