用一个例子理解

训练文本里的目标词元是「课本」。模型给它 10% 的概率,通常比给它 60% 的概率受到更大的损失;这样程序知道哪种调整方向更符合这个训练目标。

看图理解把过程看清楚
01预测概率

目标词元目前只有 10%

02已知目标

训练样本给出的正确后续

03损失数值

越不符合目标,惩罚通常越大

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

常见语言建模目标使用交叉熵。对单个已知目标词元,可以先理解为负对数概率:L = −log p。p 是模型给目标词元的概率;例如自然对数下 p=0.1 时约为 2.30,p=0.6 时约为 0.51。实际训练会对许多位置和样本聚合。

它不能说明什么

数字更小只表示更符合这项数学目标,不直接表示更有审美、更适合课堂或所有事实都正确。任务真正好不好还需要单独评估。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。