用一个例子理解

预测经过很多层运算才得到损失。反向传播从损失出发,一层层计算:如果稍微改变这里的数值,最终损失会怎样变。它提供调整依据,本身不是按下「更新参数」。

看图理解把过程看清楚
01前向计算 →

输入经过多层得到损失

02← 反向求导

用链式法则逐层传递

03参数梯度

交给优化器使用

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

一段复杂计算由许多小运算组成。链式法则把这些小运算的导数串起来,得到损失相对于参数的导数。自动微分框架负责记录计算依赖,反向传播是计算梯度的常见方式。

它不能说明什么

梯度计算与参数更新是两步。反向传播也不是把生成的答案反着读,更不是奖励模型给答案打分。若某些参数冻结,它们就不按这一轮训练更新。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。