用一个例子理解
预测经过很多层运算才得到损失。反向传播从损失出发,一层层计算:如果稍微改变这里的数值,最终损失会怎样变。它提供调整依据,本身不是按下「更新参数」。
看图理解把过程看清楚
01前向计算 →
输入经过多层得到损失
02← 反向求导
用链式法则逐层传递
03参数梯度
交给优化器使用
再深入一层
一段复杂计算由许多小运算组成。链式法则把这些小运算的导数串起来,得到损失相对于参数的导数。自动微分框架负责记录计算依赖,反向传播是计算梯度的常见方式。
它不能说明什么
梯度计算与参数更新是两步。反向传播也不是把生成的答案反着读,更不是奖励模型给答案打分。若某些参数冻结,它们就不按这一轮训练更新。
接下来可以了解
资料依据
- PyTorch · Automatic Differentiation:反向传播通过链式法则计算参数梯度;与优化器更新分开。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。