用一个例子理解
用一条简单曲线理解:损失 L=(w−3)²,当前参数 w=1。这里梯度为 −4;普通梯度下降减去梯度乘学习率后,w 会往 3 靠近。
看图理解只看一个参数,理解一步更新
01当前位置
w = 1,损失 = 4
02局部方向
梯度 = −4
03小幅更新
学习率 0.1 → w = 1.4
再深入一层
梯度指向函数局部增长最快的方向,所以普通梯度下降向其反方向走。上例更新后损失为 2.56,比 4 小。真实模型有许多参数,梯度也包含许多分量;实际优化器还可能使用历史统计来调整步伐。
它不能说明什么
这个单参数示例只解释局部变化,不保证真实训练每一步都下降,更不保证找到全局最优点。学习率过大可能跨过低点,数据批次变化也会带来波动。
接下来可以了解
资料依据
- PyTorch · Optimizing Model Parameters:批次、学习率、损失、梯度、SGD 更新与测试集评估。
- PyTorch · Automatic Differentiation:反向传播通过链式法则计算参数梯度;与优化器更新分开。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。