用一个例子理解
反向传播给出「该往哪边调」的信息,优化器决定采用什么规则走一步。SGD 和 Adam 都在这个层次;Transformer 则在模型结构层次。
看图理解把过程看清楚
01输入梯度
来自本轮损失的求导
02更新规则
结合学习率与历史状态
03新参数
用于下一轮计算
再深入一层
学习率控制更新尺度;批次决定一轮使用哪些样本;一些优化器还维护过去梯度的统计量。SGD 可以作为基础理解,Adam 根据梯度的一阶和二阶矩估计适配各参数的更新。它们不是要求依次执行的课程步骤。
它不能说明什么
选择优化器并不替代数据、目标和评估设计。PPO 等训练方法内部仍会借助梯度优化器更新参数,两者属于不同抽象层。
接下来可以了解
资料依据
- PyTorch · Optimizing Model Parameters:批次、学习率、损失、梯度、SGD 更新与测试集评估。
- Adam: A Method for Stochastic Optimization:第 2 节和算法 1:一阶与二阶矩、偏差修正、参数更新。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。