用一个例子理解

反向传播给出「该往哪边调」的信息,优化器决定采用什么规则走一步。SGD 和 Adam 都在这个层次;Transformer 则在模型结构层次。

看图理解把过程看清楚
01输入梯度

来自本轮损失的求导

02更新规则

结合学习率与历史状态

03新参数

用于下一轮计算

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

学习率控制更新尺度;批次决定一轮使用哪些样本;一些优化器还维护过去梯度的统计量。SGD 可以作为基础理解,Adam 根据梯度的一阶和二阶矩估计适配各参数的更新。它们不是要求依次执行的课程步骤。

它不能说明什么

选择优化器并不替代数据、目标和评估设计。PPO 等训练方法内部仍会借助梯度优化器更新参数,两者属于不同抽象层。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。