用一个例子理解
假设有一百万条训练样本,不必每次看完全部才调整一次。训练常用一小批样本计算梯度并更新,因此每一步有波动,但计算更可行。
看图理解把过程看清楚
01抽取一批样本
估计当前梯度
02沿负梯度走一步
学习率控制幅度
03更换样本继续
多轮累计改进
再深入一层
严格说,单样本更新是随机梯度下降,小批量更新是 mini-batch SGD;实践里常统称 SGD。基础规则是「新参数 = 旧参数 − 学习率 × 梯度」。实现还可能加入动量,缓和方向频繁摇摆。
它不能说明什么
随机不是随便改参数:梯度仍来自损失和样本。小批量梯度只是一种估计,某一批改善不表示其他样本必然改善。此规则是理解训练的起点,不是对所有大模型训练配方的断言。
接下来可以了解
资料依据
- PyTorch · Optimizing Model Parameters:批次、学习率、损失、梯度、SGD 更新与测试集评估。
- Adam: A Method for Stochastic Optimization:第 2 节和算法 1:一阶与二阶矩、偏差修正、参数更新。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。