用一个例子理解
句子「把教材放进书包,因为它很重」中的「它」可能有不同指代。模型需要结合上下文中多个词的关系,而不是只看相邻两个字。注意力是参与这种信息交互的一种机制。
看图理解把过程看清楚
01词元的数值表示
带有位置信息
02注意力与前馈层
多层信息交互和变换
03输出表示
用于预测等任务
再深入一层
原始 Transformer 包含编码器和解码器。很多自回归语言模型采用解码器风格结构,并用因果约束使位置只能利用允许的此前内容。注意力之外,还有前馈网络、残差连接和归一化等组成。
它不能说明什么
Transformer 是结构名称,不是训练阶段,也不是优化器。并非所有 AI 都使用它;同属该结构的模型也可以有不同目标和能力。图例省略多头与多层的实现细节。
接下来可以了解
资料依据
- Attention Is All You Need:Transformer 是以注意力为核心的模型结构;原论文包含编码器与解码器。
- Hugging Face · Caching:自回归推理中按层复用历史 K/V;注意力 Q/K/V 和缓存内存开销。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。