用一个例子理解
输入「法国的首都是」,词元表里的许多续写会获得不同分数。模型最终生成「巴黎」相关词元的过程,是基于数值计算,并不是打开内部事实表逐行查找。
看图理解把过程看清楚
01已有内容
法国的首都是…
02预测分布
为候选词元计算概率
03目标或采样
训练时对照目标;使用时选择续写
再深入一层
训练时,已有文本给出真实的后续词元,程序提高这些目标词元的预测概率。使用时没有预先给定答案,生成的词元会加入后续条件。一个汉字、单词或标点与词元并非固定一一对应,具体取决于分词器。
它不能说明什么
「预测续写」描述生成机制,不等于能力只能补几个字;也不能据此保证答案属实。图中文字为教学分段,不冒充任何实际分词器的结果。
接下来可以了解
资料依据
- Hugging Face · How do Transformers work?:预训练与微调、不同结构与训练目标。
- Hugging Face · Caching:自回归推理中按层复用历史 K/V;注意力 Q/K/V 和缓存内存开销。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。