用一个例子理解
在语言模型中,大量书面表达、代码和其他文本提供语言规律。模型先学会比较广泛的续写能力,之后才可能进一步学习如何按要求给出一份结构清晰的教案。
看图理解把过程看清楚
01大量数据
内容与质量影响所学规律
02训练目标
例如下一词元预测
03基础模型
获得可进一步适配的能力
再深入一层
对常见自回归语言模型,训练信号可以由文本本身产生:前文作为条件,实际后续词元作为目标。并非所有预训练都预测下一个词元,其他结构也会采用掩码恢复等目标。预训练是阶段名称,不是某一种唯一算法。
它不能说明什么
基础模型不是完整应用。它没有因此自动获得文件访问权、PPT 排版工具或事实验收能力。一般用户使用的是经过进一步训练并接入应用功能的系统。
接下来可以了解
资料依据
- Hugging Face · How do Transformers work?:预训练与微调、不同结构与训练目标。
- Attention Is All You Need:Transformer 是以注意力为核心的模型结构;原论文包含编码器与解码器。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。