用一个例子理解
假设一个教学用模型窗口是 16,000 个词元,已有指令、历史和资料用掉 10,000 个,那么并不能再要求任意长的输出。还要考虑该模型的输出上限,以及可能的推理用量。
看图理解16,000 个词元,怎样分给输入与生成?
指令与历史4,000|指令与历史
资料与工具结果6,000|资料与工具
留给生成6,000|窗口剩余
上下文预算分配(教学示意)
教学假设:上下文总量 16,000输出另有限额:4,000
窗口还余 6,000,但若输出另限 4,000,本例最多预留 4,000 给输出。
再深入一层
要分清三个问题:规格支持多大窗口、应用本次实际装入了多少信息、模型有没有有效利用这些信息。窗口足够大也可能遗漏细节;上传的整份文件还可能先被检索系统筛选,只把部分片段放进输入。
它不能说明什么
16,000 只是预算示例,不对应任何产品规格。不同模型对输入、输出、推理词元的计量存在差异。窗口不是长期记忆;开新对话后是否保留信息由应用机制决定。
接下来可以了解
资料依据
- OpenAI · Conversation state:上下文窗口、输入输出和推理 Token;持久化状态与本次输入是不同层次。
- Hugging Face · Caching:自回归推理中按层复用历史 K/V;注意力 Q/K/V 和缓存内存开销。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。