用一个例子理解

假设一个教学用模型窗口是 16,000 个词元,已有指令、历史和资料用掉 10,000 个,那么并不能再要求任意长的输出。还要考虑该模型的输出上限,以及可能的推理用量。

看图理解16,000 个词元,怎样分给输入与生成?
指令与历史4,000|指令与历史
资料与工具结果6,000|资料与工具
留给生成6,000|窗口剩余
上下文预算分配(教学示意)
教学假设:上下文总量 16,000输出另有限额:4,000

窗口还余 6,000,但若输出另限 4,000,本例最多预留 4,000 给输出。

16,000 / 4,000 均为教学假设,不对应产品规格。这里先忽略额外开销;推理用量和应用规则还可能进一步占用预算。

再深入一层

要分清三个问题:规格支持多大窗口、应用本次实际装入了多少信息、模型有没有有效利用这些信息。窗口足够大也可能遗漏细节;上传的整份文件还可能先被检索系统筛选,只把部分片段放进输入。

它不能说明什么

16,000 只是预算示例,不对应任何产品规格。不同模型对输入、输出、推理词元的计量存在差异。窗口不是长期记忆;开新对话后是否保留信息由应用机制决定。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。