用一个例子理解

沿用 16,000 窗口、10,000 输入的示例,如果最大输出另限 4,000,即使窗口还有 6,000 的空间,也不能一次生成 6,000 个输出词元。

看图理解把过程看清楚
01窗口剩余

16,000 − 10,000 = 6,000

02输出另有上限

示意:4,000

03实际受较小限额约束

其他规则仍可能进一步占用

教学简图:只展示理解本概念所需的关系,省略具体实现细节。

再深入一层

可以用「输入加生成所需空间不超过窗口,并且生成不超过输出上限」建立基本直觉。有些推理模型的内部推理词元会占用输出或上下文预算,最终可见文字可能更少。应用还可设置比模型上限更低的限制。

它不能说明什么

Token 不是固定字数,输出预算也不是保证一定写满的长度。长内容分段生成后仍需核对衔接、重复与遗漏,不能只靠把上限拉高。

接下来可以了解

资料依据

资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。