用一个例子理解
沿用 16,000 窗口、10,000 输入的示例,如果最大输出另限 4,000,即使窗口还有 6,000 的空间,也不能一次生成 6,000 个输出词元。
看图理解把过程看清楚
01窗口剩余
16,000 − 10,000 = 6,000
02输出另有上限
示意:4,000
03实际受较小限额约束
其他规则仍可能进一步占用
再深入一层
可以用「输入加生成所需空间不超过窗口,并且生成不超过输出上限」建立基本直觉。有些推理模型的内部推理词元会占用输出或上下文预算,最终可见文字可能更少。应用还可设置比模型上限更低的限制。
它不能说明什么
Token 不是固定字数,输出预算也不是保证一定写满的长度。长内容分段生成后仍需核对衔接、重复与遗漏,不能只靠把上限拉高。
接下来可以了解
资料依据
- OpenAI · Conversation state:上下文窗口、输入输出和推理 Token;持久化状态与本次输入是不同层次。
资料核验于 2026-09-09;原论文用于说明机制,文中例子为教学示例。