模型架构
上下文窗口
也称为 context window、上下文长度、长上下文
先用大白话
上下文窗口是模型一次能处理的最大 token 数,涵盖输入和到目前为止生成的全部内容。
技术定义
上下文窗口是模型支持的最大序列长度,约束提示词、对话历史、检索材料与生成输出的 token 总数。
工程细节
注意力让每个 token 都能引用之前的 token,KV cache 为它们全部保存状态,所以更长的窗口意味着随长度增长的内存和计算开销。位置编码方案和训练长度决定可用窗口,服务栈则必须为其预算 KV 容量。现代前沿模型宣称几十万 token 的窗口,但序列接近上限时吞吐量和交互性都会下降。
为什么重要
长上下文让代码 agent、重检索流水线和文档分析成为可能,也让它们的服务成本变高。滑动窗口层、潜在注意力和线性注意力等架构响应,主要就是为了压弯窗口的成本曲线。
如何在 InferenceX 中解读
InferenceX 从两个方向覆盖窗口:固定序列场景钉住输入输出长度,例如 8K 输入 1K 输出;AgentX 则回放上下文逐轮增长、逼近真实 agent 工作集的会话。