AI 推理术语表
模型架构SWA

滑动窗口注意力

也称为 sliding window attention、SWA、局部注意力

先用大白话

滑动窗口注意力让某些层只看最近一段 token,因此窗口填满之后它的缓存就不再继续增长。

技术定义

滑动窗口注意力把每个 query 限制在固定长度的前文范围内,从而限定该层需要保留的 KV 状态。

工程细节

由于窗口长度固定,这类层的缓存会达到上限而不会随对话增长,较早的条目会随窗口推进被移出。模型通常把这类层与全注意力层交错排列,这样远距离信息在网络中仍有通路,而大多数层保持低成本。

为什么重要

有界的开销带来了分配器层面的问题。窗口页不断翻转,而持久的前缀页静止不动;当两者取自同一个池子时,短暂分配往往会把有价值的那份挤出去,于是长会话可能因为短命的窗口状态而丢失昂贵的全注意力历史。

如何在 InferenceX 中解读

这些效应只在多轮流量中出现。单条短提示词既不会让窗口绕过前缀,也不会造成池子争用,因此窗口感知的淘汰、offload 和分叉处理都表现为由 AgentX 推动的引擎工作,而不是定长场景的测试结果。