模型架构SWA
滑动窗口注意力
也称为 sliding window attention、SWA、局部注意力
先用大白话
滑动窗口注意力让某些层只看最近一段 token,因此窗口填满之后它的缓存就不再继续增长。
技术定义
滑动窗口注意力把每个 query 限制在固定长度的前文范围内,从而限定该层需要保留的 KV 状态。
工程细节
由于窗口长度固定,这类层的缓存会达到上限而不会随对话增长,较早的条目会随窗口推进被移出。模型通常把这类层与全注意力层交错排列,这样远距离信息在网络中仍有通路,而大多数层保持低成本。
为什么重要
有界的开销带来了分配器层面的问题。窗口页不断翻转,而持久的前缀页静止不动;当两者取自同一个池子时,短暂分配往往会把有价值的那份挤出去,于是长会话可能因为短命的窗口状态而丢失昂贵的全注意力历史。
如何在 InferenceX 中解读
这些效应只在多轮流量中出现。单条短提示词既不会让窗口绕过前缀,也不会造成池子争用,因此窗口感知的淘汰、offload 和分叉处理都表现为由 AgentX 推动的引擎工作,而不是定长场景的测试结果。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势