线性注意力
也称为 linear attention、GatedDeltaNet、常数状态注意力
先用大白话
线性注意力保存一份固定大小的运行摘要,而不是全部历史 token,因此内存不会随对话增长。
技术定义
线性注意力用一个大小恒定、随 token 到达而更新的循环状态,替代不断增长的 key 与 value 缓存。
工程细节
标准注意力保存的状态与序列长度成正比,且每一步都要重新读取。线性或门控循环层改为携带固定大小的状态,用对每个位置的精确回忆换取有界的内存占用。GatedDeltaNet 这类结构只在部分层这样做,其余层保留全注意力,以维持精确的远距离查找能力。
为什么重要
在长上下文下,节省的存储相当可观,但这种状态改变了缓存的含义:它无法像窗口尾部那样由周围 token 重建,一旦丢弃就只能重放整个序列,因此复用需要显式的检查点机制,而不是普通的 block 复用。
如何在 InferenceX 中解读
InferenceX 服务的模型中已有采用这类层的,引擎对循环状态的检查点与传输支持属于测试配置的一部分。一个模型可以在 day 0 就能被服务,却仍不支持这类状态的复用,表现为重复轮次上出乎意料的高 prefill 开销。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
AMD MI355X Qwen3.5 397B-A17B 推理:SGLang FP8 三个月内每 GPU 吞吐量提升最高 19 倍
从 v0.5.8(2 月)→ v0.5.10rc0(4 月)→ v0.5.12(5 月),三次 AITER 内核合入 MI355X 加上从 TP=8 到 TP=2/TP=4 的重新调优,将 Qwen3.5 8k/1k 峰值从 1.3k 推高至 6.4k tok/s/GPU,并将曲线延伸至 75 tok/s/user
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能