Gated DeltaNet
也称为 Gated DeltaNet、GDN、Gated Delta Net、delta rule 注意力
先用大白话
Gated DeltaNet 是一种线性注意力层,为每个请求保留固定大小的运行状态,而不是随 token 增长的 KV cache。
技术定义
Gated DeltaNet 是一种循环式线性注意力机制:每一步先用门控衰减运行状态,再用 rank-one 的 delta rule 修正更新,最后与 query 相乘得到输出。
工程细节
Qwen3.5 把 GDN 层与分组查询注意力层交错排列,是一个有两种状态的混合模型:GQA 层累积不断增长的 KV 历史,GDN 层为每个请求保存固定大小的循环状态。在 TPU 上,循环计算被调度到 MXU、VPU、VMEM 和 HBM 之间。一项优化重排了输出投影的代数,让 MXU 直接计算衰减状态与 query 的乘积,同时 VPU 构建下一步的状态,把状态更新从 MXU 的依赖链上移走;当前 token 的贡献只是每个 head 一个标量点积加一次小的向量加法。其他改动包括在 decode 循环中切片 Q 和 K 以减少寄存器溢出、状态在 HBM 中以 BF16 存储而在计算时用 FP32,以及把 Conv1D 与 GDN 融合成一个 kernel。
为什么重要
固定大小的状态让长上下文在内存上很便宜,但让 prefix caching 变复杂,因为缓存前缀末尾的循环状态通常在请求继续时就被覆盖。混合模型的 prefix caching 为 GDN 提供分开的槽位,分别读取 checkpoint 和写入实时状态,并与 KV block 边界对齐。
如何在 InferenceX 中解读
Ironwood 上 Qwen3.5 报告的收益包括:代数重排在并发 512 下吞吐量提高 4.48%,异步状态传输提高 11.3%,BF16 状态存储使 1k8k 提高 15%,GDN v3 在 kernel 层面 decode 加速 1.41 倍、prefill 1.60 倍、混合 batch 2.14 倍。
参考资料
在真实基准中理解这一概念
TPU 推理外部化全速推进
InferenceX、最高 50% 的每美元性能优势、TPU 软件栈的快速外部化、不断扩大的客户群、Ironwood、TPUv8i,以及正在收窄的 CUDA 护城河
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
AMD MI355X Qwen3.5 397B-A17B 推理:SGLang FP8 三个月内每 GPU 吞吐量提升最高 19 倍
从 v0.5.8(2 月)→ v0.5.10rc0(4 月)→ v0.5.12(5 月),三次 AITER 内核合入 MI355X 加上从 TP=8 到 TP=2/TP=4 的重新调优,将 Qwen3.5 8k/1k 峰值从 1.3k 推高至 6.4k tok/s/GPU,并将曲线延伸至 75 tok/s/user
MI355X 对比 GB300 NVL72 推理性能:Qwen3.5 SGLang 上 20 倍差距
GatedDeltaNet、262k 原生上下文,以及同一引擎上 AMD 完全缺席的竞争