AI 推理术语表
模型架构GDN

Gated DeltaNet

也称为 Gated DeltaNet、GDN、Gated Delta Net、delta rule 注意力

先用大白话

Gated DeltaNet 是一种线性注意力层,为每个请求保留固定大小的运行状态,而不是随 token 增长的 KV cache。

技术定义

Gated DeltaNet 是一种循环式线性注意力机制:每一步先用门控衰减运行状态,再用 rank-one 的 delta rule 修正更新,最后与 query 相乘得到输出。

工程细节

Qwen3.5 把 GDN 层与分组查询注意力层交错排列,是一个有两种状态的混合模型:GQA 层累积不断增长的 KV 历史,GDN 层为每个请求保存固定大小的循环状态。在 TPU 上,循环计算被调度到 MXU、VPU、VMEM 和 HBM 之间。一项优化重排了输出投影的代数,让 MXU 直接计算衰减状态与 query 的乘积,同时 VPU 构建下一步的状态,把状态更新从 MXU 的依赖链上移走;当前 token 的贡献只是每个 head 一个标量点积加一次小的向量加法。其他改动包括在 decode 循环中切片 Q 和 K 以减少寄存器溢出、状态在 HBM 中以 BF16 存储而在计算时用 FP32,以及把 Conv1D 与 GDN 融合成一个 kernel。

为什么重要

固定大小的状态让长上下文在内存上很便宜,但让 prefix caching 变复杂,因为缓存前缀末尾的循环状态通常在请求继续时就被覆盖。混合模型的 prefix caching 为 GDN 提供分开的槽位,分别读取 checkpoint 和写入实时状态,并与 KV block 边界对齐。

如何在 InferenceX 中解读

Ironwood 上 Qwen3.5 报告的收益包括:代数重排在并发 512 下吞吐量提高 4.48%,异步状态传输提高 11.3%,BF16 状态存储使 1k8k 提高 15%,GDN v3 在 kernel 层面 decode 加速 1.41 倍、prefill 1.60 倍、混合 batch 2.14 倍。