AI 推理术语表
模型架构

循环状态(recurrent state)

也称为 recurrent state、循环状态、GDN 状态、线性注意力状态、SSM 状态

先用大白话

循环状态是线性注意力或 SSM 层为每个请求保存的固定大小内存,不像 KV cache 那样随每个 token 增长。

技术定义

循环状态是 Gated DeltaNet 等线性注意力层在每一步更新的、每个请求固定大小的张量,取代了 softmax 注意力层按 token 存储且不断增长的 key-value 历史。

Qwen3.5 397B 的紧凑循环状态分配

回收约 76 GiB HBM,attention block 池 +71%,并发 64 的 1k8k 吞吐量 +18%

工程细节

在 Qwen3.5 这样的混合模型中,GQA 层累积随上下文增长的 KV 历史,GDN 层则为每个请求保存一个固定大小的状态,每个 token 都对它衰减、施加 rank-one 更新并读出。服务引擎必须为这个状态分配 slot、决定其存储精度,并为 prefix caching 处理 checkpoint,因为请求一旦继续,实时状态就会被覆盖。在 Ironwood 上,状态最初按每个层组 num_blocks 个 slot 分配,浪费了 HBM,后来压缩为大约每个活跃请求一个 slot。

为什么重要

循环状态改变了内存预算:它不随上下文增长,这正是混合架构的意义所在,但它必须存放在某处,并且每一步都要在 VMEM 和 HBM 之间搬运。以 BF16 存储、以 FP32 计算可以把它的占用减半。混合模型的 prefix caching 需要分开的读写 slot,缓存的 checkpoint 才能保留下来。

如何在 InferenceX 中解读

紧凑分配回收了约 76 GiB HBM,把 attention block 池扩大了 71%,让 Qwen3.5 397B 在 1k8k 上的吞吐量在并发 64 下提高 18%。BF16 状态存储在并发 512 的 1k8k 上再带来 15% 的收益。