AI 推理术语表
模型架构

线性注意力

也称为 linear attention、GatedDeltaNet、常数状态注意力

先用大白话

线性注意力保存一份固定大小的运行摘要,而不是全部历史 token,因此内存不会随对话增长。

技术定义

线性注意力用一个大小恒定、随 token 到达而更新的循环状态,替代不断增长的 key 与 value 缓存。

工程细节

标准注意力保存的状态与序列长度成正比,且每一步都要重新读取。线性或门控循环层改为携带固定大小的状态,用对每个位置的精确回忆换取有界的内存占用。GatedDeltaNet 这类结构只在部分层这样做,其余层保留全注意力,以维持精确的远距离查找能力。

为什么重要

在长上下文下,节省的存储相当可观,但这种状态改变了缓存的含义:它无法像窗口尾部那样由周围 token 重建,一旦丢弃就只能重放整个序列,因此复用需要显式的检查点机制,而不是普通的 block 复用。

如何在 InferenceX 中解读

InferenceX 服务的模型中已有采用这类层的,引擎对循环状态的检查点与传输支持属于测试配置的一部分。一个模型可以在 day 0 就能被服务,却仍不支持这类状态的复用,表现为重复轮次上出乎意料的高 prefill 开销。