AI 推理术语表
软件栈

KV cache 管理器

也称为 KV cache manager、Mooncake、LMCache、HiCache

先用大白话

KV cache 管理器负责把注意力状态存放在芯片之外,并决定哪些保留、哪些淘汰、什么时候取回。

技术定义

KV cache 管理器是位于推理引擎之下的可插拔层,负责跨存储层级保存可复用的 KV block,并管理其放置、淘汰与传输。

工程细节

引擎对外提供 connector 接口,因此 Mooncake Store、LMCache、SGLang HiCache 等管理器可以服务不同运行时。管理器按前缀哈希为 block 建立索引,把它们放在主机 DRAM、本地 NVMe 或远端后端;实际的字节搬运由 Mooncake Transfer Engine、NIXL 等传输引擎完成。同一个引擎内部可以并存多条路径。

为什么重要

一旦工作负载大量复用前缀,这一层的正确性和记账就和内核速度同等重要。混合注意力模型更难处理:一个模型同时携带形状和生命周期都不同的多个 cache group,而假设单一 block 几何结构的 connector 无法描述它们。

如何在 InferenceX 中解读

InferenceX 把 KV offload 引擎记录为运行元数据,并在 AgentX 点详情视图中展示。框架标签给出的是组合而不是单个引擎,因此一套方案会显示为 Mooncake ATOMesh 或 MoRI SGLang,而不只是引擎名。