KV cache 管理器
也称为 KV cache manager、Mooncake、LMCache、HiCache
先用大白话
KV cache 管理器负责把注意力状态存放在芯片之外,并决定哪些保留、哪些淘汰、什么时候取回。
技术定义
KV cache 管理器是位于推理引擎之下的可插拔层,负责跨存储层级保存可复用的 KV block,并管理其放置、淘汰与传输。
工程细节
引擎对外提供 connector 接口,因此 Mooncake Store、LMCache、SGLang HiCache 等管理器可以服务不同运行时。管理器按前缀哈希为 block 建立索引,把它们放在主机 DRAM、本地 NVMe 或远端后端;实际的字节搬运由 Mooncake Transfer Engine、NIXL 等传输引擎完成。同一个引擎内部可以并存多条路径。
为什么重要
一旦工作负载大量复用前缀,这一层的正确性和记账就和内核速度同等重要。混合注意力模型更难处理:一个模型同时携带形状和生命周期都不同的多个 cache group,而假设单一 block 几何结构的 connector 无法描述它们。
如何在 InferenceX 中解读
InferenceX 把 KV offload 引擎记录为运行元数据,并在 AgentX 点详情视图中展示。框架标签给出的是组合而不是单个引擎,因此一套方案会显示为 Mooncake ATOMesh 或 MoRI SGLang,而不只是引擎名。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM