AI 推理术语表
推理服务

NVMe offloading

也称为 NVMe offload、SSD offloading、闪存 KV cache 卸载

先用大白话

NVMe offloading 把 KV cache 再向下延伸一层到本地 SSD,让 GPU 和 CPU 内存都装不下的前缀日后仍能重新载入。

技术定义

NVMe offloading 把可复用的 KV cache block 保存在 HBM 与主机 DRAM 之下的 NVMe SSD 层,用更慢的重载速度换取大得多的可取回 KV 工作集。

工程细节

存储层级每往下一层,容量成倍增长而带宽成倍下降,因此只有当重新载入长前缀仍然比重算划算时,SSD 层才有收益。LMCache、Mooncake Store 等 KV cache 管理器已经在 DRAM 和远端存储之外支持本地 NVMe 后端。这一层在两种情况下帮助最大:复用工作集超出任何合理的 DRAM 预算,或会话空闲太久、DRAM 淘汰已经把它丢弃之后才回来。

为什么重要

NVMe offloading 实际上延长了长生命周期智能体会话的缓存存活时间,当 agent 需要等待工具、人类或 CI 数分钟时这一点尤为重要。它高度依赖工作负载:如果高并发部署下 DRAM offloading 已经在拖累延迟,更慢的一层也救不回来,因为瓶颈在重载带宽而不是容量。

如何在 InferenceX 中解读

AgentX v1 测量 HBM 和 DRAM 两层,暂缓 NVMe offloading;SSD/NVMe KV offloading 已列为快速跟进项,用来把工作集扩展到 DRAM 之外。届时回放流当前 5 分钟的空闲上限也可能随之提高,使更长的缓存存活时间变得可测量。