软件栈
Mooncake Store
也称为 Mooncake Store、Mooncake、Mooncake KV 存储、P2P KV 池化
先用大白话
Mooncake Store 把多台服务器的主机内存和 NVMe 盘汇聚成一个共享的 KV cache 存储,集群内任何加速器都能读取。
技术定义
Mooncake Store 是 Mooncake 项目的开源分布式 KV cache 存储层,把各服务节点的 DRAM 和 NVMe 聚合成一个支持点对点访问的逻辑池。
工程细节
通过 P2P 池化,每台主机上的 KV cache 存储被呈现为一个逻辑内存池,任意服务器上的加速器都可以读取其他服务器写入的 cache,而不只是本机的。Mooncake Store 还能跨服务器池化 NVMe,并支持 WEKA、VAST 等分布式文件系统后端。它在 GPU 上已与 vLLM 和 SGLang 配合使用,是业界标准的 offload 存储;Google 正在添加 TPU 支持和 DRAM P2P 池化模式,很可能基于 TPU-Sync 原语实现。
为什么重要
智能体和多轮负载会在大量请求和 sub-agent 突发之间复用长前缀。集群级的池把 KV cache 命中率提升到远超单机 DRAM 所能达到的水平,这是 HBM 耗尽后高并发智能体服务仍然经济的原因。
如何在 InferenceX 中解读
GPU 上的 AgentX 结果已经依赖 offload 行为,计划中的 AgentX TPU 结果将在 Ironwood 上实际使用 Mooncake Store 和 TPU-Sync。InferenceX Official Preview 把 Mooncake 支持列为分离式服务之后的下一步外部化工作。
参考资料