AI 推理术语表
软件栈

Mooncake Store

也称为 Mooncake Store、Mooncake、Mooncake KV 存储、P2P KV 池化

先用大白话

Mooncake Store 把多台服务器的主机内存和 NVMe 盘汇聚成一个共享的 KV cache 存储,集群内任何加速器都能读取。

技术定义

Mooncake Store 是 Mooncake 项目的开源分布式 KV cache 存储层,把各服务节点的 DRAM 和 NVMe 聚合成一个支持点对点访问的逻辑池。

工程细节

通过 P2P 池化,每台主机上的 KV cache 存储被呈现为一个逻辑内存池,任意服务器上的加速器都可以读取其他服务器写入的 cache,而不只是本机的。Mooncake Store 还能跨服务器池化 NVMe,并支持 WEKA、VAST 等分布式文件系统后端。它在 GPU 上已与 vLLM 和 SGLang 配合使用,是业界标准的 offload 存储;Google 正在添加 TPU 支持和 DRAM P2P 池化模式,很可能基于 TPU-Sync 原语实现。

为什么重要

智能体和多轮负载会在大量请求和 sub-agent 突发之间复用长前缀。集群级的池把 KV cache 命中率提升到远超单机 DRAM 所能达到的水平,这是 HBM 耗尽后高并发智能体服务仍然经济的原因。

如何在 InferenceX 中解读

GPU 上的 AgentX 结果已经依赖 offload 行为,计划中的 AgentX TPU 结果将在 Ironwood 上实际使用 Mooncake Store 和 TPU-Sync。InferenceX Official Preview 把 Mooncake 支持列为分离式服务之后的下一步外部化工作。