推理服务
KV cache DRAM P2P 池化
也称为 P2P pooling、P2P 池化、DRAM 池化、共享 KV 池
先用大白话
P2P 池化把多台服务器的主机内存合并成一个逻辑 KV cache 存储,任何服务器上的加速器都能从其他服务器拉取缓存的上下文。
技术定义
KV cache DRAM P2P 池化是一种 offload 架构,把集群中每个节点贡献的主机 DRAM 聚合为单个逻辑内存池,让任意加速器通过网络读取其他节点写入的 KV cache。
工程细节
单节点 offload 在 HBM 满时把 KV block 从 HBM 移到本地主机 DRAM。池化更进一步:Mooncake Store 把每台 TPU 主机上的 DRAM 统一为一个共享池,还能把多台服务器的 NVMe 池化,或者接入 WEKA、VAST 这类分布式文件系统后端。被路由到与计算前缀的服务器不同的机器上的请求仍然可以命中缓存。Google 正通过 TPU-Sync 对外开放其原生 TPU offload 栈,并支持 Mooncake Store,后者很可能基于 TPU-Sync 的原语实现。
为什么重要
池化提高了智能体负载可达到的 prefix cache 命中率,这类负载的会话会运行数百轮,子智能体还会带着全新上下文突发出现。没有池化,命中率就受限于单节点能容纳多少内容,以及路由器能否把会话固定在一台机器上。
如何在 InferenceX 中解读
TPU-Sync DRAM offload 和 Mooncake Store 池化被列为 TPU InferenceX 预览的后续步骤,排在 AgentX TPU 结果之前。NVIDIA 和 AMD 的 AgentX 文章已经表明,KV 工作集大小和 offload 容量决定智能体负载的每 token 成本。
参考资料