AI 推理术语表
软件栈

TPU-Sync

也称为 TPU-Sync、TPU-raiden、tpu-sync、TPU KV 传输库

先用大白话

TPU-Sync 是 Google 用来在 TPU 之间以及向主机内存搬运 KV cache 的库,是分离式服务和 offload 所需的底层管道。

技术定义

TPU-Sync(原名 TPU-raiden)是 Google 开源的 TPU 分离式 KV cache 传输库,通过提取原生 PJRTBuffer 硬件描述符实现零拷贝传输。

工程细节

prefill-decode 分离需要一条快速通路,把完成 prefill 的 KV cache 从一组芯片搬到另一组;KV cache offload 需要 HBM 与主机 DRAM 之间的往返通路。TPU-Sync 同时提供两者。它原生支持 JAX 和 TorchTPU 栈,并支持原生 TPU KV cache DRAM offload,用于 HBM 放不下所有用户 cache 的大模型和中大 batch 场景。Google 内部为 Gemini 运行分离式服务已有多年,对外开放的工作在 Official Preview 发布前几个月才开始,与 llm-d 的 TPU 支持同步推进。

为什么重要

没有传输库,TPU 外部服务只能停留在聚合模式,这正是当前结果所处的位置,也是 GB200 和 GB300 NVL72 分离式服务目前在部分曲线上领先的原因。SemiAnalysis 预期 TPU 上的 Mooncake Store 支持会基于 TPU-Sync 的原语实现。

如何在 InferenceX 中解读

InferenceX Official Preview 比较的是 TPUv7 聚合服务与 B200、B300 聚合服务。基于 TPU-Sync 的分离式服务在外部栈中优化完成后,TPUv7 分离式与 GB200、GB300 NVL72 分离式的对比将在后续文章发布。