AI 推理术语表
并行策略

KV head 复制

也称为 KV head replication、KV head 复制、复制 KV head、KV head 冗余

先用大白话

KV head 复制在模型的 KV head 数量少于所切分的设备数量时,把相同的 key-value head 复制到多个张量并行 rank 上。

技术定义

KV head 复制是一种张量并行策略:当张量并行度超过 grouped-query attention 层的 KV head 数量时,把 key 和 value head 复制到各个 rank 上,让每个 rank 无需通信就能拿到本地 query head 所需的 KV 数据。

工程细节

Qwen3.5 有 32 个 query head 和 2 个共享 KV head。TP8 下每个设备分到 4 个 query head,但 2 个 KV head 无法均分到 8 个设备:每个 KV head 被 16 个 query head 共享,因此有 4 个设备需要同一份 KV 数据。在每个 rank 上复制两个 KV head 可以避免对 KV 张量做 all-to-all 交换,代价是每个 rank 都重复保存 KV cache。vLLM 早已支持这一行为,TPU 后端需要一个兼容性修复来启用它。

为什么重要

高并发下的替代方案是 DP attention:每个设备处理不同的请求子集,并为这些请求保存两个 KV head,这样 KV 内存不会在 rank 之间重复,而体积更大的专家权重仍通过专家并行切分。Ironwood 服务在低并发下使用 TP8 attention,在高并发下使用 DP8 加 EP8。

如何在 InferenceX 中解读

启用复制消除了 Qwen3.5 397B TorchTPU bring-up 中不必要的 All-to-All 通信。切换到 TP8 attention 加专家并行的低并发调优让 1k1k 在并发 4 下提高 22.9%,在并发 8 下提高 18.1%。