数据并行注意力
也称为 DP attention、DPA、注意力数据并行
先用大白话
DP attention 让每个 rank 处理各自的一批序列并持有自己的缓存,而不是每个 rank 都存同一份副本。
技术定义
数据并行注意力让每个 rank 在互不重叠的序列集合上各自计算注意力,因此每个 rank 拥有 KV cache 的私有份额,而专家层仍然共享。
工程细节
张量并行的注意力按 head 切分,在 head 数较少时会在各 rank 之间复制 KV 状态,浪费容量。DP attention 改为把整条序列分配给某个 rank,从而避免这种重复。各 rank 仍共同参与 MoE 集合通信,因此注意力是本地的,而专家分发仍是全局的。
为什么重要
由于每个 rank 只拥有缓存池的私有一份,请求落在哪里就成了影响性能的关键:长会话一旦被路由到不持有其前缀的 rank,就要全部重算。此时实测命中率会远低于理论上限,而原因与缓存大小毫无关系。
如何在 InferenceX 中解读
InferenceX 会在数据点 tooltip 的并行策略部分展示 DP attention。它是否有利取决于模型;当缓存局部性变成路由约束时,不启用它的配置有时反而占据前沿曲线。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升
NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU