AI 推理术语表
并行策略DPA

数据并行注意力

也称为 DP attention、DPA、注意力数据并行

先用大白话

DP attention 让每个 rank 处理各自的一批序列并持有自己的缓存,而不是每个 rank 都存同一份副本。

技术定义

数据并行注意力让每个 rank 在互不重叠的序列集合上各自计算注意力,因此每个 rank 拥有 KV cache 的私有份额,而专家层仍然共享。

工程细节

张量并行的注意力按 head 切分,在 head 数较少时会在各 rank 之间复制 KV 状态,浪费容量。DP attention 改为把整条序列分配给某个 rank,从而避免这种重复。各 rank 仍共同参与 MoE 集合通信,因此注意力是本地的,而专家分发仍是全局的。

为什么重要

由于每个 rank 只拥有缓存池的私有一份,请求落在哪里就成了影响性能的关键:长会话一旦被路由到不持有其前缀的 rank,就要全部重算。此时实测命中率会远低于理论上限,而原因与缓存大小毫无关系。

如何在 InferenceX 中解读

InferenceX 会在数据点 tooltip 的并行策略部分展示 DP attention。它是否有利取决于模型;当缓存局部性变成路由约束时,不启用它的配置有时反而占据前沿曲线。