AI 推理术语表
并行策略CP

上下文并行

也称为 context parallelism、PCP、DCP、序列并行

先用大白话

上下文并行把一条长提示词拆到多颗芯片上,让它们分担读取提示词和扫描注意力状态的工作。

技术定义

上下文并行把 query token 切分到多个加速器上,用于 prefill 的形式称为 PCP,用于 decode 的形式称为 DCP。

工程细节

PCP 让每个 rank 处理一段 query,keys 和 values 以环形方式传递,从而并行化计算受限的 prefill,也避免某个 rank 独自承担整条长提示词。DCP 则切分 KV cache 本身,每个 rank 扫描各自分片,再以 flash-decode 方式合并部分注意力结果;由于 decode 受显存带宽限制,并行读取 KV 可以提高可达 token 速率。

为什么重要

张量并行会在每个 rank 上复制完整 KV cache,数据并行注意力则把会话绑定在持有其分片的 rank 上,两者在上下文达到几十万 token 时都难以扩展。上下文并行直接针对这一点,而且收益随输入长度增长,而不是随 batch 大小增长。

如何在 InferenceX 中解读

InferenceX 在数据点 tooltip 和并行标签中与 TP、EP、DP 一起展示 DCP 与 PCP 的并行度。各厂商支持程度并不均衡:在 AgentX 1.0 结果发布时,vLLM 支持矩阵中 AMD 的注意力后端仍标为不支持,因此该技术仍构成 CUDA 实际优势的一部分。