上下文并行
也称为 context parallelism、PCP、DCP、序列并行
先用大白话
上下文并行把一条长提示词拆到多颗芯片上,让它们分担读取提示词和扫描注意力状态的工作。
技术定义
上下文并行把 query token 切分到多个加速器上,用于 prefill 的形式称为 PCP,用于 decode 的形式称为 DCP。
工程细节
PCP 让每个 rank 处理一段 query,keys 和 values 以环形方式传递,从而并行化计算受限的 prefill,也避免某个 rank 独自承担整条长提示词。DCP 则切分 KV cache 本身,每个 rank 扫描各自分片,再以 flash-decode 方式合并部分注意力结果;由于 decode 受显存带宽限制,并行读取 KV 可以提高可达 token 速率。
为什么重要
张量并行会在每个 rank 上复制完整 KV cache,数据并行注意力则把会话绑定在持有其分片的 rank 上,两者在上下文达到几十万 token 时都难以扩展。上下文并行直接针对这一点,而且收益随输入长度增长,而不是随 batch 大小增长。
如何在 InferenceX 中解读
InferenceX 在数据点 tooltip 和并行标签中与 TP、EP、DP 一起展示 DCP 与 PCP 的并行度。各厂商支持程度并不均衡:在 AgentX 1.0 结果发布时,vLLM 支持矩阵中 AMD 的注意力后端仍标为不支持,因此该技术仍构成 CUDA 实际优势的一部分。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload