并行策略PP
流水线并行
也称为 pipeline parallelism、PP、层间并行
先用大白话
流水线并行让每颗芯片负责一部分层,沿链条传递激活值,而不是把每一层都切开。
技术定义
流水线并行按层切分模型并分配到多个加速器上,每个阶段执行自己的层,并把激活值传给下一个阶段。
工程细节
通信是阶段边界处激活值的点对点交接,比张量并行所需的逐层集合通信便宜得多。代价是空闲:只有一条请求在途时,除当前阶段外其余阶段都在等待,只有持续的并发流量才能把流水线填满。
为什么重要
对最大的那批模型来说,这首先是容量手段,其次才是提速手段。有些前沿模型根本装不进单个节点,流水线并行才让它们可服务;当某项竞争性优化拒绝与任何方案组合时,它甚至是唯一选项。
如何在 InferenceX 中解读
InferenceX 在数据点 tooltip 和并行标签中与 TP、EP、DP 一起展示流水线并行度,且仅在大于 1 时显示。可组合性与并行度同样重要:一种会导致投机解码无法启用的阶段切分,代价可能超过它节省的显存。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM