Reduce-scatter
也称为 reduce scatter、归约散播
先用大白话
Reduce-scatter 把每颗芯片上对应位置的数据求和,然后让每颗芯片只保留合并结果中属于自己的那一片。
技术定义
Reduce-scatter 是一种集合操作,对所有设备贡献的张量做逐元素归约,并把归约结果按分片分发,每个设备一片。
工程细节
当每个 rank 都为同一张量计算出部分结果时,这些部分结果必须相加。Reduce-scatter 完成求和后只把下一步需要的那一片交给每个 rank,避免把完整归约张量发给所有人的浪费。一次 all-reduce 恰好等于 reduce-scatter 加 all-gather,调度器会根据下一个操作实际消费什么来选择融合形式还是拆分形式。
为什么重要
当下游只需要分片时,用 reduce-scatter 代替完整 all-reduce 能把每个 rank 的接收数据量减半。在 NVL72 这种规模下,集合通信流量与模型本身争夺互连带宽,这一点尤为重要。把这些集合操作与计算重叠,是成熟推理栈的标志性能力。
如何在 InferenceX 中解读
InferenceX 中带张量并行分片的配置在每一层 Transformer 都会触发归约类集合操作,而 CollectiveX 存在的意义正是在推理实际使用的消息尺寸上,跨厂商发布这些原语的测量结果。
参考资料
在真实基准中理解这一概念
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升
NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU