AI 推理术语表
并行策略

Reduce-scatter

也称为 reduce scatter、归约散播

先用大白话

Reduce-scatter 把每颗芯片上对应位置的数据求和,然后让每颗芯片只保留合并结果中属于自己的那一片。

技术定义

Reduce-scatter 是一种集合操作,对所有设备贡献的张量做逐元素归约,并把归约结果按分片分发,每个设备一片。

工程细节

当每个 rank 都为同一张量计算出部分结果时,这些部分结果必须相加。Reduce-scatter 完成求和后只把下一步需要的那一片交给每个 rank,避免把完整归约张量发给所有人的浪费。一次 all-reduce 恰好等于 reduce-scatter 加 all-gather,调度器会根据下一个操作实际消费什么来选择融合形式还是拆分形式。

为什么重要

当下游只需要分片时,用 reduce-scatter 代替完整 all-reduce 能把每个 rank 的接收数据量减半。在 NVL72 这种规模下,集合通信流量与模型本身争夺互连带宽,这一点尤为重要。把这些集合操作与计算重叠,是成熟推理栈的标志性能力。

如何在 InferenceX 中解读

InferenceX 中带张量并行分片的配置在每一层 Transformer 都会触发归约类集合操作,而 CollectiveX 存在的意义正是在推理实际使用的消息尺寸上,跨厂商发布这些原语的测量结果。