软件栈NCCL
NCCL
也称为 RCCL、NVIDIA 集合通信库
先用大白话
NCCL 是 NVIDIA 的集合通信库,在集合操作中负责芯片之间的数据搬运,RCCL 是 AMD 的对应实现。
技术定义
NCCL 是 NVIDIA 的集合通信库,在节点内经 NVLink、节点间经 RDMA 网络实现 all-reduce、all-gather、all-to-all 等跨 GPU 操作。
工程细节
框架不直接操作互连,而是调用一个集合通信库,由它发现拓扑并为每种消息尺寸选择算法和信道调度。NVIDIA 系统由 NCCL 负责,AMD 维护接口对齐的 RCCL 服务 ROCm 平台。调优是针对具体网络的:ring 与 tree 算法、协议阈值、信道数都随拓扑变化,同一模型在两个集群上的通信行为可能大不相同。
为什么重要
每个多芯片推理和训练任务都站在这一层之上,集合通信的回退会悄无声息地向整个集群征税。NCCL 与 RCCL 的接口兼容性同样至关重要,引擎可以面向同一套集合通信 API 覆盖多家厂商。
如何在 InferenceX 中解读
InferenceX 的多芯片配置在每个张量并行和专家并行层都在调用这些库,而 CollectiveX 在推理相关的消息尺寸上跨厂商直接测量底层集合通信性能,把网络行为与模型行为分离开。
参考资料
在真实基准中理解这一概念
GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升
NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton