硬件RDMA
远程直接内存访问
也称为 RDMA、RoCE、GPUDirect RDMA
先用大白话
RDMA 让一台机器直接通过网络读写另一台机器的内存,两边的 CPU 都不用参与数据拷贝。
技术定义
远程直接内存访问(RDMA)是一种网络能力,由网卡在两台机器的内存之间直接搬运数据,绕过操作系统和 CPU 的拷贝开销。
工程细节
常规网络栈在两端都要经过内核缓冲区拷贝数据,消耗 CPU 周期和延迟。RDMA 网卡在已注册的内存区域之间直接传输,GPUDirect 进一步让网卡直接写入加速器的 HBM。InfiniBand 原生内置 RDMA,RoCE 则把同一套语义跑在 Ethernet 上。NCCL、RCCL 等集合通信库,以及分离式服务中的 KV cache 传输路径,都建在这些原语之上。
为什么重要
RDMA 是整个分布式 AI 栈的地板:没有它,跨节点集合通信和缓存传输早在链路跑满之前就会卡在 CPU 上。RoCE 变体让基于 Ethernet 的集群能以更低成本与 InfiniBand 竞争。
如何在 InferenceX 中解读
InferenceX 的每个多节点结果在集合通信之下都依赖 RDMA 传输,分离式配置还依赖它完成 prefill 到 decode 的 KV 搬运,因此传输层成熟度是区分相似集群结果的因素之一。
参考资料
在真实基准中理解这一概念
GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍
DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8
DeepSeek V4 Pro 的 AgentX 结果:GB200 与 GB300 的机架级分离式部署
两者都依赖 PD 分离,GB300 额外使用 DEP32 宽专家并行解码,而差距体现在首 token 延迟而非 token 速率上