AI 推理术语表
硬件RDMA

远程直接内存访问

也称为 RDMA、RoCE、GPUDirect RDMA

先用大白话

RDMA 让一台机器直接通过网络读写另一台机器的内存,两边的 CPU 都不用参与数据拷贝。

技术定义

远程直接内存访问(RDMA)是一种网络能力,由网卡在两台机器的内存之间直接搬运数据,绕过操作系统和 CPU 的拷贝开销。

工程细节

常规网络栈在两端都要经过内核缓冲区拷贝数据,消耗 CPU 周期和延迟。RDMA 网卡在已注册的内存区域之间直接传输,GPUDirect 进一步让网卡直接写入加速器的 HBM。InfiniBand 原生内置 RDMA,RoCE 则把同一套语义跑在 Ethernet 上。NCCL、RCCL 等集合通信库,以及分离式服务中的 KV cache 传输路径,都建在这些原语之上。

为什么重要

RDMA 是整个分布式 AI 栈的地板:没有它,跨节点集合通信和缓存传输早在链路跑满之前就会卡在 CPU 上。RoCE 变体让基于 Ethernet 的集群能以更低成本与 InfiniBand 竞争。

如何在 InferenceX 中解读

InferenceX 的每个多节点结果在集合通信之下都依赖 RDMA 传输,分离式配置还依赖它完成 prefill 到 decode 的 KV 搬运,因此传输层成熟度是区分相似集群结果的因素之一。