AI 推理术语表
硬件

NVL72

也称为 NVL72、GB200 NVL72、GB300 NVL72、机架级系统

先用大白话

NVL72 是一个机架,其中 72 个加速器共享同一张高速网络,因而更像一台大机器而不是一个集群。

技术定义

NVL72 是 NVIDIA 的机架级系统,把 72 个加速器放进同一个 NVLink scale-up 域,而不是分散在多个八芯片节点中。

工程细节

仪表板的规格数据记录为 NVLink 5.0、每颗芯片 900 GB/s 单向带宽、scale-up world size 为 72,并通过 NVSwitch 交换。常规节点把同样的带宽限定在八颗芯片之间,超出后就要退回更慢的 scale-out 网络,因此差别不在于原始速度,而在于换用另一种网络之前能触及多少颗芯片。

为什么重要

开销以集合通信为主的技术,在大规模 scale-up 域中经济性会发生变化。宽专家并行把专家分散到许多芯片上,每个 token 都要付出 all-to-all 流量;在 scale-up 带宽下这可以承受,在 scale-out 网络上往往不行。

如何在 InferenceX 中解读

机架级优势并非自动成立。更高的单芯片成本必须被赚回来,而在 agentic 流量下,编排层可能比网络更早成为瓶颈;因此对于不怎么用到宽并行的模型,NVL72 配置在按 TCO 归一化的吞吐量上有时会落后于八芯片节点。