NVL72
也称为 NVL72、GB200 NVL72、GB300 NVL72、Vera Rubin NVL72、机架级系统
先用大白话
NVL72 是一个机架,其中 72 个加速器共享同一张高速网络,因而更像一台大机器而不是一个集群。
技术定义
NVL72 是 NVIDIA 的机架级系统,把 72 个加速器放进同一个 NVLink scale-up 域,而不是分散在多个八芯片节点中。
工程细节
NVL72 描述的是 NVLink 域的规模,并不限定某一代芯片或固定带宽。GB200 和 GB300 使用 Blackwell 世代硬件及 NVLink 5;Vera Rubin 则组合 Rubin GPU、Vera CPU 和 NVLink 6 Switch。比较时应查看具体平台,不能把 Blackwell 规格套用到所有 NVL72 机架。
为什么重要
开销以集合通信为主的技术,在大规模 scale-up 域中经济性会发生变化。宽专家并行把专家分散到许多芯片上,每个 token 都要付出 all-to-all 流量;在 scale-up 带宽下这可以承受,在 scale-out 网络上往往不行。
如何在 InferenceX 中解读
机架级优势并非自动成立。更高的单芯片成本必须被赚回来,而在 agentic 流量下,编排层可能比网络更早成为瓶颈;因此对于不怎么用到宽并行的模型,NVL72 配置在按 TCO 归一化的吞吐量上有时会落后于八芯片节点。
参考资料
在真实基准中理解这一概念
GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍
DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。
GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升
NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72
AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力
OpenAI Jalapeño:比 NVIDIA Blackwell 更强
OpenAI 自研 ASIC 对比 Rubin:Jalapeño 的 TCO、每兆瓦吞吐量,以及那些够辣的细节
Rubin NVL72 Agentic 推理:每美元性能提升至 67 倍
Jensen 再次低估性能,每吉瓦年利润超过两倍,买得越多赚得越多,AgentX、InferenceX 与深度协同设计