NVIDIA · Blackwell
NVIDIA GB200 NVL72
概览
NVIDIA GB200 NVL72 是机柜级系统:72 颗 Blackwell 芯片与 36 颗 Grace CPU 通过第五代 NVLink 组成单一 72 芯片域,单芯片单向带宽 900 GB/s。机柜内部没有 scale-out 网络,因为机柜本身就是计算单元,汇聚约 13.4 TB HBM3e。
这种一跳全互联的 fabric 正是 GB200 NVL72 在大型 MoE 模型 wide expert parallelism 推理中占优的原因:专家层可以分布到数十颗芯片上而无需经过 InfiniBand 或以太网。Dynamo、SGLang PD 等 prefill/decode 分离方案能自然映射到这个域上。
规格参数
| 厂商 | NVIDIA |
|---|---|
| 架构 | Blackwell |
| 显存(可用) | 186 GB HBM3e |
| 内存带宽 | 8 TB/s |
| FP4 稠密 TFLOP/s | 10,000 |
| FP8 稠密 TFLOP/s | 5,000 |
| BF16 稠密 TFLOP/s | 2,500 |
| Scale-up 互联 | NVLink 5.0 |
| 单芯片 scale-up 带宽 | 900 GB/s |
| Scale-up 域规模 | 72 |
| Scale-up 拓扑 | Switched 18-rail Optimized |
| Scale-out 网络 | 无(仅 NVLink 域内互联) |
| 网卡 | 无(仅 NVLink 域内互联) |
| 单芯片 TDP | 1,200 W |
| 单芯片整机功耗 | 1.87 kW |
| 超大规模云 $/芯片/小时 | $1.86 |
| Neocloud $/芯片/小时 | $2.26 |
| 零售档 $/芯片/小时 | $2.60 |
来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model
InferenceX 如何测试这款芯片
InferenceX 以多节点分离式配置测试 GB200 NVL72,包括前沿 MoE 模型上的 wide-EP vLLM、SGLang 与 Dynamo TRT-LLM 运行,并将结果归一化为单芯片吞吐量,使机柜级数据可与 8 芯片 HGX 节点直接对比。
常见问题
- GB200 NVL72 云端租用每小时多少钱?
- 按 SemiAnalysis AI Cloud TCO 模型,GB200 NVL72 在超大规模云约 $1.86/小时,neocloud 档约 $2.26/小时,零售档约 $2.60/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
- GB200 NVL72 有多少显存?
- GB200 NVL72 单芯片提供 186 GB 可用 HBM3e,内存带宽 8 TB/s;一个 72 芯片的 NVLink 5.0 域合计约 13,392 GB。
- GB200 NVL72 的功耗是多少?
- GB200 NVL72 单芯片 TDP 为 1,200 W,计入主机 CPU、网卡与散热分摊后整机约 1.87 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
- GB200 NVL72 支持 FP4 吗?
- 支持。GB200 NVL72 稠密 FP4 算力达 10,000 TFLOP/s(FP8 为 5,000),InferenceX 的精度对比页面持续追踪 FP4 与 FP8 的推理精度和吞吐量差异。
- GB200 NVL72 的 LLM 推理速度有多快?
- 这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 GB200 NVL72 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。
查看实时基准测试结果
以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:
通过 SemiAnalysis 行业模型深入研究
InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。