全部 AI 推理芯片
NVIDIA · Blackwell

NVIDIA GB300 NVL72

概览

NVIDIA GB300 NVL72 是 Blackwell Ultra 机柜:72 颗芯片各配 278 GB 可用 HBM3e,整柜约 20 TB 显存,单芯片稠密 FP4 算力 15,000 TFLOP/s,NVLink 5.0 域与 GB200 NVL72 相同为 72 路。FP8 与 BF16 吞吐量沿用 GB200,Ultra 的提升集中在 FP4 和显存。

单芯片显存的增加在机柜尺度上被进一步放大:更大的前沿 MoE 模型、更长的上下文和更大的 KV 工作集都能常驻而不外溢;相应地每颗芯片 TDP 提高到 1,400 W 以支撑更大的 HBM 堆栈。在 Vera Rubin 之前,GB300 NVL72 是 NVIDIA 推理产品线的当前顶点。

规格参数

厂商NVIDIA
架构Blackwell
显存(可用)278 GB HBM3e
内存带宽8 TB/s
FP4 稠密 TFLOP/s15,000
FP8 稠密 TFLOP/s5,000
BF16 稠密 TFLOP/s2,500
Scale-up 互联NVLink 5.0
单芯片 scale-up 带宽900 GB/s
Scale-up 域规模72
Scale-up 拓扑Switched 18-rail Optimized
Scale-out 网络无(仅 NVLink 域内互联)
网卡无(仅 NVLink 域内互联)
单芯片 TDP1,400 W
单芯片整机功耗2.12 kW
超大规模云 $/芯片/小时$2.31
Neocloud $/芯片/小时$2.79
零售档 $/芯片/小时$3.30

来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model

InferenceX 如何测试这款芯片

InferenceX 在前沿 MoE 模型上以分离式与 wide-EP 配置测试 GB300 NVL72;AgentX agentic 编码基准将这个机柜作为参考上限,用来衡量 AMD MI355X ATOM 结果与更小的 NVIDIA 节点。

常见问题

GB300 NVL72 云端租用每小时多少钱?
按 SemiAnalysis AI Cloud TCO 模型,GB300 NVL72 在超大规模云约 $2.31/小时,neocloud 档约 $2.79/小时,零售档约 $3.30/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
GB300 NVL72 有多少显存?
GB300 NVL72 单芯片提供 278 GB 可用 HBM3e,内存带宽 8 TB/s;一个 72 芯片的 NVLink 5.0 域合计约 20,016 GB。
GB300 NVL72 的功耗是多少?
GB300 NVL72 单芯片 TDP 为 1,400 W,计入主机 CPU、网卡与散热分摊后整机约 2.12 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
GB300 NVL72 支持 FP4 吗?
支持。GB300 NVL72 稠密 FP4 算力达 15,000 TFLOP/s(FP8 为 5,000),InferenceX 的精度对比页面持续追踪 FP4 与 FP8 的推理精度和吞吐量差异。
GB300 NVL72 的 LLM 推理速度有多快?
这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 GB300 NVL72 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。

查看实时基准测试结果

以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:

通过 SemiAnalysis 行业模型深入研究

InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。