全部 AI 推理芯片
NVIDIA · Blackwell

NVIDIA B200

概览

NVIDIA B200 是 Blackwell 一代的主力数据中心芯片:180 GB 可用 HBM3e(带宽 8 TB/s)、单芯片 900 GB/s 的 NVLink 5.0,Tensor Core 每时钟吞吐量翻倍于 Hopper 并新增 FP4。稠密算力 9,000 FP4 / 4,500 FP8 TFLOP/s,在主导 LLM decode 的内存带宽受限场景中,单颗 B200 的表现超过两颗 H100。

NVFP4 推理正是在 B200 上成为主流:前沿开源模型发布 FP4 checkpoint,精度与 FP8 相差无几,单芯片吞吐量却接近翻倍。它 1,000 W 的 TDP 和约 1.7 kW 的整机功耗使小时租价远高于 Hopper,因此升级决策取决于每美元性能而非峰值算力。

规格参数

厂商NVIDIA
架构Blackwell
显存(可用)180 GB HBM3e
内存带宽8 TB/s
FP4 稠密 TFLOP/s9,000
FP8 稠密 TFLOP/s4,500
BF16 稠密 TFLOP/s2,250
Scale-up 互联NVLink 5.0
单芯片 scale-up 带宽900 GB/s
Scale-up 域规模8
Scale-up 拓扑Switched 2-rail Optimized
Scale-out 网络gIB RoCEv2 Ethernet
网卡ConnectX-7 400GbE
单芯片 TDP1,000 W
单芯片整机功耗1.71 kW
超大规模云 $/芯片/小时$1.73
Neocloud $/芯片/小时$2.07
零售档 $/芯片/小时$2.60

来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model

InferenceX 如何测试这款芯片

B200 是 InferenceX 上测试最密集的芯片之一:每日在 vLLM、SGLang、TensorRT-LLM 和 Dynamo 分离式推理上运行固定序列扫描与 AgentX agentic 编码 trace,每美元性能与精度对比页面持续追踪每个模型上 NVFP4 与 FP8 的差距。

常见问题

B200 云端租用每小时多少钱?
按 SemiAnalysis AI Cloud TCO 模型,B200 在超大规模云约 $1.73/小时,neocloud 档约 $2.07/小时,零售档约 $2.60/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
B200 有多少显存?
B200 单芯片提供 180 GB 可用 HBM3e,内存带宽 8 TB/s;一个 8 芯片的 NVLink 5.0 域合计约 1,440 GB。
B200 的功耗是多少?
B200 单芯片 TDP 为 1,000 W,计入主机 CPU、网卡与散热分摊后整机约 1.71 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
B200 支持 FP4 吗?
支持。B200 稠密 FP4 算力达 9,000 TFLOP/s(FP8 为 4,500),InferenceX 的精度对比页面持续追踪 FP4 与 FP8 的推理精度和吞吐量差异。
B200 的 LLM 推理速度有多快?
这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 B200 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。

查看实时基准测试结果

以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:

通过 SemiAnalysis 行业模型深入研究

InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。