全部 AI 推理芯片
NVIDIA · Hopper

NVIDIA H200 SXM

概览

NVIDIA H200 SXM 是 Hopper 的大内存版本:稠密 FP8 算力与 H100 相同(1,979 TFLOP/s),但配备 141 GB HBM3e,带宽 4.8 TB/s。大 76% 的显存和高 43% 的带宽对长上下文服务和大 KV cache 最为关键,而这恰恰是 H100 最先遇到瓶颈的场景。

在内存受限的 decode 工作负载中,H200 以相近的小时租价提供明显高于 H100 的单芯片 token 吞吐量,这也是 Blackwell 上市后它仍是 Hopper 出货主力的原因。与 H100 一样,它不支持 FP4,推理精度以 FP8 和 INT4 仅权重量化为主。

规格参数

厂商NVIDIA
架构Hopper
显存(可用)141 GB HBM3e
内存带宽4.8 TB/s
FP4 稠密 TFLOP/s不支持
FP8 稠密 TFLOP/s1,979
BF16 稠密 TFLOP/s989
Scale-up 互联NVLink 4.0
单芯片 scale-up 带宽450 GB/s
Scale-up 域规模8
Scale-up 拓扑4-rail 优化交换拓扑
Scale-out 网络InfiniBand NDR
网卡ConnectX-7 400G
单芯片 TDP700 W
单芯片综合功耗1.37 kW
自有 - 超大规模云大批量 $/芯片/小时$1.22
零售档 $/芯片/小时$2.90

左右滑动可查看全部规格参数。

来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model

InferenceX 如何测试这款芯片

InferenceX 每日在 vLLM、SGLang 和 TensorRT-LLM 上对 H200 进行基准测试,对比页面将 H200 FP8 与 B200 NVFP4、AMD MI325X 并列呈现,让 Hopper 到 Blackwell、NVIDIA 到 AMD 的取舍以实测数据为准。

常见问题

H200 云端租用每小时多少钱?
按 SemiAnalysis AI Cloud TCO 模型,H200 按超大规模云厂商大批量采购价自有约 $1.22/小时,零售档约 $2.90/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
H200 有多少显存?
H200 单芯片提供 141 GB 可用 HBM3e,内存带宽 4.8 TB/s;一个 8 芯片的 NVLink 4.0 域合计约 1,128 GB。
H200 的功耗是多少?
H200 的单芯片 TDP 为 700 W。计入主机 CPU、网卡和散热的分摊功耗后,每颗芯片对应的总功耗约为 1.37 kW。InferenceX 按这一口径计算每 token 能耗。
H200 支持 FP4 吗?
不支持。H200 最高支持 FP8,稠密算力 1,979 TFLOP/s;FP4 推理需要更新一代的芯片。
H200 的 LLM 推理速度有多快?
这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 H200 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。

查看实时基准测试结果

以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:

通过 SemiAnalysis 行业模型深入研究

InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。