NVIDIA · Hopper
NVIDIA H100 SXM
概览
NVIDIA H100 SXM 是 Hopper 一代的数据中心加速器,支撑了第一波大规模 LLM 部署。每颗芯片配备 80 GB HBM3(带宽 3.35 TB/s)和第四代 Tensor Core,稠密 FP8 算力达 1,979 TFLOP/s;8 颗芯片通过 NVLink 4.0 组成节点,单芯片互联带宽 450 GB/s。
H100 仍是衡量其他加速器的基准线:它拥有所有 AI 芯片中最成熟的软件生态、最广泛的云端供应,以及 NVIDIA 产品线中最低的小时租价。它没有 FP4 Tensor Core,因此在适用 NVFP4 的量化推理场景中会落后于更新的 Blackwell 产品。
规格参数
| 厂商 | NVIDIA |
|---|---|
| 架构 | Hopper |
| 显存(可用) | 80 GB HBM3 |
| 内存带宽 | 3.35 TB/s |
| FP4 稠密 TFLOP/s | 不支持 |
| FP8 稠密 TFLOP/s | 1,979 |
| BF16 稠密 TFLOP/s | 989 |
| Scale-up 互联 | NVLink 4.0 |
| 单芯片 scale-up 带宽 | 450 GB/s |
| Scale-up 域规模 | 8 |
| Scale-up 拓扑 | Switched 4-rail Optimized |
| Scale-out 网络 | RoCEv2 Ethernet |
| 网卡 | ConnectX-7 2x200GbE |
| 单芯片 TDP | 700 W |
| 单芯片整机功耗 | 1.37 kW |
| 超大规模云 $/芯片/小时 | $1.17 |
| Neocloud $/芯片/小时 | $1.55 |
| 零售档 $/芯片/小时 | $1.78 |
来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model
InferenceX 如何测试这款芯片
InferenceX 在 vLLM、SGLang 和 TensorRT-LLM 上对 H100 进行持续测试,覆盖固定序列服务与长上下文 agentic trace,发布吞吐量-交互性 Pareto 前沿、每百万 token 成本和每 token 能耗,并与每一代新芯片并列展示,让升级收益始终有数可查。
常见问题
- H100 云端租用每小时多少钱?
- 按 SemiAnalysis AI Cloud TCO 模型,H100 在超大规模云约 $1.17/小时,neocloud 档约 $1.55/小时,零售档约 $1.78/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
- H100 有多少显存?
- H100 单芯片提供 80 GB 可用 HBM3,内存带宽 3.35 TB/s;一个 8 芯片的 NVLink 4.0 域合计约 640 GB。
- H100 的功耗是多少?
- H100 单芯片 TDP 为 700 W,计入主机 CPU、网卡与散热分摊后整机约 1.37 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
- H100 支持 FP4 吗?
- 不支持。H100 最高支持 FP8,稠密算力 1,979 TFLOP/s;FP4 推理需要更新一代的芯片。
- H100 的 LLM 推理速度有多快?
- 这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 H100 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。
查看实时基准测试结果
以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:
通过 SemiAnalysis 行业模型深入研究
InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。