AMD · CDNA 3
AMD Instinct MI300X
概览
AMD Instinct MI300X 是让 AMD 真正跻身 LLM 推理市场的 CDNA 3 加速器:192 GB HBM3(带宽 5.3 TB/s),显存超过 H100 的两倍,稠密 FP8 算力 2,615 TFLOP/s。8 颗芯片通过 Infinity Fabric 全互联组网,无需交换机,单芯片 scale-up 带宽 448 GB/s。
显存优势让 MI300X 能用更少的芯片部署模型,或在每个副本中容纳更大的 KV cache,小时租价也明显低于同级 NVIDIA 产品。软件是历史上的短板:ROCm 版 vLLM 和 SGLang 已大幅缩小差距,而差距究竟缩小了多少,公开基准测试记录里一目了然。
规格参数
| 厂商 | AMD |
|---|---|
| 架构 | CDNA 3 |
| 显存(可用) | 192 GB HBM3 |
| 内存带宽 | 5.3 TB/s |
| FP4 稠密 TFLOP/s | 不支持 |
| FP8 稠密 TFLOP/s | 2,615 |
| BF16 稠密 TFLOP/s | 1,307 |
| Scale-up 互联 | Infinity Fabric |
| 单芯片 scale-up 带宽 | 448 GB/s |
| Scale-up 域规模 | 8 |
| Scale-up 拓扑 | Full Mesh |
| Scale-out 网络 | RoCEv2 Ethernet |
| 网卡 | Pollara 400GbE |
| 单芯片 TDP | 750 W |
| 单芯片整机功耗 | 1.39 kW |
| 超大规模云 $/芯片/小时 | $0.95 |
| Neocloud $/芯片/小时 | $1.16 |
| 零售档 $/芯片/小时 | $1.30 |
来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model
InferenceX 如何测试这款芯片
MI300X 是最早加入 InferenceMAX 的芯片之一,至今仍在 ROCm vLLM 与 SGLang 的持续扫描中运行,留下了所有加速器中最长的公开软件进步曲线之一:同一颗芯片,随着 kernel 与调度器的改进被连续测量了数月。
常见问题
- MI300X 云端租用每小时多少钱?
- 按 SemiAnalysis AI Cloud TCO 模型,MI300X 在超大规模云约 $0.95/小时,neocloud 档约 $1.16/小时,零售档约 $1.30/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
- MI300X 有多少显存?
- MI300X 单芯片提供 192 GB 可用 HBM3,内存带宽 5.3 TB/s;一个 8 芯片的 Infinity Fabric 域合计约 1,536 GB。
- MI300X 的功耗是多少?
- MI300X 单芯片 TDP 为 750 W,计入主机 CPU、网卡与散热分摊后整机约 1.39 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
- MI300X 支持 FP4 吗?
- 不支持。MI300X 最高支持 FP8,稠密算力 2,615 TFLOP/s;FP4 推理需要更新一代的芯片。
- MI300X 的 LLM 推理速度有多快?
- 这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 MI300X 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。
查看实时基准测试结果
以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:
通过 SemiAnalysis 行业模型深入研究
InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。