MiniMax M3 428B · Chip 对比
MiniMax M3 428B — GB300 NVL72 vs MI325X
GB300 NVL72(NVIDIA Blackwell)与 MI325X(AMD CDNA 3)在 MiniMax M3 428B 上的正面 AI 推理基准测试对比。涵盖各类 LLM 工作负载的延迟、吞吐量与成本。使用下方图表控件切换序列、精度和指标——交互方式与主推理图表相同。
GB300 NVL72 在 MiniMax M3 428B 上以 56 tok/s/user 运行时达到 16377 tok/s/Chip(每百万 token $0.04);MI325X 达到 813 tok/s/Chip($0.38)。GB300 NVL72 每 token 成本低 860%;GB300 NVL72 每 Chip 吞吐量高出 1915%。
MiniMax M3 428B 在 90 tok/s/user 交互性下的吞吐量:GB300 NVL72 为 13339 tok/s/Chip,MI325X 为 560。每百万 token 成本分别为 $0.05 和 $0.55。GB300 NVL72 每 token 成本低 1034%;GB300 NVL72 每 Chip 吞吐量高出 2282%。
GB300 NVL72 / MI325X 在 MiniMax M3 428B 上以 125 tok/s/user 运行:4610 / 374 tok/s/Chip,$0.14 / $0.82 每百万 token。GB300 NVL72 每 token 成本低 487%;GB300 NVL72 每 Chip 吞吐量高出 1134%。 (数据反映此 URL 的默认 8k/1k · fp8 选择——如果您在控件中更改序列、精度或模型,下方表格和图表会自动更新。)
Interpolated from real benchmark data. Edit target interactivity values below to compare at different operating points.
| Metric | Interactivity (tok/s/user) | Interactivity (tok/s/user) | Interactivity (tok/s/user) |
|---|---|---|---|
| Throughput (tok/s/chip) | GB300 NVL72:16377.2MI325X:812.7 | GB300 NVL72:13339.1MI325X:560.0 | GB300 NVL72:4610.3MI325X:373.7 |
| Cost ($/M tok) | GB300 NVL72:$0.039MI325X:$0.376 | GB300 NVL72:$0.048MI325X:$0.546 | GB300 NVL72:$0.139MI325X:$0.818 |
| tok/s/MW | GB300 NVL72:7725089MI325X:480863 | GB300 NVL72:6292042MI325X:331354 | GB300 NVL72:2174679MI325X:221150 |
| Concurrency | GB300 NVL72:~2048MI325X:~8 | GB300 NVL72:~1019MI325X:~4 | GB300 NVL72:~60MI325X:~3 |
推理性能
不同模型、硬件配置和服务参数下的推理性能指标。
厂商:
部署模式:
投机解码: