MiniMax M3 428B · Chip 对比

MiniMax M3 428B — GB300 NVL72 vs MI325X

GB300 NVL72NVIDIA Blackwell)与 MI325XAMD CDNA 3)在 MiniMax M3 428B 上的正面 AI 推理基准测试对比。涵盖各类 LLM 工作负载的延迟、吞吐量与成本。使用下方图表控件切换序列、精度和指标——交互方式与主推理图表相同。

GB300 NVL72 在 MiniMax M3 428B 上以 56 tok/s/user 运行时达到 16377 tok/s/Chip(每百万 token $0.04);MI325X 达到 813 tok/s/Chip($0.38)。GB300 NVL72 每 token 成本低 860%;GB300 NVL72 每 Chip 吞吐量高出 1915%。

MiniMax M3 428B 在 90 tok/s/user 交互性下的吞吐量:GB300 NVL72 为 13339 tok/s/Chip,MI325X 为 560。每百万 token 成本分别为 $0.05 和 $0.55。GB300 NVL72 每 token 成本低 1034%;GB300 NVL72 每 Chip 吞吐量高出 2282%。

GB300 NVL72 / MI325X 在 MiniMax M3 428B 上以 125 tok/s/user 运行:4610 / 374 tok/s/Chip,$0.14 / $0.82 每百万 token。GB300 NVL72 每 token 成本低 487%;GB300 NVL72 每 Chip 吞吐量高出 1134%。 (数据反映此 URL 的默认 8k/1k · fp8 选择——如果您在控件中更改序列、精度或模型,下方表格和图表会自动更新。)

查看每美元性能对比 →

Interpolated from real benchmark data. Edit target interactivity values below to compare at different operating points.
Metric
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Throughput (tok/s/chip)
GB300 NVL72:16377.2MI325X:812.7
GB300 NVL72:13339.1MI325X:560.0
GB300 NVL72:4610.3MI325X:373.7
Cost ($/M tok)
GB300 NVL72:$0.039MI325X:$0.376
GB300 NVL72:$0.048MI325X:$0.546
GB300 NVL72:$0.139MI325X:$0.818
tok/s/MW
GB300 NVL72:7725089MI325X:480863
GB300 NVL72:6292042MI325X:331354
GB300 NVL72:2174679MI325X:221150
Concurrency
GB300 NVL72:~2048MI325X:~8
GB300 NVL72:~1019MI325X:~4
GB300 NVL72:~60MI325X:~3

推理性能

不同模型、硬件配置和服务参数下的推理性能指标。

厂商:
部署模式:
投机解码: