MiniMax M2.5/M2.7
MiniMax M2.7 最低成本 GPU 排行
GB200 NVL72 成本最低,每百万 token 仅 $0.041,比第二名 B200 低 0%。
测试基于单轮对话工作负载(8k 输入 / 1k 输出),交互速度统一设定为每用户每秒 50 token。在该工作点没有实测数据的硬件不参与排名。
| 排名 | GPU | 单 GPU 每秒 token 数 | 每百万 token 成本 | 精度 | 推理引擎 |
|---|---|---|---|---|---|
| 1 | GB200 NVL72 | 12,515 | $0.041 | fp4 | Dynamo vLLM |
| 2 | B200 | 11,606 | $0.041 | fp4 | vLLM |
| 3 | GB300 NVL72 | 13,707 | $0.047 | fp4 | Dynamo vLLM |
| 4 | B300 | 12,253 | $0.051 | fp4 | vLLM |
| 5 | MI355X | 7,692 | $0.054 | fp4 | vLLM |
更关注速度而不是成本? 查看 MiniMax M2.7 推理最快的 GPU
测试方法
本页所有数字都来自实测,而非纸面规格估算。InferenceX 集群使用社区推理引擎在真实硬件上部署 MiniMax M2.7,通过扫描并发数绘制每个平台的吞吐与交互速度前沿曲线。
所有平台在同一工作点(每用户每秒 50 token)读取,保证对比是等交互速度的:任何 GPU 都无法靠牺牲单用户速度换取纸面吞吐来取胜。成本按 SemiAnalysis AI Cloud TCO 模型的 $/GPU/小时 价格,把实测吞吐换算为每百万 token(输入加输出)成本。
推导逻辑与 InferenceX 总览排行榜共用,基准测试持续重跑,新引擎版本和新配置落地后排行会自动更新。
常见问题
- 运行 MiniMax M2.7 最省钱的 GPU 是哪款?
- 按最新基准测试结果,GB200 NVL72 在单轮对话工作负载(8k 输入 / 1k 输出)下成本最低,每百万 token(输入加输出)仅 $0.041,按超大规模云 $/GPU/小时 价格计算,交互速度统一设定为每用户每秒 50 token。
- 每百万 token 成本是如何计算的?
- 将每用户每秒 50 token 档位下的实测单 GPU 吞吐,按 SemiAnalysis AI Cloud TCO 模型中的超大规模云 $/GPU/小时 价格换算为每百万 token(输入加输出)成本。更慢的交互档位或更便宜的租用价格会改变绝对数值,但很少改变排名顺序。
- 排行多久更新一次?
- 基准测试在 InferenceX 集群上持续运行,本排行最新一条结果落在 2026-06-13。页面始终渲染最新数据。