任意模型在任意 GPU 上的实测结果
选一个模型和一款 GPU:下面每个页面都会回答它能跑多快、每百万 token 成本多少、以及数字出自哪个推理引擎,数据来自真实硬件上持续重跑的基准测试。
DeepSeek V4 Pro
8 款 GPU- DeepSeek V4 Pro 运行在 H200实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 B200实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 B300实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 GB200 NVL72实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 GB300 NVL72实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 MI300X实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 MI325X实测吞吐量、延迟与成本
- DeepSeek V4 Pro 运行在 MI355X实测吞吐量、延迟与成本
DeepSeek V4.1 Flash
7 款 GPUDeepSeek R1
9 款 GPUKimi K3
6 款 GPUKimi K2.6
8 款 GPUGLM-5
7 款 GPUGLM-5.3
7 款 GPUMiniMax M3
9 款 GPUMiniMax M2.7
9 款 GPU- MiniMax M2.7 运行在 H100实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 H200实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 B200实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 B300实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 GB200 NVL72实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 GB300 NVL72实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 MI300X实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 MI325X实测吞吐量、延迟与成本
- MiniMax M2.7 运行在 MI355X实测吞吐量、延迟与成本