GPU 排行榜
Kimi K3 2.8T

Kimi K3 最低成本 GPU 排行

GB300 NVL72 成本最低,每百万 token 仅 $0.075,比第二名 MI355X 低 21%。

测试基于AgentX coding agent 工作负载,交互速度统一设定为每用户每秒 50 token。在该工作点没有实测数据的硬件不参与排名。

Kimi K3 最低成本 GPU 排行:实时基准排行
排名GPU单 GPU 每秒 token 数每百万 token 成本精度推理引擎
1GB300 NVL728,601$0.075fp4Dynamo vLLM
2MI355X4,413$0.094fp4vLLM
3B3006,083$0.10fp4vLLM
4B2004,561$0.11fp4Dynamo vLLM
5GB200 NVL724,579$0.11fp4Dynamo vLLM

更关注速度而不是成本? 查看 Kimi K3 推理最快的 GPU

测试方法

本页所有数字都来自实测,而非纸面规格估算。InferenceX 集群使用社区推理引擎在真实硬件上部署 Kimi K3,通过扫描并发数绘制每个平台的吞吐与交互速度前沿曲线。

各平台均在同一工作点(每用户每秒 50 token)读取数据,确保在相同交互速度下进行比较。单用户速度低到无法正常使用时,即使吞吐量很高,也不能据此获得更高排名。每百万 token(输入加输出)的成本由实测吞吐量和 SemiAnalysis AI Cloud TCO 模型提供的 $/GPU/hr 费率换算得出。

推导逻辑与 InferenceX 总览排行榜共用,基准测试持续重跑,新引擎版本和新配置落地后排行会自动更新。

常见问题

运行 Kimi K3 最省钱的 GPU 是哪款?
按最新基准测试结果,GB300 NVL72 在AgentX coding agent 工作负载下成本最低,每百万 token(输入加输出)仅 $0.075,按超大规模云 $/GPU/小时 价格计算,交互速度统一设定为每用户每秒 50 token。
每百万 token 成本是如何计算的?
将每用户每秒 50 token 档位下的实测单 GPU 吞吐,按 SemiAnalysis AI Cloud TCO 模型中的超大规模云 $/GPU/小时 价格换算为每百万 token(输入加输出)成本。更慢的交互档位或更便宜的租用价格会改变绝对数值,但很少改变排名顺序。
排行多久更新一次?
基准测试在 InferenceX 集群上持续运行,本排行最新一条结果落在 2026-09-04。页面始终渲染最新数据。

继续探索数据