GPU 排行榜
Kimi K3 2.8T

Kimi K3 最快 GPU 排行

GB300 NVL72 以单 GPU 每秒 8,601 token 领先,比第二名 B300 高 41%。

测试基于AgentX coding agent 工作负载,交互速度统一设定为每用户每秒 50 token。在该工作点没有实测数据的硬件不参与排名。

Kimi K3 最快 GPU 排行:实时基准排行
排名GPU单 GPU 每秒 token 数每百万 token 成本精度推理引擎
1GB300 NVL728,601$0.075fp4Dynamo vLLM
2B3006,083$0.10fp4vLLM
3GB200 NVL724,579$0.11fp4Dynamo vLLM
4B2004,561$0.11fp4Dynamo vLLM
5MI355X4,413$0.094fp4vLLM

更关注成本而不是速度? 查看运行 Kimi K3 最省钱的 GPU

测试方法

本页所有数字都来自实测,而非纸面规格估算。InferenceX 集群使用社区推理引擎在真实硬件上部署 Kimi K3,通过扫描并发数绘制每个平台的吞吐与交互速度前沿曲线。

各平台均在同一工作点(每用户每秒 50 token)读取数据,确保在相同交互速度下进行比较。单用户速度低到无法正常使用时,即使吞吐量很高,也不能据此获得更高排名。每百万 token(输入加输出)的成本由实测吞吐量和 SemiAnalysis AI Cloud TCO 模型提供的 $/GPU/hr 费率换算得出。

推导逻辑与 InferenceX 总览排行榜共用,基准测试持续重跑,新引擎版本和新配置落地后排行会自动更新。

常见问题

Kimi K3 推理最快的 GPU 是哪款?
按最新基准测试结果,GB300 NVL72 在AgentX coding agent 工作负载下以单 GPU 每秒 8,601 token 领先,交互速度统一设定为每用户每秒 50 token。
“最快”是如何衡量的?
所有平台都在相同的交互速度档位(每用户每秒 50 token)和AgentX coding agent 工作负载下读取,再按实测单 GPU 吞吐排名。推导方式与 InferenceX 总览排行榜完全一致,因此本页排名不会与仪表盘出现分歧。
排行多久更新一次?
基准测试在 InferenceX 集群上持续运行,本排行最新一条结果落在 2026-09-04。页面始终渲染最新数据。

继续探索数据