Kimi K3 2.8T
Kimi K3 最快 GPU 排行
GB300 NVL72 以单 GPU 每秒 8,601 token 领先,比第二名 B300 高 41%。
测试基于AgentX coding agent 工作负载,交互速度统一设定为每用户每秒 50 token。在该工作点没有实测数据的硬件不参与排名。
| 排名 | GPU | 单 GPU 每秒 token 数 | 每百万 token 成本 | 精度 | 推理引擎 |
|---|---|---|---|---|---|
| 1 | GB300 NVL72 | 8,601 | $0.075 | fp4 | Dynamo vLLM |
| 2 | B300 | 6,083 | $0.10 | fp4 | vLLM |
| 3 | GB200 NVL72 | 4,579 | $0.11 | fp4 | Dynamo vLLM |
| 4 | B200 | 4,561 | $0.11 | fp4 | Dynamo vLLM |
| 5 | MI355X | 4,413 | $0.094 | fp4 | vLLM |
更关注成本而不是速度? 查看运行 Kimi K3 最省钱的 GPU
测试方法
本页所有数字都来自实测,而非纸面规格估算。InferenceX 集群使用社区推理引擎在真实硬件上部署 Kimi K3,通过扫描并发数绘制每个平台的吞吐与交互速度前沿曲线。
各平台均在同一工作点(每用户每秒 50 token)读取数据,确保在相同交互速度下进行比较。单用户速度低到无法正常使用时,即使吞吐量很高,也不能据此获得更高排名。每百万 token(输入加输出)的成本由实测吞吐量和 SemiAnalysis AI Cloud TCO 模型提供的 $/GPU/hr 费率换算得出。
推导逻辑与 InferenceX 总览排行榜共用,基准测试持续重跑,新引擎版本和新配置落地后排行会自动更新。
常见问题
- Kimi K3 推理最快的 GPU 是哪款?
- 按最新基准测试结果,GB300 NVL72 在AgentX coding agent 工作负载下以单 GPU 每秒 8,601 token 领先,交互速度统一设定为每用户每秒 50 token。
- “最快”是如何衡量的?
- 所有平台都在相同的交互速度档位(每用户每秒 50 token)和AgentX coding agent 工作负载下读取,再按实测单 GPU 吞吐排名。推导方式与 InferenceX 总览排行榜完全一致,因此本页排名不会与仪表盘出现分歧。
- 排行多久更新一次?
- 基准测试在 InferenceX 集群上持续运行,本排行最新一条结果落在 2026-09-04。页面始终渲染最新数据。