Kimi K2.5/K2.6/K2.7-Code 1TNVIDIA Hopper
在 H200 上运行 Kimi K2.6
快速结论
Kimi K2.6 可在 H200 上运行:目前已有 15 组实测配置,各档位实测结果见下方阶梯表。
实测配置数
15
推理引擎
vLLM
精度
int4
运行日期
2026-03-27 → 2026-05-30
各交互档位下的吞吐表现
推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在单轮对话工作负载(8k 输入 / 1k 输出)下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。
| 单用户速度目标 | 单 GPU 每秒 token 数 | 每百万 token 成本 | 推理引擎 | 精度 |
|---|---|---|---|---|
| 30 tok/s | - | - | - | - |
| 50 tok/s | - | - | - | - |
| 75 tok/s | - | - | - | - |
| 100 tok/s | - | - | - | - |
| 150 tok/s | - | - | - | - |
| 200 tok/s | - | - | - | - |
常见问题
- Kimi K2.6 在 H200 上能跑多快?
- InferenceX 集群已为该组合完成 15 组实测配置,各交互档位的实测结果见上方阶梯表。
- 在 H200 上部署 Kimi K2.6 的成本是多少?
- 每百万 token 成本由实测吞吐和 SemiAnalysis AI Cloud TCO 模型的 $/GPU/小时 价格换算得出,待该组合达到主交互档位后即会显示。
- 哪些推理引擎可以在 H200 上运行 Kimi K2.6?
- 本页数据来自 vLLM,精度覆盖 INT4。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
- 这些 Kimi K2.6 数据是如何测得的?
- 所有数字均由 InferenceX 集群在真实 H200 硬件上实测,通过在单轮对话工作负载(8k 输入 / 1k 输出)下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-05-30。推导方式与 InferenceX 总览排行榜完全一致。