InferenceX🎃bySemiAnalysis logo
首页AgentX新总览仪表板性能对比技术文章关于
Star1,799EN
SemiAnalysis logo

InferenceX 持续开展开源的 agentic 推理基准测试,发布来自真实环境、可复现、可审计的性能数据,并获得 OpenAI、Meta、Oracle、Microsoft 等万亿美元级 AI 基础设施运营方的信赖。

SemiAnalysis

SemiAnalysis 官网订阅通讯关于 SemiAnalysis

法律信息

原住民传统领地声明隐私政策Cookie 政策

参与贡献

基准测试仓库AgentX 测试框架可视化工具

更多

业界评价AgentX遥测数据技术文章白皮书API 文档历史趋势TCO 计算器集群生命周期首 token 延迟约束前缀缓存复用芯片可靠性芯片规格仪表板每美元性能模型架构AI 推理术语表芯片规格与价格GPU 排行榜模型在 GPU 上的实测结果

如果这些数据对您的工作有帮助,欢迎在 GitHub 上点个 Star,或分享给同事。

© 2026 semianalysis.com. 版权所有。

Kimi K2.5/K2.6/K2.7-Code 1T · 芯片对比

Kimi K2.5/K2.6/K2.7-Code 1T — GB200 NVL72 与 GB300 NVL72

对比 GB200 NVL72(NVIDIA Blackwell)与 GB300 NVL72(NVIDIA Blackwell)在 Kimi K2.5/K2.6/K2.7-Code 1T 上的 AI 推理基准测试结果,涵盖不同 LLM 工作负载下的延迟、吞吐量和成本。可通过下方图表控件切换序列长度、精度和指标,操作方式与主推理图表相同。

64 tok/s/user 接近 26–180 tok/s/user 交互性区间的下限。在这一运行点,GB200 NVL72 运行 Kimi K2.5/K2.6/K2.7-Code 1T 的吞吐量为 8980 tok/s/chip,每百万 token 成本为 $0.06;GB300 NVL72 的吞吐量为 9986 tok/s/chip,每百万 token 成本为 $0.06。GB200 NVL72 的成本效率高出 12%;GB300 NVL72 的单芯片吞吐量高出 11%。

将 Kimi K2.5/K2.6/K2.7-Code 1T 的目标交互性设为 103 tok/s/user 时,GB200 NVL72 的吞吐量为 1545 tok/s/chip,每百万 token 成本为 $0.33;GB300 NVL72 的吞吐量为 1685 tok/s/chip,每百万 token 成本为 $0.38。GB200 NVL72 的成本效率高出 14%;GB300 NVL72 的单芯片吞吐量高出 9%。

当 Kimi K2.5/K2.6/K2.7-Code 1T 的目标交互性为 141 tok/s/user 时,GB200 NVL72 的吞吐量为 733 tok/s/chip,每百万 token 成本为 $0.70;GB300 NVL72 的吞吐量为 771 tok/s/chip,每百万 token 成本为 $0.83。GB200 NVL72 的成本效率高出 18%;GB300 NVL72 的单芯片吞吐量高出 5%。 (以上数据基于此 URL 对应的默认 8k/1k · fp4 配置;在控件中切换序列长度、精度或模型后,下方表格和图表会同步更新。)

查看每美元性能对比 →

数据由真实基准测试结果插值得出。调整下方的目标交互性数值,即可比较不同运行点。
指标
交互性(tok/s/user)
交互性(tok/s/user)
交互性(tok/s/user)
吞吐量(tok/s/chip)
GB200 NVL72:8979.7GB300 NVL72:9986.1
GB200 NVL72:1545.4GB300 NVL72:1684.6
GB200 NVL72:732.9GB300 NVL72:771.5
成本($/M tok)
GB200 NVL72:$0.058GB300 NVL72:$0.064
GB200 NVL72:$0.334GB300 NVL72:$0.381
GB200 NVL72:$0.705GB300 NVL72:$0.832
tok/s/MW
GB200 NVL72:4801979GB300 NVL72:4710439
GB200 NVL72:826425GB300 NVL72:794621
GB200 NVL72:391932GB300 NVL72:363913
并发数
GB200 NVL72:~1203GB300 NVL72:~1146
GB200 NVL72:~167GB300 NVL72:~68
GB200 NVL72:~27GB300 NVL72:~27

推理性能

不同模型、硬件配置和服务参数下,来自 AgentX 场景的智能体推理指标与固定序列推理指标。

基准测试配置
8K / 1K
图表配置
交互性
对比历史趋势

Kimi K2.5/2.6/2.7-Code 1T 8K / 1K 每 1 美元 TCO 对应的总 token 数 vs. 交互性

成本层级:
自有 - 超大规模云大批量
来源:
SemiAnalysis InferenceX™

TCO $/chip/hr: 3.61 1.17 1.22 1.73 2.26 1.86 2.31 0.95 1.1 1.5 0.68 1.27 1.03

来源: SemiAnalysis Market July 2026 Pricing Surveys & AI Cloud TCO Model

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算每百万 token 成本,而非按芯片总数计算。因此,与聚合配置进行token 成本的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算输入吞吐量,而非按芯片总数计算。因此,与聚合配置进行输入吞吐量的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算输出吞吐量,而非按芯片总数计算。因此,与聚合配置进行输出吞吐量的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算功耗,而非按芯片总数计算。因此,与聚合配置进行功耗的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算能耗,而非按芯片总数计算。因此,与聚合配置进行每 token 能耗的直接对比并不完全等价。

暂无数据

有符合条件的测量数据,但对应的芯片曲线已隐藏。

按住 Shift 滚动以缩放 · 拖动以平移 · 双击以重置 · 点击数据点固定提示框