InferenceXbySemiAnalysis logo
首页AgentX新总览仪表板性能对比技术文章关于
Star1,625EN
SemiAnalysis logo

InferenceX 持续开展开源的 agentic 推理基准测试,发布来自真实环境、可复现、可审计的性能数据,并获得 OpenAI、Meta、Oracle、Microsoft 等万亿美元级 AI 基础设施运营方的信赖。

SemiAnalysis

SemiAnalysis 官网订阅通讯关于 SemiAnalysis

法律信息

原住民传统领地声明隐私政策Cookie 政策

参与贡献

基准测试仓库AgentX 测试框架可视化工具

更多

业界评价AgentX遥测数据技术文章API 文档TCO 计算器集群生命周期芯片可靠性芯片规格仪表板每美元性能模型架构AI 推理术语表芯片规格与价格GPU 排行榜模型在 GPU 上的实测结果

如果这些数据对您的工作有帮助,欢迎在 GitHub 上点个 Star,或分享给同事。

© 2026 semianalysis.com. 版权所有。

GLM 5.3 744B · 芯片对比

GLM 5.3 744B — GB200 NVL72 与 GB300 NVL72

对比 GB200 NVL72(NVIDIA Blackwell)与 GB300 NVL72(NVIDIA Blackwell)在 GLM 5.3 744B 上的 AI 推理基准测试结果,涵盖不同 LLM 工作负载下的延迟、吞吐量和成本。可通过下方图表控件切换序列长度、精度和指标,操作方式与主推理图表相同。

AgentX 回放真实的 coding agent 会话,而非定长 prompt。随着会话轮次增加,上下文不断增长;每个请求的大部分内容都可直接从 cache 读取,无需重新计算。因此,这项对比不仅取决于芯片本身的吞吐量,还会受到跨节点 KV 传输、prefix-aware routing 和 cache 容量等系统因素影响。定长序列工作负载仍是衡量 kernel 与芯片性能的清晰基线;两种场景从不同角度回答同一硬件的性能问题。 进一步了解 AgentX →

以 143 tok/s/user 为目标运行 GLM 5.3 744B 时,GB200 NVL72 的吞吐量为 12412 tok/s/chip,每百万 token 成本为 $0.04;GB300 NVL72 的吞吐量为 14337 tok/s/chip,每百万 token 成本为 $0.04。GB200 NVL72 的成本效率高出 8%;GB300 NVL72 的单芯片吞吐量高出 16%。

195 tok/s/user 位于 92–297 tok/s/user 交互性区间的中段。在这一运行点,GB200 NVL72 运行 GLM 5.3 744B 的吞吐量为 8529 tok/s/chip,每百万 token 成本为 $0.06;GB300 NVL72 的吞吐量为 8991 tok/s/chip,每百万 token 成本为 $0.07。GB200 NVL72 的成本效率高出 18%;GB300 NVL72 的单芯片吞吐量高出 5%。

将 GLM 5.3 744B 的目标交互性设为 246 tok/s/user 时,GB200 NVL72 的吞吐量为 4979 tok/s/chip,每百万 token 成本为 $0.10;GB300 NVL72 的吞吐量为 6250 tok/s/chip,每百万 token 成本为 $0.10。GB300 NVL72 的成本效率高出 1%;GB300 NVL72 的单芯片吞吐量高出 26%。 (以上数据基于此 URL 对应的默认 agentic-traces · fp4 配置;在控件中切换序列长度、精度或模型后,下方表格和图表会同步更新。)

查看每美元性能对比 →

数据由真实基准测试结果插值得出。调整下方的目标交互性数值,即可比较不同运行点。
指标
交互性(tok/s/user)
交互性(tok/s/user)
交互性(tok/s/user)
吞吐量(tok/s/chip)
GB200 NVL72:12412.1GB300 NVL72:14337.4
GB200 NVL72:8528.6GB300 NVL72:8990.8
GB200 NVL72:4978.7GB300 NVL72:6250.0
成本($/M tok)
GB200 NVL72:$0.042GB300 NVL72:$0.045
GB200 NVL72:$0.061GB300 NVL72:$0.071
GB200 NVL72:$0.104GB300 NVL72:$0.103
tok/s/MW
GB200 NVL72:6637513GB300 NVL72:6762913
GB200 NVL72:4560734GB300 NVL72:4240924
GB200 NVL72:2662432GB300 NVL72:2948110
并发数
GB200 NVL72:~63GB300 NVL72:~56
GB200 NVL72:~39GB300 NVL72:~22
GB200 NVL72:~5GB300 NVL72:~15

推理性能

不同模型、硬件配置和服务参数下,来自 AgentX 场景的智能体推理指标与固定序列推理指标。

配置
8K / 1K
图表
交互性
对比历史趋势

暂无数据

当前选择没有可绘制的测量数据。请检查上方的基准测试设置,或调整快捷筛选。