InferenceXbySemiAnalysis logo
首页AgentX新总览仪表板性能对比技术文章关于
Star1,614EN
SemiAnalysis logo

InferenceX 持续开展开源的 agentic 推理基准测试,发布来自真实环境、可复现、可审计的性能数据,并获得 OpenAI、Meta、Oracle、Microsoft 等万亿美元级 AI 基础设施运营方的信赖。

SemiAnalysis

SemiAnalysis 官网订阅通讯关于 SemiAnalysis

法律信息

原住民传统领地声明隐私政策Cookie 政策

参与贡献

基准测试仓库AgentX 测试框架可视化工具

更多

业界评价AgentX遥测数据技术文章API 文档芯片可靠性每美元性能模型架构AI 推理术语表芯片规格与价格GPU 排行榜模型在 GPU 上的实测结果

如果这些数据对您的工作有帮助,欢迎在 GitHub 上点个 Star,或分享给同事。

© 2026 semianalysis.com. 版权所有。

GLM 5.3 744B · 芯片对比

GLM 5.3 744B — B300 vs H200

B300(NVIDIA Blackwell)与 H200(NVIDIA Hopper)在 GLM 5.3 744B 上的正面 AI 推理基准测试对比。涵盖各类 LLM 工作负载的延迟、吞吐量与成本。使用下方图表控件切换序列、精度和指标——交互方式与主推理图表相同。

AgentX 回放真实的编码 agent 会话,而不是固定长度的 prompt,因此上下文随轮次不断增长,每个请求的大部分内容由 cache 提供而无需重新计算。这让对比变成一个系统问题:跨节点的 KV 传输、prefix 感知路由与 cache 容量,都会与芯片原始吞吐量一同影响曲线。固定序列负载仍然是衡量 kernel 与芯片性能的干净基线,因此两种场景回答的是关于同一硬件的不同问题。 进一步了解 AgentX →

B300 在 GLM 5.3 744B 上以 171 tok/s/user 运行时达到 7311 tok/s/chip(每百万 token $0.09)。H200 在此工作点没有数据。

B300:5171 tok/s/chip,每百万 token $0.12(GLM 5.3 744B 上以 217 tok/s/user 运行)。H200 在此点尚未测试。

在 GLM 5.3 744B 上以 262 tok/s/user 运行时,B300 吞吐量为 4002 tok/s/chip,每百万 token 成本 $0.16;H200 在此目标点没有基准测试数据。 (数据反映此 URL 的默认 agentic-traces · fp4 选择——如果您在控件中更改序列、精度或模型,下方表格和图表会自动更新。)

查看每美元性能对比 →

基于实测基准测试数据插值。修改下方目标交互速度,可比较不同运行点的表现。
指标
交互速度 (tok/s/user)
交互速度 (tok/s/user)
交互速度 (tok/s/user)
吞吐量 (tok/s/chip)
B300:7310.5H200:—
B300:5170.9H200:—
B300:4002.3H200:—
成本 ($/M tok)
B300:$0.086H200:—
B300:$0.121H200:—
B300:$0.157H200:—
tok/s/MW
B300:3847647H200:—
B300:2721500H200:—
B300:2106449H200:—
并发数
B300:~9H200:—
B300:~6H200:—
B300:~4H200:—

推理性能

不同模型、硬件配置和服务参数下,来自 AgentX 场景的智能体推理指标与固定序列推理指标。

配置
8K / 1K
图表
交互性
对比历史趋势

当前模型、场景与筛选条件下没有匹配的基准测试数据。请调整上方筛选条件查看结果。