GLM 5.3 在 GLM 5.2 744B 基础上做了额外的后训练,是一款前沿级别的模型。
在开源 SGLang 的性能上,这又是一个 NVIDIA 在真实 agentic 推理性能上胜过 AMD 的模型。在 150 tok/s/user 的 p90 交互性下,NVIDIA 的成本效率最高领先 5 倍。

「硬件白送」检验
衡量这种差距有一个很实用的方法。以 AMD 软件当前的状态,在 150 tok/s/user 时,NVIDIA 的性能优势大到这种程度:即便竞品芯片硬件白送(服务商当然仍要承担数据中心托管、电力和其他运营成本),用 NVIDIA 的单 token 成本依然更低。
这个说法之所以重要,是因为在采购谈判中最常被拿来用的杠杆就是硬件价格;而在这个运行点上,这根杠杆的力量不够。真正的约束是软件,而不是物料成本。

这是一次快照,不是最终结论
这个差距是相对 AMD 软件当前状态测得的,而在这批结果的其他部分中,这一状态一直在快速变化。我们期待 AMD 在几周后的 AgentX 更新文章中带来性能优化,那篇文章还会包含其他一些非常有意思的结果。
范围也要说清楚:这里比较的是开源 SGLang。在同一个模型的部分区间上,AMD 的厂商引擎讲的是另一个故事,我们另文说明。
本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。
本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。