看 ATOM 的话,在 p90 端到端归一化交互性的部分区间内,AMD 的每美元性能优于 GB300 NVL72 SGLang,甚至优于 TRTLLM。这一结果值得肯定,AMD 团队做得很好。
对两家厂商的建议还是那两条:我们期待 AMD 把这些优化移植到 SGLang,也期待 NVIDIA 在接下来几周里尽快优化 GB300 NVL72。

端到端归一化交互性衡量什么
这个结果所对应的横轴是一个实验性指标,在据此下结论之前值得先弄清楚它的含义。端到端归一化交互性的目标,是在同时考虑首 token 延迟和每秒 token 数的前提下,衡量用户实际感受到的响应速度,其定义为输出序列长度除以端到端延迟。
把端到端延迟展开为 TTFT 加上输出长度乘以每输出 token 时间(实际上只解码输出长度减一个 token),可得下式。

它本质上等于交互性(即 1/TPOT 那部分),再加上一项与 TTFT 成正比的惩罚。
这个指标在哪里会误导
需要说明的是,该指标是实验性的,并不完美。例如它对高 TTFT 的惩罚很重,也无法体现 prefill-decode 分离等优化的全部细节。AgentX v1.0 的所有提交仍然分别针对常规交互性和 TTFT 做优化;我们也会继续打磨能反映现代 agentic 推理各种细节的新北极星指标。
这个前提在这里对双方都成立。一套用首 token 延迟换取流式速度的配置,在这条坐标轴上一定会被惩罚,无论这种取舍是否契合具体产品;因此仅凭端到端归一化交互性得出的胜负,应当再对照独立的交互性曲线和 TTFT 曲线核实,然后才能作为采购论据。
本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。
本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。