Qwen3.5 397B 的 AgentX 结果:90 tok/s/user 下 20 倍的 SGLang 差距

GatedDeltaNet、262k 原生上下文,以及同一引擎上 AMD 完全缺席的竞争

SemiAnalysis··2 分钟阅读·阅读英文原文·agentxagenticbenchmarkinferenceqwensglangtrtllmnvidiaamd
本页目录 (click to expand)

Qwen3.5 397B 每隔几层就用 GatedDeltaNet 替代常规注意力。GatedDeltaNet 由 MIT 与 NVIDIA Research 提出,其状态存储需求在理论上是常数,而常规注意力是线性增长的,因此相比同等规模的稠密注意力模型,它的存储需求更低。与 Nemotron 那样惨败的端到端模型训练研究不同,NVIDIA Research 在 GDN、LatentMoE 这类被前沿模型采用的基础研究上做得非常出色。

在看结果之前先说明一点测试方法:该模型原生最大上下文长度为 262k token,因此 AgentX 对它回放的是截断到 256k 的数据集。这模拟的是在上下文上限较小的模型上频繁触顶、频繁压缩上下文的工作负载,也就是用户实际使用这类模型的方式。

差距

在 SGLang 对 SGLang 的比较中,Qwen3.5 397B 是 NVIDIA 的强势领地:90 tok/s/user 时性能领先 20 倍以上。在 Qwen3.5 SGLang 上,AMD 目前完全没有竞争力。

来源:SemiAnalysis InferenceX

固定引擎这一变量,正是这组对比值得一提的原因。跨引擎的结果总有争论空间,因为不同软件栈的成熟度不同,投入优化的人力也不同;而这里两边都是 SGLang,差距依然是 20 倍。

NVIDIA 在用 TTFT 换交互性

在 NVIDIA 阵营内部,我们再次看到以牺牲首 token 延迟为代价过度优化交互性的现象,TRT-LLM 尤其明显。上图中所有 NVIDIA SGLang 提交的 p90 TTFT 都远低于 TRT-LLM。

这是真实的取舍而非缺陷,但读者必须看得到它。一套让用户先等更久、之后流式输出更快的方案,在交互性坐标轴上会更好看,在首 token 的服务级目标下则更差;只有两者一起读,才知道哪一种适合你的产品。


本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。

本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。