在 Qwen3.5 上,B300 FP4 的每美元性能是 H100 的 12 倍。

这个数字代表什么,又不代表什么
这里同时有两个变量在变,读数时都要考虑。第一是四年的硬件迭代;第二是数值格式:该对比跨越 FP4 与 FP8,并没有固定精度。这样比较反映的是运营方今天在各款硬件上实际能部署的方案,是诚实的口径,但它并不是只针对硅片本身的受控实验。
工作负载同样重要。这不是 8k1k。Qwen3.5 的原生最大上下文长度为 262k token,因此 AgentX 对它回放的是截断到 256k 的 agentic 数据集,这意味着频繁的上下文压缩和大量前缀复用。在长上下文多轮回放上测得的比值,与在互相独立的短提示词上测得的同一比值,是两种不同的结论,而前者更接近真实的生产编码流量。
请按你自己的运行点来读
12 倍的总体比值是一个标题,而不是部署方案。真正承载决策的是曲线:先确定你的产品需要的交互性,在该点读取每套系统的表现,并在同一点核对首 token 延迟,然后再下结论。
这也是各模型的 AgentX 图表默认展示完整前沿、而不是单个数字的原因。较老的硬件可能在低并发下于每美元性能上仍有竞争力,却在高吞吐区间完全掉队;单一比值无法同时表达这条曲线的两端。
本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。
本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。