MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

SemiAnalysis··3 分钟阅读·阅读英文原文·agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
本页目录 (click to expand)

在 MiniMax M3 432B 上,NVIDIA 完胜所有对手。AMD 的软件性能非常糟糕,长上下文下尤其如此;我们认为根源在于 AMD 工程管理层只激励团队针对短上下文单轮工作负载做调优,而忽视了长上下文多轮工作负载。

在 NVIDIA 阵营内部,B300 TRT-LLM 在 TP2 下拿下了 M3 的桂冠。

来源:SemiAnalysis InferenceX

缺失的 DP attention 数据点

M3 的前沿曲线上没有 DP attention 数据点,而这种缺席本身就说明了问题:在 M3 上,数据并行注意力并不划算,因为 KV cache 局部性会变成路由约束。

具体数字让机制变得清晰。以并发 40 的 GB200 为例,TP4/EP4/DPA 的吞吐量只有纯 TP4 的 0.60 倍,而 p90 TTFT 高出 3 倍以上;并发 32 时缓存命中率仅 28.8%,理论值则是 96.0%。每个 DP rank 独占缓存池的四分之一,一个 30 万 token 的会话一旦落到错误的 rank 上,就要全部重算。

28.8% 实测与 96.0% 理论之间的这道鸿沟,正是数据并行下前缀复用的全部症结:缓存本身足够大,只是会话没有被发到持有它的那个 rank 上。

M3 的前沿曲线上也没有出现任何带专家并行的 decode 配置,可能是因为并发还不足以让所有专家的负载均衡起来。

vLLM 与 TRT-LLM 的对比

值得一提的是,从吞吐量与 p90 交互性的关系看,vLLM 的表现与 TRT-LLM 非常接近;而在吞吐量与 p90 TTFT 的关系上,vLLM 表现更好。

来源:SemiAnalysis InferenceX

因此更倾向于哪一个,取决于你的产品是按哪条坐标轴来定义的。这也再次说明:应当把交互性和首 token 延迟放在一起读,而不是挑一张更符合预设结论的图。


本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。

本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。