在 MiniMax M3 上,按 TCO 归一化的吞吐量方面,B200 与 B300 完全胜过各自对应的机架级方案。对于一个由 NVIDIA 横扫的模型来说,这个内部结果颇令人意外,而原因并不在网络。
在 AgentX 上,机架级的优势不那么明显,因为 Dynamo router 可能成为瓶颈:它的工作量随在线前缀的数量和长度增长,而不是随生成的 token 数增长。此外,这个模型上还没有针对宽专家并行、宽 DCP 或宽张量并行调优良好的 kernel。而 GB200 与 GB300 的 TCO 更高,在没有宽 EP 或宽 DCP 的情况下,这就直接表现为更差的每 TCO 性能。

我们也预期 NVIDIA 会在该 SKU 的机架级方案上做进一步优化,并会在后续文章中重点介绍。
没有人在使用上下文并行
尽管 p90 输入序列长度达到 317k token,目前仍没有任何提交使用上下文并行。这恰恰是该技术存在的意义所在,因此这种缺席需要解释。
M3 只有 4 个 KV head,即使在 TP8 下 DCP 也最多只能到 2;而且 MSA indexer 还需要单独的上下文并行处理,相关 vLLM PR 已经提交。因此这个上限是架构层面的,而不是调优疏忽,它也限定了长上下文并行策略在这个模型上能带来多少收益。
AMD 的 offload 缺口
NVIDIA 所有 Pareto 最优点在并发 20 以上都启用了 KV offload。而 AMD 的 Pareto 最优点没有一个使用 DRAM KV offload;在其他模型上,AMD 使用 offload 的比例也低于 NVIDIA。
原因很机械:AMD vLLM 上 CPU KV cache offload 所需的 GPU 到 CPU 传输效率极低,因为 hipMemcpyBatchAsync API 直到 ROCm 7.14 才提供。没有它,vLLM 原生的 simple CPU offloading 只能做串行 memcpy,而无法把多次拷贝合并成更大的消息。

缺少一个批量拷贝 API,这种事不会出现在规格书上,在定长基准测试中也根本不会被触发。但在长时间的 agentic 会话中,它决定了整整一层内存是否可用。
本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。
本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。