Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力

SemiAnalysis··2 分钟阅读·阅读英文原文·agentxagenticbenchmarkinferencekimimi355xgb300nvl72h200amdnvidia
本页目录 (click to expand)

在端到端延迟 40 到 60 秒的那段曲线上,MI355X ATOM 的每美元性能甚至胜过 GB300 NVL72 vLLM。在一个 2.8 万亿参数的模型上、面对 NVIDIA 的机架级系统,这是 AMD 实打实赢来的结果。

来源:SemiAnalysis InferenceX

上游这个前提

AMD 用 ATOM 快速推进 K3 性能是件好事。与之相伴的建议是:优先把这些改进上游到 vLLM。ATOM 目前是 AMD 性能最好的引擎,但对使用上游开源服务栈的客户来说,vLLM 才是更有参考价值的对比对象;只在厂商运行时下成立的曲线,并不能代表这些客户实际能部署的性能。

Hopper 基本无法参与

Hopper 很难承接 Kimi K3 的 AgentX 工作负载。一方面 Kimi 确实是个庞大的模型,另一方面 vLLM 维护者和 NVIDIA 一直没有把精力放在为 K3 优化 Hopper 上。

具体原因是明确的,而非笼统的:Hopper(SM90)需要为 K3 定制调优 kernel,并针对高交互性服务调优 TP32 和 EP32 的 shape。这两者目前都不存在,因此真正的约束与其说是硬件,不如说是没有人在做这件事。

来源:SemiAnalysis InferenceX

这提醒我们:基准测试图表上的代际差距,有一部分其实是工程投入上的代际差距。Hopper 多年来能很好地服务 DeepSeek R1,是因为那个模型持续获得 kernel 层面的投入;K3 没有得到同等对待,曲线也就如实反映了这一差别。


本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。

本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。