ATOM
也称为 ATOM、AMD ATOM、ATOMesh
先用大白话
ATOM 是 AMD 自研的推理引擎,是它在厂商专用运行时这条路线上的答案,而非上游开源引擎。
技术定义
ATOM 是 AMD 面向 Instinct 加速器的推理引擎,与 ROCm 上的上游 vLLM、SGLang 并列,定位为厂商自有运行时。
工程细节
它对 AMD 的意义,与厂商运行时对 NVIDIA 的意义相同:针对自家硬件调优,且可以跑在上游引擎前面。它的 router 名为 ATOMesh,最初是 SGLang router 的一个分支。该引擎最初面向单轮服务设计,因此支持长上下文多轮场景需要对其缓存管理器和 kernel 做大量改造。
为什么重要
厂商引擎可以在开源栈跟上之前展示硬件的能力上限,这既是有价值的证据,也是不便直接照搬的建议。多数实验室部署的是上游引擎,因此只在厂商运行时下成立的结果,并不能代表这些用户实际拿到的性能。
如何在 InferenceX 中解读
InferenceX 把 ATOM 作为独立的框架标签,避免与同一加速器上的 vLLM 或 SGLang 结果混为一谈。想知道硬件能做到什么,就拿它与其他厂商运行时比较;想知道客户今天能部署什么,就拿它与上游引擎比较。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
MI355X 上 DeepSeek-V4-Pro 搭配 SGLang:26 天内每 GPU 吞吐量提升 110.5 倍
amd/deepseek_v4 分支合入了 TileLang 注意力索引器、Triton 稀疏 MLA、融合 RoPE/Hadamard、FlyDSL MoE 以及 FP4 权重,历经 31 个性能优化 PR——将首次点亮时 20 tok/s/GPU、2.4 tok/s/user 的水平提升至 8K/1K 负载下 2,256 tok/s/GPU、9.4 tok/s/user,吞吐量与交互性同步攀升
AMD MI355X GLM-5 推理:SGLang FP8 单节点每百万 token 成本比 B200 最高低 40%
GLM-5 发布 14 周后,AMD 在 MI355X 上同时实现了 SGLang FP8 的 MTP 和非 MTP 方案 — 通过 TileLang 实现的融合 MLA + FP8 KV 缓存在大部分性能 Pareto 前沿上将单节点 FP8 成本曲线翻转为 AMD 占优
DeepSeek V4 Pro 的 AgentX 结果:MI355X 对比 B200,以及 8 月 21 日的反转
在端到端延迟的每美元性能上,AMD 一度追平 B200 vLLM,随后上游 vLLM 的优化改变了格局
Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72
AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力