AITER
也称为 AITER、AMD AITER、ROCm kernel 库
先用大白话
AITER 是 AMD 调优过的 kernel 库,决定注意力和矩阵运算在 Instinct 芯片上究竟能跑多快。
技术定义
AITER 是 AMD 面向 Instinct 加速器的优化 kernel 库,供运行在 ROCm 上的推理引擎调用。
工程细节
引擎负责表达策略,kernel 决定它是否够快。AITER 提供调优过的注意力、矩阵和融合算子,引擎会用它替代通用路径。这个分发决策本身也可调优,而且在某种 shape 上取胜的 kernel 在另一种 shape 上可能落败,因此选择可能取决于上下文长度,而不是固定不变。
为什么重要
并行策略只有在 kernel 能表达时才算数,这正是 AMD 上的上下文并行和长上下文稀疏注意力以 kernel 工作而非引擎工作形式出现的原因。超大缓存还会暴露短请求根本触及不到的问题,例如缓存池跨过某个容量边界后地址运算溢出,从而静默访问错误的行。
如何在 InferenceX 中解读
该库位于测试配置所固定的容器镜像内部,因此 AITER 的改进可以在引擎版本和硬件都不变的情况下推动曲线上移。在统一 shape 上实测到的 kernel 级收益,未必能在 agentic trace 上留存,缓存与调度带来的波动可能将其淹没。
参考资料
在真实基准中理解这一概念
AMD MI355X Kimi K2.5 推理:vLLM 25 天内吞吐量提升 7.7 倍、交互性最高提升 15 倍
vLLM PR #35850 修复了 MI355X CDNA4 上的 AITER MLA 分发路径,解锁 TP=8 下的 Kimi K2.5 推理性能,随 vLLM 0.18 一同发布
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
MI355X 上 DeepSeek-V4-Pro 搭配 SGLang:26 天内每 GPU 吞吐量提升 110.5 倍
amd/deepseek_v4 分支合入了 TileLang 注意力索引器、Triton 稀疏 MLA、融合 RoPE/Hadamard、FlyDSL MoE 以及 FP4 权重,历经 31 个性能优化 PR——将首次点亮时 20 tok/s/GPU、2.4 tok/s/user 的水平提升至 8K/1K 负载下 2,256 tok/s/GPU、9.4 tok/s/user,吞吐量与交互性同步攀升