AgentX 行业影响 · 内核
ROCm AITER
ATOM、AMD vLLM 与 AMD SGLang 的长上下文执行都依赖与之匹配的底层 AITER 内核,因为引擎层的并行策略只有在内核能够表达时才是真实可用的。
- 加宽行索引后可覆盖的 token 数
- >131k
- 超过 4 GB 的池所需的寻址位宽
- 64-bit
- 可避免静默访问错误行的行数量级
- ~150M
Context-parallel 进程组
Prefill 的 context-parallel 进程组提供了 prefill context parallelism 所需的额外 query 分片维度,同时把融合内核的行索引加宽到可支持 131,000 token 以上的 prompt。Decode context parallelism(DCP)则把 KV 切分到已有的张量并行 GPU 上,使更长的序列或更大的 batch 无需在每个 rank 上复制整份 cache 就能容纳。
地址位宽:短请求几乎永远碰不到的失败
大 cache 暴露出一类短固定请求基本碰不到的失败:地址位宽。在单个 cache 池跨过边界之前,32 位偏移完全够用;一旦越界,运算就会回绕,内核会访问到错误的行,而且不会抛出任何错误。
AITER 为超过 4 GB 的 batch prefill 增加了运行时 64 位分发,为超过 2 GB 的场景提供 64 位 MLA 偏移,并在 DeepSeek-V4 的统一 cache 路径中全面采用 64 位寻址——最后一项避免了在约 1.5 亿行的池中静默读写到错误的行。

面向常见 head 打包方式的常驻 MLA decode
DeepSeek-V4 的 decode 还获得了面向 64 head 与 128 head MTP 打包方式的常驻 MLA 内核。这两种 head 数量正是普通解码与 speculative 验证实际产生的形态,因此引擎在常见形状上获得了专门的长上下文路径,而不是把它们当作某个为短上下文编写的内核的附带变体。这与前面 vLLM 选择 AITER sparse-MLA 内核的论点相同:在长上下文下,通用路径不是一种小幅妥协,而根本就是错误的内核。
上游 PR
其他项目
推理引擎
vLLM
混合注意力 prefix 保留、面向 hybrid 模型的 CPU KV offload,以及收窄后的 store 与 load 路径。
查看优化详情 →推理引擎
SGLang
Sliding-window 分配、HiCache 混合 offload、以 runtime scalar 传入上下文长度,以及 cache 感知的 DP 路由。
查看优化详情 →推理引擎
TensorRT-LLM
边界感知的增量 tokenization、disaggregated KV 的 descriptor 合并,以及调度器生命周期修复。
查看优化详情 →推理引擎
AMD ATOM
稀疏 checkpoint 保留、recurrent 状态 checkpoint、CPU offload 归属管理,以及长 prefill 并行。
查看优化详情 →Router 与编排
NVIDIA Dynamo
批量化 KV 匹配、以 request lease 表示归属、更廉价的 router 状态,以及更精简的请求平面。
查看优化详情 →KV cache 层
LMCache
分块的外部 cache 加载、hybrid group 存储优化、AMD Instinct 支持,以及 DCP 感知的 offload。
查看优化详情 →传输引擎
Mooncake
通过 HIP dmabuf 在 ROCm 上实现 GPU-direct RDMA,并提供已发布的 ROCm wheel 与发版流程。
查看优化详情 →