软件栈
FlashInfer
也称为 FlashInfer、注意力 kernel 库
先用大白话
FlashInfer 是一个注意力 kernel 库,服务引擎直接调用它,而不必自己实现注意力。
技术定义
FlashInfer 是开源的注意力 kernel 与后端库,供推理引擎在 prefill、decode 和投机验证中使用。
工程细节
推理特有的复杂性大多集中在注意力上:分页缓存、变长序列、分组 query head、稀疏模式,以及对草稿 token 的验证,都会改变 kernel 的形态。共享库让多个引擎复用同一份调优实现,引擎则按 shape 和硬件目标选择后端。
为什么重要
由于后端是被选择而不是固定的,kernel 的可用性就变成了可移植性问题。只为某一家厂商后端实现的功能,会让另一方退回通用路径;而在长上下文下,这不是小小的妥协,而是选错了 kernel。
如何在 InferenceX 中解读
所使用的后端属于测试配置的一部分,改动它可以在硬件和引擎版本都不变的情况下推动曲线变化。正是这些 kernel 支持了循环状态的检查点,混合模型才得以参与前缀复用。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
SGLang 0.5.6 在 B200 DeepSeek R1 FP4 上的表现:低并发下最高提升 1.8 倍
针对 DeepSeek V3 的分段 CUDA graph、统一事件循环和 JIT 内核将 8k/1k 吞吐量从 508 提升至 907 tok/s/GPU,使用相同的 16 GPU B200 资源池
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM