AI 推理术语表
软件栈

FlashInfer

也称为 FlashInfer、注意力 kernel 库

先用大白话

FlashInfer 是一个注意力 kernel 库,服务引擎直接调用它,而不必自己实现注意力。

技术定义

FlashInfer 是开源的注意力 kernel 与后端库,供推理引擎在 prefill、decode 和投机验证中使用。

工程细节

推理特有的复杂性大多集中在注意力上:分页缓存、变长序列、分组 query head、稀疏模式,以及对草稿 token 的验证,都会改变 kernel 的形态。共享库让多个引擎复用同一份调优实现,引擎则按 shape 和硬件目标选择后端。

为什么重要

由于后端是被选择而不是固定的,kernel 的可用性就变成了可移植性问题。只为某一家厂商后端实现的功能,会让另一方退回通用路径;而在长上下文下,这不是小小的妥协,而是选错了 kernel。

如何在 InferenceX 中解读

所使用的后端属于测试配置的一部分,改动它可以在硬件和引擎版本都不变的情况下推动曲线变化。正是这些 kernel 支持了循环状态的检查点,混合模型才得以参与前缀复用。