AI 推理术语表
模型架构

混合注意力

也称为 hybrid attention、混合缓存模型

先用大白话

混合模型在不同层使用不同的注意力类型,因此它的缓存是几种不同状态,而不是一块统一的数据。

技术定义

混合注意力模型交错使用不同类型的注意力层,从而产生形状和生命周期各不相同的多个 KV cache group。

工程细节

统一模型每个 token 只有一种缓存布局,用单一 block 几何结构就能描述所有需要保存的内容;混合模型则不然:全注意力层、窗口层,以及循环或压缩状态同时存在,各有各的占用、各有各的丢弃时机,能否重建也不一样。

为什么重要

在状态需要离开加速器之前,这一区别是看不出来的。假设单一布局的 connector 无法说明某个 block 属于哪一组,因此会话最长的那些模型一度反而完全用不了 offload。循环状态最棘手,因为它累积了此前的全部内容,无法从相邻 token 重算。

如何在 InferenceX 中解读

InferenceX 测试矩阵中的前沿开放权重模型越来越多采用混合结构,因此引擎对混合 cache group 的支持本身就是测试内容的一部分。offload、分离式传输和前缀复用都必须逐组扩展,而不能从统一结构的情形直接继承。