模型架构
混合注意力
也称为 hybrid attention、混合缓存模型
先用大白话
混合模型在不同层使用不同的注意力类型,因此它的缓存是几种不同状态,而不是一块统一的数据。
技术定义
混合注意力模型交错使用不同类型的注意力层,从而产生形状和生命周期各不相同的多个 KV cache group。
工程细节
统一模型每个 token 只有一种缓存布局,用单一 block 几何结构就能描述所有需要保存的内容;混合模型则不然:全注意力层、窗口层,以及循环或压缩状态同时存在,各有各的占用、各有各的丢弃时机,能否重建也不一样。
为什么重要
在状态需要离开加速器之前,这一区别是看不出来的。假设单一布局的 connector 无法说明某个 block 属于哪一组,因此会话最长的那些模型一度反而完全用不了 offload。循环状态最棘手,因为它累积了此前的全部内容,无法从相邻 token 重算。
如何在 InferenceX 中解读
InferenceX 测试矩阵中的前沿开放权重模型越来越多采用混合结构,因此引擎对混合 cache group 的支持本身就是测试内容的一部分。offload、分离式传输和前缀复用都必须逐组扩展,而不能从统一结构的情形直接继承。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析