AI 推理术语表
推理服务

混合模型 prefix caching

也称为 hybrid prefix caching、混合 prefix caching、GDN checkpoint 缓存、对齐 checkpoint 模式

先用大白话

混合模型 prefix caching 让同时包含注意力层和线性注意力层的模型能复用缓存的 prompt,方法是把循环状态与 KV block 一起保存。

技术定义

混合模型 prefix caching 是一种服务技术,为共享的 prompt 前缀同时保存注意力层的 KV block 和线性注意力层循环状态的 checkpoint,使新请求可以从该前缀继续而无需重新计算。

工程细节

对纯注意力模型,缓存前缀就是保留它的 KV block。对混合模型,前缀末尾的 GDN 循环状态也必须保留,但实时状态通常会随着请求继续而被覆盖。Ironwood 的实现给 GDN 分开的 slot 用于读取 checkpoint 和写入实时状态,状态地址从已经用于定位 KV block 的 block table 推导,checkpoint 按对齐的缓存粒度保存,使保存的状态总是落在 KV block 边界上。这种模式需要完整的 checkpoint 池而不是紧凑的按请求分配,用 HBM 换取跨请求复用。

为什么重要

智能体和多轮负载会复用很长的系统提示词和对话历史,混合模型只有在循环状态也被缓存时才能受益。取舍很明确:混合模型的 prefix caching 会消耗紧凑分配省下的 HBM,因此只有在前缀确实被共享时才划算。

如何在 InferenceX 中解读

TPU InferenceX 预览中的 Qwen3.5 397B 数字来自随机输入的 8k1k 运行,请求之间没有任何共享,因此没有经过这条路径。带 DP 支持的混合模型 prefix caching 是 Google 客户所要求的 AgentX TPU 结果的基础工作。