AI 推理术语表
推理服务

前缀缓存命中率

也称为 prefix cache hit rate、缓存命中率、KV 复用率

先用大白话

命中率是指提示词中有多少 token 直接来自缓存而无需重算,在长会话中这通常是绝大部分。

技术定义

前缀缓存命中率是 prefill 阶段由已缓存 KV 状态满足、而非重新计算的输入 token 占比。

工程细节

命中率必须与产生它的缓存层级一起看才有意义,因为从加速器显存读取的 token 与从主机内存取回的 token,代价完全不同。它也不只取决于容量:淘汰策略可能丢掉仍会被用到的前缀,路由也可能把请求发到从未持有该前缀的 worker。

为什么重要

在多轮流量下,命中率基本决定了 prefill 的开销,因为每一轮都会把整段对话再加一点新内容重新发过来。一旦复用率很高,剩余的 prefill 工作就主要是真正的新 token,瓶颈也从计算转向缓存管理。

如何在 InferenceX 中解读

AgentX 点详情视图会按缓存层级分别展示命中率随时间的变化,并给出 prompt token 来源拆分。如果一个数据点在低命中率下报出很高的总吞吐量,说明它做的 prefill 工作远多于缓存良好的部署。