AI 推理术语表
数值精度

KV cache 量化

也称为 KV cache quantization、FP8 KV cache、量化 KV

先用大白话

把对话缓存用更小的格式存放,让芯片装下更多上下文,并在生成时更快地把它读回来。

技术定义

KV cache 量化用降精度格式存放注意力的 key 与 value 状态,与模型权重所用精度相互独立。

工程细节

权重精度与缓存精度是两个独立选择,一套方案可以用 FP8 权重搭配 BF16 缓存,反过来也可以。缓存位宽减半,加速器显存能容纳的 token 数大致翻倍,每个 decode 步骤要读取的字节数也减半,而这正是 decode 大部分时间在做的事。

为什么重要

在长上下文服务中,这往往比压缩权重更划算,因为高并发下最先耗尽显存的是缓存而不是权重。不同模型对精度的敏感度不同,量化 key 还是 value 也有差别,因此需要实测评估而不能一概而论。

如何在 InferenceX 中解读

缓存精度属于测试配置的一部分,实践中还存在混合布局:有些模型会保留两份位宽不同的缓存缓冲区,分离式传输路径必须把它们成对搬运。阅读显存容量相关的结论时,请连同其背后的缓存格式一起看。