数值精度
KV cache 量化
也称为 KV cache quantization、FP8 KV cache、量化 KV
先用大白话
把对话缓存用更小的格式存放,让芯片装下更多上下文,并在生成时更快地把它读回来。
技术定义
KV cache 量化用降精度格式存放注意力的 key 与 value 状态,与模型权重所用精度相互独立。
工程细节
权重精度与缓存精度是两个独立选择,一套方案可以用 FP8 权重搭配 BF16 缓存,反过来也可以。缓存位宽减半,加速器显存能容纳的 token 数大致翻倍,每个 decode 步骤要读取的字节数也减半,而这正是 decode 大部分时间在做的事。
为什么重要
在长上下文服务中,这往往比压缩权重更划算,因为高并发下最先耗尽显存的是缓存而不是权重。不同模型对精度的敏感度不同,量化 key 还是 value 也有差别,因此需要实测评估而不能一概而论。
如何在 InferenceX 中解读
缓存精度属于测试配置的一部分,实践中还存在混合布局:有些模型会保留两份位宽不同的缓存缓冲区,分离式传输路径必须把它们成对搬运。阅读显存容量相关的结论时,请连同其背后的缓存格式一起看。
参考资料
在真实基准中理解这一概念
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。