数值精度
仅权重量化
也称为 weight-only quantization、W4A16、AWQ、GPTQ
先用大白话
仅权重量化只把存储的模型权重压到低精度,运算本身仍在较高精度格式下进行。
技术定义
仅权重量化把模型权重存为 4 位整数等低位格式,而激活和算术保持高精度,典型模式是 W4A16。
工程细节
权重是静态的,可以用 GPTQ、AWQ 等方法在离线阶段精心量化,选择能最小化质量损失的缩放和顺序。激活是动态的、更难压缩,保持 16 位可以绕开它们的离群值问题。服务时 kernel 在计算中即时反量化权重,因此访存流量减小,而乘加运算本身并没有变快。
为什么重要
由于 decode 是访存受限的,削减权重字节数直接加快 token 生成,也让更大的模型装进更少的芯片。仅权重方法让大型开源模型能在普通硬件上运行,在激活量化代价过高时仍是标准方案。
如何在 InferenceX 中解读
InferenceX 在精度标签中区分仅权重配置与全低精度路径,因为 W4A16 配置和 NVFP4 配置对于是哪些硬件单元和带宽预算产生了曲线,做出的是很不一样的声明。
参考资料
在真实基准中理解这一概念
B200 NVFP4 对比 H200 INT4 运行 Kimi K2.5/K2.6:性价比提升高达 2.95 倍
在 vLLM 8K/1K 工作负载下,B200 NVFP4 路径在 30–90 tok/s/user 推理区间内每百万 tokens 成本比 H200 INT4 低 2.71x–2.95x,比同一 B200 硬件上的 INT4 低 2.45x–2.74x。三个因素——B200 的 HBM 带宽、HBM 容量和 NVFP4 张量核心——可清晰分解该优势
AMD MI355X Kimi K2.5 推理:vLLM 25 天内吞吐量提升 7.7 倍、交互性最高提升 15 倍
vLLM PR #35850 修复了 MI355X CDNA4 上的 AITER MLA 分发路径,解锁 TP=8 下的 Kimi K2.5 推理性能,随 vLLM 0.18 一同发布