AI 推理术语表
数值精度

仅权重量化

也称为 weight-only quantization、W4A16、AWQ、GPTQ

先用大白话

仅权重量化只把存储的模型权重压到低精度,运算本身仍在较高精度格式下进行。

技术定义

仅权重量化把模型权重存为 4 位整数等低位格式,而激活和算术保持高精度,典型模式是 W4A16。

工程细节

权重是静态的,可以用 GPTQ、AWQ 等方法在离线阶段精心量化,选择能最小化质量损失的缩放和顺序。激活是动态的、更难压缩,保持 16 位可以绕开它们的离群值问题。服务时 kernel 在计算中即时反量化权重,因此访存流量减小,而乘加运算本身并没有变快。

为什么重要

由于 decode 是访存受限的,削减权重字节数直接加快 token 生成,也让更大的模型装进更少的芯片。仅权重方法让大型开源模型能在普通硬件上运行,在激活量化代价过高时仍是标准方案。

如何在 InferenceX 中解读

InferenceX 在精度标签中区分仅权重配置与全低精度路径,因为 W4A16 配置和 NVFP4 配置对于是哪些硬件单元和带宽预算产生了曲线,做出的是很不一样的声明。