INT4
也称为 INT4、4 位整数、W4A16
先用大白话
INT4 用 4 位整数存放权重,把模型压小,让缺少原生 4 位浮点支持的硬件每个 token 少搬很多数据。
技术定义
INT4 是主要用于权重量化的 4 位整数格式,通常为每一组数值配一个更高精度的缩放因子。
工程细节
整数格式的取值是均匀分布的,不像浮点那样疏密不一,因此 INT4 依赖分组缩放因子来跟踪每一块权重的局部数值范围。激活值通常保持更高精度,矩阵乘法在计算时实时反量化,这使得该技术更多是访存优化而不是算力优化。
为什么重要
它在缺少 4 位浮点硬件支持的平台上最有价值。在这类硬件上,INT4 是落地 4 位权重的现实路径,但通常比原生格式更依赖细致的校准,其精度必须实测验证而不能想当然。
如何在 InferenceX 中解读
InferenceX 把 INT4 与 FP4、FP8、BF16 并列为独立的精度键,精度属于测试配置而不是显示选项。把 INT4 与原生 FP4 方案对比时,务必同时查看精度评估结果,因为两种格式并不等价。
参考资料
在真实基准中理解这一概念
B200 NVFP4 对比 H200 INT4 运行 Kimi K2.5/K2.6:性价比提升高达 2.95 倍
在 vLLM 8K/1K 工作负载下,B200 NVFP4 路径在 30–90 tok/s/user 推理区间内每百万 tokens 成本比 H200 INT4 低 2.71x–2.95x,比同一 B200 硬件上的 INT4 低 2.45x–2.74x。三个因素——B200 的 HBM 带宽、HBM 容量和 NVFP4 张量核心——可清晰分解该优势
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
AMD MI355X Kimi K2.5 推理:vLLM 25 天内吞吐量提升 7.7 倍、交互性最高提升 15 倍
vLLM PR #35850 修复了 MI355X CDNA4 上的 AITER MLA 分发路径,解锁 TP=8 下的 Kimi K2.5 推理性能,随 vLLM 0.18 一同发布