AI 推理术语表
数值精度

INT4

也称为 INT4、4 位整数、W4A16

先用大白话

INT4 用 4 位整数存放权重,把模型压小,让缺少原生 4 位浮点支持的硬件每个 token 少搬很多数据。

技术定义

INT4 是主要用于权重量化的 4 位整数格式,通常为每一组数值配一个更高精度的缩放因子。

工程细节

整数格式的取值是均匀分布的,不像浮点那样疏密不一,因此 INT4 依赖分组缩放因子来跟踪每一块权重的局部数值范围。激活值通常保持更高精度,矩阵乘法在计算时实时反量化,这使得该技术更多是访存优化而不是算力优化。

为什么重要

它在缺少 4 位浮点硬件支持的平台上最有价值。在这类硬件上,INT4 是落地 4 位权重的现实路径,但通常比原生格式更依赖细致的校准,其精度必须实测验证而不能想当然。

如何在 InferenceX 中解读

InferenceX 把 INT4 与 FP4、FP8、BF16 并列为独立的精度键,精度属于测试配置而不是显示选项。把 INT4 与原生 FP4 方案对比时,务必同时查看精度评估结果,因为两种格式并不等价。