INT8
也称为 8 位整数量化、W8A8
先用大白话
INT8 用 8 位整数加缩放因子存储数值,内存相比 16 位格式减半,支持的硬件上算力翻倍。
技术定义
INT8 是一种 8 位整数数值格式,搭配每张量或每通道的缩放因子,用于量化推理中的模型权重和激活。
工程细节
整数量化通过缩放因子(有时还有零点)把浮点值映射到 256 个均匀间隔的等级上。均匀间隔对离群值处理得很差,因此 SmoothQuant 等技术先把激活中的离群值迁移到权重里,再按 W8A8 模式对两侧一起量化。在较早的加速器世代,INT8 是 16 位以下的主要快速路径,而新芯片增加了 FP8,同样位宽下指数位带来更宽的动态范围。
为什么重要
INT8 定义了 LLM 量化的第一波主流实践,在没有 8 位浮点支持的硬件上仍然重要。INT8 与 FP8 的对比也恰好展示了量化的核心权衡:均匀精度对动态范围。
如何在 InferenceX 中解读
InferenceX 为每个结果标注精度,其精度对比页面存在的原因就是格式切换曾大幅移动曲线。Blackwell 和 MI350 级硬件上的现代配置偏好 FP8 和 FP4 路径,整数格式出现在特定的权重量化配置中。
参考资料
在真实基准中理解这一概念
B200 NVFP4 对比 H200 INT4 运行 Kimi K2.5/K2.6:性价比提升高达 2.95 倍
在 vLLM 8K/1K 工作负载下,B200 NVFP4 路径在 30–90 tok/s/user 推理区间内每百万 tokens 成本比 H200 INT4 低 2.71x–2.95x,比同一 B200 硬件上的 INT4 低 2.45x–2.74x。三个因素——B200 的 HBM 带宽、HBM 容量和 NVFP4 张量核心——可清晰分解该优势
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B