AI 推理术语表
数值精度

INT8

也称为 8 位整数量化、W8A8

先用大白话

INT8 用 8 位整数加缩放因子存储数值,内存相比 16 位格式减半,支持的硬件上算力翻倍。

技术定义

INT8 是一种 8 位整数数值格式,搭配每张量或每通道的缩放因子,用于量化推理中的模型权重和激活。

工程细节

整数量化通过缩放因子(有时还有零点)把浮点值映射到 256 个均匀间隔的等级上。均匀间隔对离群值处理得很差,因此 SmoothQuant 等技术先把激活中的离群值迁移到权重里,再按 W8A8 模式对两侧一起量化。在较早的加速器世代,INT8 是 16 位以下的主要快速路径,而新芯片增加了 FP8,同样位宽下指数位带来更宽的动态范围。

为什么重要

INT8 定义了 LLM 量化的第一波主流实践,在没有 8 位浮点支持的硬件上仍然重要。INT8 与 FP8 的对比也恰好展示了量化的核心权衡:均匀精度对动态范围。

如何在 InferenceX 中解读

InferenceX 为每个结果标注精度,其精度对比页面存在的原因就是格式切换曾大幅移动曲线。Blackwell 和 MI350 级硬件上的现代配置偏好 FP8 和 FP4 路径,整数格式出现在特定的权重量化配置中。