AI 推理术语表
数值精度

块缩放

也称为 block scaling、microscaling、MX 格式、块浮点

先用大白话

块缩放给每一小组低精度数值配一个共享缩放因子,找回超小格式自身缺失的动态范围。

技术定义

块缩放是一种量化结构,数值以极低位宽格式存储,每个固定大小的块共享一个较高精度的缩放因子。

工程细节

一个 4 位数只能表示少数几个量级,远不足以覆盖模型张量的动态范围。把数值分成 16 或 32 个元素左右的块并附上共享缩放,每个块就能把格式对准自己的量级。MX 标准格式如 MXFP4、MXFP8 使用 2 的幂缩放,NVFP4 则在 16 元素块上使用 FP8 缩放,粒度更细。

为什么重要

块缩放是 FP4 推理世代背后的关键思想:没有每块缩放,4 位浮点对前沿模型根本不可用。缩放格式和块大小的选择,如今是硬件厂商与量化方案之间真正的差异化点。

如何在 InferenceX 中解读

InferenceX 在 Blackwell 和 MI355X 覆盖中的 NVFP4 与 MXFP4 结果都是块缩放格式,精度对比页面很大程度上就是为了展示这些配置相对同硬件 FP8 基线的得失。