数值精度
块缩放
也称为 block scaling、microscaling、MX 格式、块浮点
先用大白话
块缩放给每一小组低精度数值配一个共享缩放因子,找回超小格式自身缺失的动态范围。
技术定义
块缩放是一种量化结构,数值以极低位宽格式存储,每个固定大小的块共享一个较高精度的缩放因子。
工程细节
一个 4 位数只能表示少数几个量级,远不足以覆盖模型张量的动态范围。把数值分成 16 或 32 个元素左右的块并附上共享缩放,每个块就能把格式对准自己的量级。MX 标准格式如 MXFP4、MXFP8 使用 2 的幂缩放,NVFP4 则在 16 元素块上使用 FP8 缩放,粒度更细。
为什么重要
块缩放是 FP4 推理世代背后的关键思想:没有每块缩放,4 位浮点对前沿模型根本不可用。缩放格式和块大小的选择,如今是硬件厂商与量化方案之间真正的差异化点。
如何在 InferenceX 中解读
InferenceX 在 Blackwell 和 MI355X 覆盖中的 NVFP4 与 MXFP4 结果都是块缩放格式,精度对比页面很大程度上就是为了展示这些配置相对同硬件 FP8 基线的得失。
参考资料
在真实基准中理解这一概念
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。