AI 推理术语表
数值精度

BF16

也称为 BF16、bfloat16、brain float 16

先用大白话

BF16 是多数模型训练所用的 16 位格式,用它做推理也是量化方案精度对照的基准。

技术定义

BF16 是一种 16 位浮点格式,指数范围与 FP32 相同而尾数更短,广泛用于训练,也常作为未量化的推理基线。

工程细节

保留 FP32 的指数范围,使 BF16 能很好地容纳 transformer 激活值的数值分布,格式转换很少需要窄格式所依赖的缩放机制。它牺牲的是精度而不是范围,体积是 FP8 的两倍、4 位格式的四倍。

为什么重要

在基准测试中它通常扮演参照系。decode 阶段以权重读取为主,因此 BF16 方案每个 token 搬运的数据远多于量化方案,往往位于吞吐量曲线更低的位置,同时定义了其他方案所对照的精度水平。

如何在 InferenceX 中解读

InferenceX 把 BF16 作为精度键,并在规格页给出每个加速器的 BF16 稠密峰值算力。量化方案会通过精度评估验证,而不是默认无损,这正是 BF16 对照有意义的前提。