数值精度
BF16
也称为 BF16、bfloat16、brain float 16
先用大白话
BF16 是多数模型训练所用的 16 位格式,用它做推理也是量化方案精度对照的基准。
技术定义
BF16 是一种 16 位浮点格式,指数范围与 FP32 相同而尾数更短,广泛用于训练,也常作为未量化的推理基线。
工程细节
保留 FP32 的指数范围,使 BF16 能很好地容纳 transformer 激活值的数值分布,格式转换很少需要窄格式所依赖的缩放机制。它牺牲的是精度而不是范围,体积是 FP8 的两倍、4 位格式的四倍。
为什么重要
在基准测试中它通常扮演参照系。decode 阶段以权重读取为主,因此 BF16 方案每个 token 搬运的数据远多于量化方案,往往位于吞吐量曲线更低的位置,同时定义了其他方案所对照的精度水平。
如何在 InferenceX 中解读
InferenceX 把 BF16 作为精度键,并在规格页给出每个加速器的 BF16 稠密峰值算力。量化方案会通过精度评估验证,而不是默认无损,这正是 BF16 对照有意义的前提。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析