AI 推理术语表
基准指标MFU

模型算力利用率

也称为 MFU、model FLOPs utilization、MBU

先用大白话

MFU 把模型实际完成的有效运算与芯片理论峰值运算量相除,得到一个效率百分比。

技术定义

模型算力利用率(MFU)是模型逻辑上需要的浮点运算量与硬件在相同墙钟时间内理论峰值运算量之比。

工程细节

峰值 TFLOP/s 假设每个 tensor core 每个周期都在满负荷工作,这在实际推理服务中从不成立。kernel 启动间隙、访存停顿、通信等待和不完美的批处理都会让算力闲置,MFU 把这些损耗折算进一个数字。decode 通常是访存受限的,因此 decode 阶段的 MFU 天然偏低,此时带宽版本的 MBU 往往是更真实的效率指标。

为什么重要

MFU 把硬件能力与软件成熟度区分开:峰值算力巨大但 kernel 不行的芯片,可能输给算力较低但喂得饱运算单元的芯片。硬件不变而 MFU 上升,正是软件进步的特征,而推理性能的大部分收益正来自软件。

如何在 InferenceX 中解读

InferenceX 跟踪的是每颗芯片随时间交付的 token 数而非直接报告 MFU。硬件不变而性能大幅提升的反复出现的模式,例如模型发布数周内的数量级改进,本质上就是软件把利用率追讨回来的过程。