模型算力利用率
也称为 MFU、model FLOPs utilization、MBU
先用大白话
MFU 把模型实际完成的有效运算与芯片理论峰值运算量相除,得到一个效率百分比。
技术定义
模型算力利用率(MFU)是模型逻辑上需要的浮点运算量与硬件在相同墙钟时间内理论峰值运算量之比。
工程细节
峰值 TFLOP/s 假设每个 tensor core 每个周期都在满负荷工作,这在实际推理服务中从不成立。kernel 启动间隙、访存停顿、通信等待和不完美的批处理都会让算力闲置,MFU 把这些损耗折算进一个数字。decode 通常是访存受限的,因此 decode 阶段的 MFU 天然偏低,此时带宽版本的 MBU 往往是更真实的效率指标。
为什么重要
MFU 把硬件能力与软件成熟度区分开:峰值算力巨大但 kernel 不行的芯片,可能输给算力较低但喂得饱运算单元的芯片。硬件不变而 MFU 上升,正是软件进步的特征,而推理性能的大部分收益正来自软件。
如何在 InferenceX 中解读
InferenceX 跟踪的是每颗芯片随时间交付的 token 数而非直接报告 MFU。硬件不变而性能大幅提升的反复出现的模式,例如模型发布数周内的数量级改进,本质上就是软件把利用率追讨回来的过程。
参考资料
在真实基准中理解这一概念
MI355X 上 DeepSeek-V4-Pro 搭配 SGLang:26 天内每 GPU 吞吐量提升 110.5 倍
amd/deepseek_v4 分支合入了 TileLang 注意力索引器、Triton 稀疏 MLA、融合 RoPE/Hadamard、FlyDSL MoE 以及 FP4 权重,历经 31 个性能优化 PR——将首次点亮时 20 tok/s/GPU、2.4 tok/s/user 的水平提升至 8K/1K 负载下 2,256 tok/s/GPU、9.4 tok/s/user,吞吐量与交互性同步攀升
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM