Roofline 曲线
也称为 roofline、前沿包络、roofline 曲线
先用大白话
在 InferenceX 上,roofline 是按硬件配置在其最优点上画出的外包络线,用来展示它达到过的边界。
技术定义
InferenceX 上的 roofline 是按硬件配置绘制的 Pareto 包络曲线,穿过该配置在当前所选坐标轴下未被支配的数据点。
工程细节
哪个角算“最好”取决于所选指标:吞吐量对交互性取右上角,而成本类指标数值越低越好,因此包络会锚定在所选指标组合定义的那个角上。x 值退化的点不具备入选资格,但在显示全部数据点的视图中仍会绘制。
为什么重要
直接看一团原始数据点容易挑选有利结果,因为调优不佳的配置也会贡献一些运营方绝不会选择的点。包络线展示的是每套系统可达的边界,而容量决策正是依据这个形状做出的。
如何在 InferenceX 中解读
这与 HPC 中经典的 roofline 模型不同:后者把可达 FLOPS 与算术强度放在一起,用于判断计算受限还是访存受限,仪表板只借用了“上界”这一图形表达。roofline 方向按指标配置,因此同一批数据点在不同坐标轴下会得到不同的包络。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势