算术强度
也称为 arithmetic intensity、运算强度、计算访存比
先用大白话
算术强度表示每搬运一个字节能做多少次运算,它决定瓶颈落在计算单元还是显存上。
技术定义
算术强度是一次计算所执行的算术运算次数与其在显存和计算单元之间搬运的字节数之比。
工程细节
prefill 会用同一份权重处理大量 token,每个载入的字节都被反复复用,因此通常是计算受限的。decode 每一步每条序列只产出一个 token,却仍要读取权重和 KV cache,搬运了大量数据却只做很少运算,因此通常受显存带宽限制。
为什么重要
两个阶段受限于芯片的不同部分,这解释了为什么峰值 FLOPS 亮眼的规格书在 decode 上可能令人失望,也解释了 batching 为何有效:把多条序列合并会提高算术强度,因为每次权重读取被更多 token 复用。
如何在 InferenceX 中解读
这一区别解释了数据中反复出现的形态。低交互性的点跑大 batch、算术强度高,接近计算上限;高交互性一端跑小 batch,跟随显存带宽,因此带宽更充裕的硬件常常在这里胜出,尽管其峰值吞吐量更低。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
OpenAI Jalapeño:比 NVIDIA Blackwell 更强
OpenAI 自研 ASIC 对比 Rubin:Jalapeño 的 TCO、每兆瓦吞吐量,以及那些够辣的细节