AI 推理术语表
基准指标

算术强度

也称为 arithmetic intensity、运算强度、计算访存比

先用大白话

算术强度表示每搬运一个字节能做多少次运算,它决定瓶颈落在计算单元还是显存上。

技术定义

算术强度是一次计算所执行的算术运算次数与其在显存和计算单元之间搬运的字节数之比。

工程细节

prefill 会用同一份权重处理大量 token,每个载入的字节都被反复复用,因此通常是计算受限的。decode 每一步每条序列只产出一个 token,却仍要读取权重和 KV cache,搬运了大量数据却只做很少运算,因此通常受显存带宽限制。

为什么重要

两个阶段受限于芯片的不同部分,这解释了为什么峰值 FLOPS 亮眼的规格书在 decode 上可能令人失望,也解释了 batching 为何有效:把多条序列合并会提高算术强度,因为每次权重读取被更多 token 复用。

如何在 InferenceX 中解读

这一区别解释了数据中反复出现的形态。低交互性的点跑大 batch、算术强度高,接近计算上限;高交互性一端跑小 batch,跟随显存带宽,因此带宽更充裕的硬件常常在这里胜出,尽管其峰值吞吐量更低。