基准指标
访存受限与计算受限
也称为 memory bound、compute bound、带宽受限
先用大白话
当运算单元是瓶颈时工作负载是计算受限,当等待数据搬运是瓶颈时则是访存受限。
技术定义
当 kernel 的运行时间由算术吞吐能力决定时称为计算受限,由操作数在内存与运算单元之间的搬运速度决定时称为访存受限。
工程细节
每个 kernel 都有算术强度,即运算次数与访问字节数之比。如果这个比值低于硬件的平衡点,内存系统会先于运算单元饱和。LLM 的 prefill 执行算术强度很高的大矩阵乘法,通常是计算受限;而 decode 为每个请求读取全部权重和 KV cache 只产出一个 token,通常是访存受限。
为什么重要
瓶颈资源决定了哪个硬件规格才重要。decode 的访存受限特性解释了为什么每次加速器发布都把 HBM 容量和带宽放在标题上,为什么量化通过减少搬运字节数来加速 decode,以及为什么算力一般但内存很快的芯片能在交互式服务中获胜。
如何在 InferenceX 中解读
InferenceX 对并发做扫描,让系统在两种状态之间移动:低并发 decode 受带宽限制,高并发批处理则推向计算极限。每条吞吐量对交互性曲线的形状,反映了该配置发生状态切换的位置。