AI 推理术语表
基准指标

GPU 利用率

也称为 GPU utilization、芯片利用率、加速器利用率

先用大白话

GPU 利用率衡量加速器有多忙,但监控工具里常见的百分比可能很高,而真实效率仍然很低。

技术定义

GPU 利用率指加速器用于有效工作的时间或能力占比,口径从粗糙的繁忙百分比到严格的模型算力利用率不等。

工程细节

基础监控工具里的利用率只说明有 kernel 驻留,不代表芯片被用得好,一个只占用单个计算单元的 kernel 也会显示为繁忙。更严格的度量把实际交付的运算量或带宽与硬件峰值对比。在推理服务中利用率还受流量影响:请求之间的空闲、低并发以及 agent 会话中的工具调用停顿,都会让花钱买来的芯片闲着。

为什么重要

集群经济性取决于利用率。批处理和调度做得好的部署与朴素部署之间,同样硬件上每 token 成本常常相差数倍,这正是推理软件和请求路由与芯片本身同样受重视的原因。

如何在 InferenceX 中解读

InferenceX 报告每个交互性水平下每颗芯片的实际交付吞吐量而非利用率百分比,因此引擎、精度和并行方案之间的利用率差异,会直接表现为同一硬件上曲线之间的间距。