AI 推理术语表
基准指标SLO

服务级目标

也称为 service level objective、SLO、延迟目标

先用大白话

SLO 是一套部署必须兑现的性能承诺,例如十条请求中有九条要在一秒内返回首 token。

技术定义

服务级目标是对某个服务指标设定的目标值,通常表示为对延迟或交互性的分位数约束。

工程细节

一条有用的 SLO 会同时给出指标、分位数和阈值。此时服务容量就是系统在不违反该约束的前提下能维持的吞吐量,它小于峰值吞吐量,也是运营方唯一可以据以规划容量的数字。

为什么重要

吞吐量曲线上的每个点都是可达的,但只有一部分满足既定承诺。两套系统的峰值吞吐量可能很接近,而在交互性或首 token 约束下能保留多少吞吐量却相差悬殊。

如何在 InferenceX 中解读

InferenceX 不强加统一的行业 SLO,因为可接受的目标因产品而异:交互式编程需要较高的 token 速率,批处理则可以容忍数秒的首 token 延迟。请按自己的阈值读取前沿曲线,而不要直接比较峰值。