基准指标SLO
服务级目标
也称为 service level objective、SLO、延迟目标
先用大白话
SLO 是一套部署必须兑现的性能承诺,例如十条请求中有九条要在一秒内返回首 token。
技术定义
服务级目标是对某个服务指标设定的目标值,通常表示为对延迟或交互性的分位数约束。
工程细节
一条有用的 SLO 会同时给出指标、分位数和阈值。此时服务容量就是系统在不违反该约束的前提下能维持的吞吐量,它小于峰值吞吐量,也是运营方唯一可以据以规划容量的数字。
为什么重要
吞吐量曲线上的每个点都是可达的,但只有一部分满足既定承诺。两套系统的峰值吞吐量可能很接近,而在交互性或首 token 约束下能保留多少吞吐量却相差悬殊。
如何在 InferenceX 中解读
InferenceX 不强加统一的行业 SLO,因为可接受的目标因产品而异:交互式编程需要较高的 token 速率,批处理则可以容忍数秒的首 token 延迟。请按自己的阈值读取前沿曲线,而不要直接比较峰值。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本