基准指标
Goodput
也称为 goodput、有效吞吐量、SLO 约束吞吐量
先用大白话
Goodput 只统计满足延迟目标的那部分工作量,看起来很快但赶不上截止时间的系统拿不到任何分数。
技术定义
Goodput 指满足既定服务等级目标(SLO)的那部分吞吐量,例如首 token 时间上限或每用户每秒最低 token 数。
工程细节
原始吞吐量只关心服务器完成了多少请求,不管每个用户被服务得多慢。Goodput 先做一层过滤:只有满足运营方承诺的延迟或交互性约束的请求才被计入。两套吞吐量完全相同的系统,加上截止时间后 goodput 可能相差很大,因为一套在高负载下仍能压住延迟,另一套则让排队把所有请求都拖过界。
为什么重要
忽略 goodput 的容量规划要么多买要么超卖。若运营方按峰值吞吐量报价,但只有一半流量能在 SLO 内完成,实际需要的集群规模就是模型估算的两倍。goodput 是把基准测试曲线换算成部署真实承载用户数的那个数字。
如何在 InferenceX 中解读
InferenceX 发布完整的吞吐量对交互性 Pareto 前沿,而不是单一 goodput 数字,读者可以套用自己的 SLO。像 TCO 计算器那样在固定交互性档位上读取前沿,本质上就是在该档位测量 goodput。
参考资料