AI 推理术语表
基准指标

Goodput

也称为 goodput、有效吞吐量、SLO 约束吞吐量

先用大白话

Goodput 只统计满足延迟目标的那部分工作量,看起来很快但赶不上截止时间的系统拿不到任何分数。

技术定义

Goodput 指满足既定服务等级目标(SLO)的那部分吞吐量,例如首 token 时间上限或每用户每秒最低 token 数。

工程细节

原始吞吐量只关心服务器完成了多少请求,不管每个用户被服务得多慢。Goodput 先做一层过滤:只有满足运营方承诺的延迟或交互性约束的请求才被计入。两套吞吐量完全相同的系统,加上截止时间后 goodput 可能相差很大,因为一套在高负载下仍能压住延迟,另一套则让排队把所有请求都拖过界。

为什么重要

忽略 goodput 的容量规划要么多买要么超卖。若运营方按峰值吞吐量报价,但只有一半流量能在 SLO 内完成,实际需要的集群规模就是模型估算的两倍。goodput 是把基准测试曲线换算成部署真实承载用户数的那个数字。

如何在 InferenceX 中解读

InferenceX 发布完整的吞吐量对交互性 Pareto 前沿,而不是单一 goodput 数字,读者可以套用自己的 SLO。像 TCO 计算器那样在固定交互性档位上读取前沿,本质上就是在该档位测量 goodput。