AI 推理术语表
基准指标

尾部延迟

也称为 tail latency、p90、p99、分位数延迟

先用大白话

尾部延迟描述的是最慢的那部分请求,而不是典型请求,因为用户真正会注意到的正是这些。

技术定义

尾部延迟是请求分布高分位处的延迟,例如 p90 或 p99,而不是均值或中位数。

工程细节

分位数回答的问题与平均值不同。p90 为 5 秒意味着每 10 条请求中至少有 1 条等了这么久,而这条请求可能正是卡住某个 agent 继续执行的那一条。真实服务中的延迟分布高度偏斜,均值可能远低于尾部,从而把问题完全掩盖。

为什么重要

容量规划通常按分位数而不是平均值来定,因为一个平均很快、尾部很慢的服务,对用户来说依然是不合格的。某些优化还会在改善均值的同时恶化尾部,而单一汇总数字只会把它记成一次明确的胜利。

如何在 InferenceX 中解读

InferenceX 上报的指标都带分位数限定,并在坐标轴上标明,因此 p90 TTFT 与平均 TTFT 不会混在同一次比较里。agentic 运行的分布尤其偏斜,因为端到端延迟随输出长度增长,最长的生成会主导尾部。