基准指标
尾部延迟
也称为 tail latency、p90、p99、分位数延迟
先用大白话
尾部延迟描述的是最慢的那部分请求,而不是典型请求,因为用户真正会注意到的正是这些。
技术定义
尾部延迟是请求分布高分位处的延迟,例如 p90 或 p99,而不是均值或中位数。
工程细节
分位数回答的问题与平均值不同。p90 为 5 秒意味着每 10 条请求中至少有 1 条等了这么久,而这条请求可能正是卡住某个 agent 继续执行的那一条。真实服务中的延迟分布高度偏斜,均值可能远低于尾部,从而把问题完全掩盖。
为什么重要
容量规划通常按分位数而不是平均值来定,因为一个平均很快、尾部很慢的服务,对用户来说依然是不合格的。某些优化还会在改善均值的同时恶化尾部,而单一汇总数字只会把它记成一次明确的胜利。
如何在 InferenceX 中解读
InferenceX 上报的指标都带分位数限定,并在坐标轴上标明,因此 p90 TTFT 与平均 TTFT 不会混在同一次比较里。agentic 运行的分布尤其偏斜,因为端到端延迟随输出长度增长,最长的生成会主导尾部。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本