基准指标E2E latency
端到端延迟
也称为 E2E latency、E2EL、请求完成时间、P90 端到端延迟
先用大白话
端到端延迟是从提交模型请求到收完完整答案的时间,包含开始输出前的等待。
技术定义
请求端到端延迟衡量从提交请求到收到响应最后一个 token 之间的耗时。
常用单位
每个已完成请求的秒数
工程细节
它包含首 token 时间及后续流式输出时长。即使 token 速率相同,更长的答案也需要更多时间,因此比较时须采用可比的输出长度分布。P90 端到端延迟是请求完成时间的第 90 百分位数,不能把各阶段单独计算的 P90 延迟相加得到。
为什么重要
智能体往往需要等到完整响应到达,才能执行工具或开始下一轮。仅有较快的流式输出无法限定这段等待。单次请求延迟也不同于完整智能体任务时长,后者可能包含多次模型调用和工具执行。
如何在 InferenceX 中解读
Rubin 文章分别绘制 P90 端到端延迟和 P90 交互性。两者结合阅读,才能区分流式输出加快与排队、prefill 或整段响应耗时缩短。