AI 推理术语表
基准指标E2E latency

端到端延迟

也称为 E2E latency、E2EL、请求完成时间、P90 端到端延迟

先用大白话

端到端延迟是从提交模型请求到收完完整答案的时间,包含开始输出前的等待。

技术定义

请求端到端延迟衡量从提交请求到收到响应最后一个 token 之间的耗时。

常用单位

每个已完成请求的秒数

工程细节

它包含首 token 时间及后续流式输出时长。即使 token 速率相同,更长的答案也需要更多时间,因此比较时须采用可比的输出长度分布。P90 端到端延迟是请求完成时间的第 90 百分位数,不能把各阶段单独计算的 P90 延迟相加得到。

为什么重要

智能体往往需要等到完整响应到达,才能执行工具或开始下一轮。仅有较快的流式输出无法限定这段等待。单次请求延迟也不同于完整智能体任务时长,后者可能包含多次模型调用和工具执行。

如何在 InferenceX 中解读

Rubin 文章分别绘制 P90 端到端延迟和 P90 交互性。两者结合阅读,才能区分流式输出加快与排队、prefill 或整段响应耗时缩短。