AI 推理术语表
基准指标

端到端归一化交互性

也称为 E2E Normalized Interactivity、归一化交互性、OSL/E2EL

先用大白话

这个指标衡量一整条回答到达得有多快,既算首 token 之前的等待,也算之后的流式速度。

技术定义

端到端归一化交互性是整条请求上的有效每用户 token 速率,即输出 token 数除以端到端延迟。

常用单位

token/秒/用户(tok/s/user)

工程细节

把端到端延迟展开为 TTFT 加上输出长度乘以每输出 token 时间,该指标约等于 1 除以(token 间延迟加上 TTFT 除以输出 token 数),也就是常规交互性再加一项与首 token 等待成正比的惩罚。这里的“归一化”指按输出长度归一,既不是 0 到 1 的评分,也不是与其他系统对比后的相对值。

为什么重要

只看交互性,会奖励那些让用户先等很久、之后再快速输出的方案;只看 TTFT,则会奖励开头很快、随后拖沓的方案。把两者合成一个数字,可以暴露只在单一维度上好看的运行点。输出越短,TTFT 惩罚越明显,因为可供摊薄等待时间的 token 更少。

如何在 InferenceX 中解读

InferenceX 把它作为 agentic 运行的实验性 X 轴模式,因此需要持久化的逐请求 trace,非官方运行 overlay 无法使用该视图。它是有意保留缺陷的:对高 TTFT 惩罚很重,也无法体现 prefill 与 decode 分离等优化的全部细节,所以 AgentX 提交仍会分别针对交互性和 TTFT 做优化。