端到端归一化交互性
也称为 E2E Normalized Interactivity、归一化交互性、OSL/E2EL
先用大白话
这个指标衡量一整条回答到达得有多快,既算首 token 之前的等待,也算之后的流式速度。
技术定义
端到端归一化交互性是整条请求上的有效每用户 token 速率,即输出 token 数除以端到端延迟。
常用单位
token/秒/用户(tok/s/user)
工程细节
把端到端延迟展开为 TTFT 加上输出长度乘以每输出 token 时间,该指标约等于 1 除以(token 间延迟加上 TTFT 除以输出 token 数),也就是常规交互性再加一项与首 token 等待成正比的惩罚。这里的“归一化”指按输出长度归一,既不是 0 到 1 的评分,也不是与其他系统对比后的相对值。
为什么重要
只看交互性,会奖励那些让用户先等很久、之后再快速输出的方案;只看 TTFT,则会奖励开头很快、随后拖沓的方案。把两者合成一个数字,可以暴露只在单一维度上好看的运行点。输出越短,TTFT 惩罚越明显,因为可供摊薄等待时间的 token 更少。
如何在 InferenceX 中解读
InferenceX 把它作为 agentic 运行的实验性 X 轴模式,因此需要持久化的逐请求 trace,非官方运行 overlay 无法使用该视图。它是有意保留缺陷的:对高 TTFT 惩罚很重,也无法体现 prefill 与 decode 分离等优化的全部细节,所以 AgentX 提交仍会分别针对交互性和 TTFT 做优化。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本
GLM 5.3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72
AMD 厂商引擎在每美元性能上胜出的区间,以及端到端归一化交互性究竟衡量什么