AI 推理术语表
基准指标

P90 交互性

也称为 P90 interactivity、P90 TPS、P90 流式输出速度

先用大白话

P90 交互性把较慢尾部的 token 间隔换算成输出速率,数值越高,流式输出越快。

技术定义

在 Rubin AgentX 分析中,P90 交互性是 P90 全响应 token 间延迟的倒数,单位为每用户每秒 token 数。

换算关系

P90 交互性 = 1000 / P90 全响应 ITL(毫秒)

工程细节

计算时先取延迟的 P90,再取倒数并换算单位。P90 全响应 token 间延迟为 10 毫秒时,对应 100 tok/s/user。这并不是 token 速率的第 90 百分位数,因为正数取倒数后,大小顺序会反转。

为什么重要

分位数和延迟定义共同决定比较采用的速度约束。该指标不包含开始输出前的等待;相同的 P90 交互性仍可能对应明显不同的首 token 时间和端到端延迟。

如何在 InferenceX 中解读

Rubin 文章在相同 P90 交互性下比较各引擎的性能前沿,只在实测区间内插值。引用吞吐量、成本或功率归一化倍率时,必须保留目标速度与对比引擎。