基准指标
P90 交互性
也称为 P90 interactivity、P90 TPS、P90 流式输出速度
先用大白话
P90 交互性把较慢尾部的 token 间隔换算成输出速率,数值越高,流式输出越快。
技术定义
在 Rubin AgentX 分析中,P90 交互性是 P90 全响应 token 间延迟的倒数,单位为每用户每秒 token 数。
换算关系
P90 交互性 = 1000 / P90 全响应 ITL(毫秒)
工程细节
计算时先取延迟的 P90,再取倒数并换算单位。P90 全响应 token 间延迟为 10 毫秒时,对应 100 tok/s/user。这并不是 token 速率的第 90 百分位数,因为正数取倒数后,大小顺序会反转。
为什么重要
分位数和延迟定义共同决定比较采用的速度约束。该指标不包含开始输出前的等待;相同的 P90 交互性仍可能对应明显不同的首 token 时间和端到端延迟。
如何在 InferenceX 中解读
Rubin 文章在相同 P90 交互性下比较各引擎的性能前沿,只在实测区间内插值。引用吞吐量、成本或功率归一化倍率时,必须保留目标速度与对比引擎。