基准指标AL
接受长度
也称为 acceptance length、AL、接受率
先用大白话
接受长度是指每次验证中完整模型实际认可的草稿 token 数,它决定了投机解码是否划算。
技术定义
接受长度是目标模型在一次验证中平均接受的投机草稿 token 数量。
工程细节
只有草稿能通过验证,投机解码才会省时间。接受长度接近 1 意味着起草与验证这套机制白跑了一趟;数值较高则能把一次昂贵的目标模型计算摊薄到多个输出 token 上。该数值取决于 speculator、草稿长度、模型本身以及正在生成的内容。
为什么重要
正因为接受率取决于内容,基准测试有可能在无意中左右结论。合成或匿名化文本对于在真实语料上训练的 speculator 而言属于分布外数据,实测接受率会朝任一方向偏离生产环境的真实值。
如何在 InferenceX 中解读
AgentX 回放的是填充了合成 token 的匿名化 trace,因此不让接受率由这些内容自行决定。运行时改为套用一组固定接受长度,按模型、speculator、草稿长度和思考模式在外部 agentic 编码数据集上采集,从而保持厂商中立。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析