AI 推理术语表
基准指标J/token

每 token 能耗

也称为 energy per token、J/token、每请求能耗

先用大白话

每 token 能耗表示系统产出一个 token 要花多少电,是每 token 成本在电力侧的对应指标。

技术定义

每 token 能耗是产出单位 token 所消耗的电能,可以按全量供电口径统计,也可以取加速器实测遥测值。

常用单位

焦耳/token(J/tok)

工程细节

两种口径回答的是不同问题,不能混用。全量供电口径把包含供电与制冷开销在内的设施功耗预算除以实测 token 速率;实测口径来自运行期间的加速器遥测,只覆盖芯片本身。InferenceX 还会给出每次成功请求的实测能耗,以及平均功耗占 TDP 的百分比。

为什么重要

新建部署的约束往往是电力而不是资本开支,每焦耳产出更多 token 的系统能在同样的用电额度下服务更多需求。TDP 占比则单独反映一套方案究竟把加速器压到了什么程度,这是仅看按 token 归一的数值看不出来的。

如何在 InferenceX 中解读

比较前请先看清标签:全量供电口径与实测口径之间相差整个设施开销。当底层遥测无效或统计范围不明确时,InferenceX 会屏蔽实测能耗,因此数值缺失意味着该测量不可信,而不是这次运行不耗电。