每 token 能耗
也称为 energy per token、J/token、每请求能耗
先用大白话
每 token 能耗表示系统产出一个 token 要花多少电,是每 token 成本在电力侧的对应指标。
技术定义
每 token 能耗是产出单位 token 所消耗的电能,可以按全量供电口径统计,也可以取加速器实测遥测值。
常用单位
焦耳/token(J/tok)
工程细节
两种口径回答的是不同问题,不能混用。全量供电口径把包含供电与制冷开销在内的设施功耗预算除以实测 token 速率;实测口径来自运行期间的加速器遥测,只覆盖芯片本身。InferenceX 还会给出每次成功请求的实测能耗,以及平均功耗占 TDP 的百分比。
为什么重要
新建部署的约束往往是电力而不是资本开支,每焦耳产出更多 token 的系统能在同样的用电额度下服务更多需求。TDP 占比则单独反映一套方案究竟把加速器压到了什么程度,这是仅看按 token 归一的数值看不出来的。
如何在 InferenceX 中解读
比较前请先看清标签:全量供电口径与实测口径之间相差整个设施开销。当底层遥测无效或统计范围不明确时,InferenceX 会屏蔽实测能耗,因此数值缺失意味着该测量不可信,而不是这次运行不耗电。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200