AI 推理术语表
基准指标tok/$

每美元 token 数

也称为 tokens per dollar、tok/$、每 1 美元 token 数

先用大白话

每美元 token 数表示一美元基础设施支出能买到多少 token,数值越大说明系统越便宜。

技术定义

每美元 token 数是某个配置在一单位建模成本下产出的 token 数量,即每 token 成本的倒数。

常用单位

每 1 美元 token 数(tok/$)

工程细节

它由每芯片吞吐量和建模的每芯片小时成本直接得出,因此与每百万 token 成本共用同一套假设,只是换成了人们规划容量时更习惯的方向。InferenceX 为总 token、输入 token 和输出 token 分别给出该指标,覆盖每种成本口径,并同时提供人民币与美元两种计价。

为什么重要

每百万 token 成本与每美元 token 数对系统的排序完全一致,但后者随硬件变好而升高,与吞吐量方向相同,因此同一张图里的坐标轴不会中途反向。该数值完全依赖背后的成本模型,脱离所声明的口径就不成立。

如何在 InferenceX 中解读

InferenceX 推理图表默认的 Y 轴就是每 1 美元可购买的总 token 数。阅读时请对照图表上方的 TCO 行,并只在同一成本口径内比较:自有(超大规模费率)、自有(neocloud 费率)和 3 年租赁对同一颗芯片会给出不同结果。