每美元 token 数
也称为 tokens per dollar、tok/$、每 1 美元 token 数
先用大白话
每美元 token 数表示一美元基础设施支出能买到多少 token,数值越大说明系统越便宜。
技术定义
每美元 token 数是某个配置在一单位建模成本下产出的 token 数量,即每 token 成本的倒数。
常用单位
每 1 美元 token 数(tok/$)
工程细节
它由每芯片吞吐量和建模的每芯片小时成本直接得出,因此与每百万 token 成本共用同一套假设,只是换成了人们规划容量时更习惯的方向。InferenceX 为总 token、输入 token 和输出 token 分别给出该指标,覆盖每种成本口径,并同时提供人民币与美元两种计价。
为什么重要
每百万 token 成本与每美元 token 数对系统的排序完全一致,但后者随硬件变好而升高,与吞吐量方向相同,因此同一张图里的坐标轴不会中途反向。该数值完全依赖背后的成本模型,脱离所声明的口径就不成立。
如何在 InferenceX 中解读
InferenceX 推理图表默认的 Y 轴就是每 1 美元可购买的总 token 数。阅读时请对照图表上方的 TCO 行,并只在同一成本口径内比较:自有(超大规模费率)、自有(neocloud 费率)和 3 年租赁对同一颗芯片会给出不同结果。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势