每美元 token 数
也称为 tokens per dollar、tok/$、每 1 美元 TCO 对应的 token 数
先用大白话
每美元 token 数表示按图表注明的成本口径,每投入 1 美元基础设施开支可以产出多少 token。
技术定义
每美元总 token 数用每芯片小时产出的总 token 数除以建模得出的每芯片小时全包基础设施成本。
常用单位
每 1 美元 TCO 对应的 token 数(tok/$)
工程细节
超大规模云厂商自有硬件、Neocloud Giant 自有硬件和 3 年期租赁三个版本分别采用对应的 TCO 每小时成本。Historical Trends 会插值对应的总吞吐量、输入吞吐量或输出吞吐量,再应用每小时成本系数。
为什么重要
该指标衡量硬件和软件的成本效率,因此比较时必须采用相同的模型、工作负载、交互性目标、token 类型和基础设施成本口径。
如何在 InferenceX 中解读
InferenceX 分别提供按超大规模云厂商自有硬件、Neocloud Giant 自有硬件和 3 年期租赁成本计算的每美元总 token 数轴,其中超大规模云厂商自有硬件轴是仪表板的默认 Y 轴。每 GPU 小时 token 收入是另一个独立指标,只有它采用标准化 token 售价或 OpenRouter 价格。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势
Qwen3.5 397B 的 AgentX 结果:B300 FP4 的每美元性能是 H100 的 12 倍
在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么