基准指标
测试配置
也称为 recipe、配置方案、服务配置
先用大白话
一套测试配置就是产生某条曲线的全部选择:模型、引擎、镜像、精度、并行策略和工作负载。
技术定义
测试配置是指产生一条实测曲线所需的完整组合:模型、推理引擎与容器镜像、数值精度、并行策略、芯片系统和工作负载。
工程细节
InferenceX 上的每个数据点都属于某套测试配置,对同一套配置做并发扫描就画出它的曲线。改动其中任何一项都会得到另一套配置,而不是同一套配置的变体,因此升级引擎镜像会作为独立结果上报,而不会并入既有曲线。
为什么重要
芯片峰值规格无法描述服务性能,同一颗芯片在不同配置下可以相差数倍。把整套组合写清楚,结论才可核查:脱离配置的单个数字既无法复现,也无法与其他厂商公平比较。
如何在 InferenceX 中解读
InferenceX 的测试配置主要跟随 vLLM 与 SGLang 官方 cookbook,并使用上游镜像,因此结果反映用户实际能部署的性能,而不是为基准测试特调过的镜像。数据点 tooltip 会展示背后的配置,并给出运行溯源链接。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200