Apples-to-apples 对比
也称为 apples-to-apples comparison、apples to apples、apples to bananas、同条件对比
先用大白话
apples-to-apples 对比把精度、服务模式和负载保持一致,结果差异才能归因于硬件本身。
技术定义
在 InferenceX 中,apples-to-apples 对比要求各系统在数值精度、聚合或分离式服务模式、投机解码设置和负载形状上一致,只有硬件及其软件栈不同。
工程细节
一边 FP8、一边 FP4 不算 apples to apples,因为 FP4 相对 FP8 有质量损失,每个权重读取的字节也只有一半。一边聚合、一边分离式,则把部署模式的优势混进了结果。单 token 预测对 MTP 在投机解码上也是同样的问题。InferenceX 把这种不匹配的情况称为 apples to bananas,并在标注后照常发布,因为买家确实面临这些选择,但头条结论来自匹配的设置。Ironwood 没有原生 FP4,因此目前公平的对比是 FP8 对 FP8 Blackwell;TPUv8i 将以 FP4 对 FP4 比较。
为什么重要
大量厂商性能声明建立在不匹配的设置之上。坚持匹配精度和服务模式,才能让每美元性能的比值成为关于芯片的陈述,而不是关于营销幻灯片所选方案的陈述。
如何在 InferenceX 中解读
InferenceX Official Preview 的头条结论,即 TPUv7 每美元性能最高高出 50%,是与 B200、B300 在 FP8 聚合单 token 设置下的 apples-to-apples 对比。GB300 NVL72 分离式对 TPUv7 聚合的图表被明确标注为 apples to bananas,曲线中段 GB300 领先约 30%。
参考资料
在真实基准中理解这一概念
TPU 推理外部化全速推进
InferenceX、最高 50% 的每美元性能优势、TPU 软件栈的快速外部化、不断扩大的客户群、Ironwood、TPUv8i,以及正在收窄的 CUDA 护城河
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
OpenAI Jalapeño:比 NVIDIA Blackwell 更强
OpenAI 自研 ASIC 对比 Rubin:Jalapeño 的 TCO、每兆瓦吞吐量,以及那些够辣的细节