硬件TDP
热设计功耗
也称为 TDP、热设计功率包络
先用大白话
TDP 是芯片设计上可持续消耗并以热量形式散发的功率,是每份加速器规格表上的标题瓦数。
技术定义
热设计功耗(TDP)是芯片被设计为可持续运行的最大功率包络,其散热系统必须能够持续把这些热量排出。
工程细节
现代加速器每颗芯片的功耗在千瓦上下甚至更高,整机柜系统乘上去就是十万瓦量级。只看 TDP 还会低估真实账单:内存、网络、CPU、电源转换损耗和散热开销都叠加在上面,因此每芯片的全部包含功耗明显高于芯片 TDP。数据中心容量按兆瓦出售,这些功率包络直接决定一个场地能容纳多少加速器。
为什么重要
电力已成为 AI 扩建的硬约束,在许多市场甚至排在资本之前。每芯片 TDP 的持续上升迫使行业转向液冷,也让每瓦性能与每美元性能一样,成为比较芯片世代的主要维度。
如何在 InferenceX 中解读
Rubin 文章注明所测量产 SKU 的 TDP 为 2300 W,但设施吞吐量采用全口径市电功率归一化。TDP 既不是推理实测功耗,也不是设施总功耗。文中 DSX MaxLPS 部分讨论按工作负载规划供电,并将更细粒度的 PowerX 测量列为后续工作,没有把现有曲线当作实测功耗结果。
参考资料
在真实基准中理解这一概念
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
Rubin NVL72 Agentic 推理:每美元性能提升至 67 倍
Jensen 再次低估性能,每吉瓦年利润超过两倍,买得越多赚得越多,AgentX、InferenceX 与深度协同设计