AI 推理术语表
硬件

TPUv7 Ironwood

也称为 Ironwood、TPU v7、TPUv7、v7x

先用大白话

Ironwood 是第七代 TPU,也是 Google 第一款卖给其他公司、让它们跑自己推理业务的 TPU。

技术定义

TPUv7 Ironwood 是 Google 的加速器,每颗芯片有两个独立计算 die、原生 FP8 硬件、256x256 的 MXU、约为 Trillium 六倍的 HBM 容量,以及 3D torus 结构的 ICI 网络。

每用户 100 tok/s、FP8 8k1k 下的成本

每百万 token 0.181 美元,B200 为 0.222 美元,B300 为 0.276 美元

工程细节

Ironwood 放弃了 TPU v4 和 v5p 的 MegaCore 设计,后者把两个核心融合为共享同一内存空间的单个逻辑设备。Ironwood 的两个 die 各自作为独立逻辑设备运行,通过 die-to-die 链路相连,因此框架看到的是每颗芯片两个设备。每颗芯片有 2 个 TensorCore 和 4 个第三代 SparseCore。pod 的基本单元是 4x4x4 共 64 颗芯片的立方体,再通过光电路交换机拼接成 9,216 颗芯片的 superpod。Ironwood 没有原生 FP4,因此目前与 NVIDIA 的对比两边都使用 FP8。

为什么重要

这是 Google 第一次用可直接购买或租用的芯片,去争夺外部推理负载。仅 Anthropic 就承诺采购超过一百万颗 TPU。在 TPUv8i 加入原生 FP4 之前,只有 FP8 的计算路径限制了它与 Blackwell 的对比范围。

如何在 InferenceX 中解读

在 InferenceX Official Preview 中,Ironwood 以 FP8 服务 Qwen3.5 397B,在每用户 100 tok/s 的交互性下每百万 token 成本约 0.181 美元,B200 为 0.222 美元,B300 为 0.276 美元。在每用户 20 tok/s 下,按外部 TCO 计算,它的每美元 token 数比 B200 高 50.4%,比 B300 高 96.0%。