硬件
TPU superpod
也称为 superpod、TPU pod、Ironwood superpod、完整 pod
先用大白话
Superpod 是接入同一个 ICI 网络的最大 TPU 单元,Ironwood 最多 9,216 颗芯片,可以当作一台机器使用。
技术定义
TPU superpod 是一代 TPU 中通过 ICI 互连的最大域,由 64 芯片立方体经光电路交换机拼接而成;Ironwood 的 superpod 达到 9,216 颗芯片,约 42.5 FP8 exaflops。
工程细节
每个 4x4x4 共 64 颗芯片的立方体占满一个机柜。光电路交换机在保留 torus wraparound 的前提下连接各立方体,整个 pod 表现为一个大型 twisted torus。由于 ICI 绕过主机 CPU,并在整个 pod 范围内提供 NVLink 级别的带宽,模型可以用张量并行、专家并行和数据并行切分到数千颗芯片上,不需要流水线阶段。客户租用的是 pod 的切片而不是整个 pod,OCS 层还能让 Google 在几秒内绕开故障芯片。
为什么重要
Pod 是 TPU 服务策略不同于 GPU 的根本原因。NVL72 域把 scale-up 组限制在 72 颗 GPU,而 Ironwood pod 能把超过 1,000 颗芯片放进一个低延迟域,从而支持机柜级 NVIDIA 系统无法复制的超宽专家并行和大模型分离式服务。
如何在 InferenceX 中解读
InferenceX Official Preview 在小切片上运行聚合服务,但文章认为 pod 才是让 TPUv7 分离式服务能与 GB200 和 GB300 NVL72 竞争的关键,相关结果将在后续文章发布。