硬件ICI
ICI(芯片间互连)
也称为 ICI、TPU 互连、ICI fabric
先用大白话
ICI 是 TPU 专用的网络,让整个 pod 内的芯片直接交换数据,不需要经过主机 CPU。
技术定义
ICI 是 Google 为 TPU 设计的芯片间互连,一种点对点网络,直接在芯片之间传输激活值、梯度和 KV cache,不经过 PCIe 或通用网卡。
工程细节
每颗 TPU 通过 ICI 链路连接 torus 中的邻居:v2 和 v3 的 2D torus 有 4 个邻居,v4 起的 3D torus 有 6 个。光电路交换机把 64 芯片立方体拼接成数千颗芯片的 pod,同时保留 wraparound 链路。结果是整个 pod 范围内都有 NVLink 级别的带宽,而不是局限在 8 个或 72 个设备之间。TPU 8i 把 ICI 带宽翻倍到每芯片 19.2 Tb/s,并从 torus 改为 Boardfly 拓扑。
为什么重要
pod 级带宽改变了哪些并行策略可行。DeepSeek-V3 规模的模型可以用张量并行、专家并行和数据并行切分到整个 pod 上,不需要流水线阶段;超过 1,000 颗芯片的 Ironwood pod 还能运行 NVL72 域做不到的分离式服务和超宽专家并行。torus 的跳数比单跳 NVSwitch 多,延迟取决于消息大小和拓扑。
如何在 InferenceX 中解读
InferenceX Official Preview 提到,即将发布的 CollectiveX 和 NetworkingX 结果显示,对于 MoE decode 产生的小尺寸专家并行消息,TPU torus 的延迟常常低于单跳 NVSwitch。SparseCore 上的 ReduceScatter 也是在 ICI 网络上重叠 die-to-die 与芯片间传输。