AI 推理术语表
硬件

Torus 拓扑

也称为 torus topology、3D torus、twisted torus、环面拓扑

先用大白话

torus 是一种边缘首尾相连的网格网络,最远的芯片也不会超过网格的一半距离。

技术定义

torus 拓扑让每颗芯片沿每个轴连接最近邻居,并在每行两端增加 wraparound 链路形成环,把普通 mesh 的最坏跳数减半。

工程细节

TPU v2 和 v3 使用每芯片 4 个邻居的 2D torus。从 v4 起,Google 改用沿 X、Y、Z 正负方向各有邻居、共 6 个邻居的 3D torus,Ironwood 沿用这一布局。基本单元是按一个机柜设计的 4x4x4 共 64 颗芯片立方体。twisted torus 通过偏移 wraparound 进一步降低平均跳数。光电路交换机在连接立方体时保留 wraparound 特性,让 Google 能在几秒内绕过故障芯片或链路。跨越多跳的流量在每一跳都付出延迟,因此集合通信会尽量安排在本地。

为什么重要

在 NVL72 机柜出现之前,放不进 8 卡节点的模型必须使用流水线并行,因为节点间 InfiniBand 太慢。TPU torus 早了好几年就在整个 pod 内提供了 NVLink 级别带宽。代价是跳数:1,024 颗芯片的 torus 直径约 16 跳,这也是 TPU 8i 为推理改用更扁平的 Boardfly 网络的原因。

如何在 InferenceX 中解读

CollectiveX 和 NetworkingX 直接测量集合通信延迟。InferenceX Official Preview 报告,尽管跳数更多,TPU torus 在 MoE decode 主要产生的小尺寸专家并行消息上,延迟常常优于单跳 NVSwitch。