硬件
Boardfly
也称为 Boardfly、Boardfly topology、TPU 8i 网络、TPUv8i Boardfly
先用大白话
Boardfly 是 Google 推理专用 TPU 8i 的新型扁平网络,芯片间跳数比 torus 大约减半。
技术定义
Boardfly 是 TPU 8i 的高基数分层互连拓扑,取代最近邻的 3D torus,名字来源于超算领域的 dragonfly 网络家族。
工程细节
训练芯片 TPU 8t 保留 3D torus,推理芯片 TPU 8i 改用 Boardfly,由高基数交换机组成,而不是邻居直连的 mesh。在 1,024 到 1,152 芯片的可比规模下,网络直径从约 16 跳降到约 7 跳。TPU 8i 同时配备 19.2 Tb/s 的 ICI 带宽(上一代的两倍)和 384 MB 片上 SRAM(上一代的三倍),专门用来把推理和智能体模型的 KV cache 放在片上。它还带来了 Ironwood 缺少的原生 FP4 计算。
为什么重要
更少的跳数意味着集合通信的尾延迟更低,这在 token 跨 MoE 层路由、或多轮智能体会话把每一跳累积成用户可感知延迟时尤其重要。Boardfly 也改变了每芯片的网络连接 capex。这是 Google 第一次把训练和推理拆成不同的架构。
如何在 InferenceX 中解读
SemiAnalysis 预期 TPUv8i Boardfly 能与 Rubin NVL72 竞争。TPUv8i 登陆 InferenceX 和 AgentX 后,与 NVIDIA 的对比将从 FP8 对 FP8 变为 FP4 对 FP4,消除当前 Ironwood 结果中的精度不对称。