AI 推理术语表
硬件

MegaCore

也称为 MegaCore、Megacore 模式、融合 TPU 核心

先用大白话

MegaCore 是 TPU v4 和 v5p 的设计,把两个物理核心融合成一个共享同一内存空间的逻辑加速器。

技术定义

MegaCore 是 TPU v4 和 v5p 的约定:一颗芯片上的两个物理 TensorCore 以单个逻辑设备的形式呈现给软件,共用一个统一的 HBM 地址空间。

工程细节

在 MegaCore 下,编译器和框架看到的是每颗芯片一个大设备,两个核心在幕后分摊工作。Ironwood 放弃了这一设计:两个计算 die 各自作为独立逻辑设备运行,拥有各自的内存,通过高带宽 die-to-die 链路相连而不是统一内存结构,因此 JAX 和 TorchTPU 看到的是每颗芯片两个设备。Ironwood 上的 TP8 配置因此跨越 4 颗芯片上的 8 个逻辑设备。

为什么重要

这一变化把协调工作从硬件移到了软件。集合通信现在分成经 die-to-die 链路的片内阶段和经 ICI 的片间阶段,kernel 可以让两者重叠。这也意味着基准测试中的每芯片数字聚合了两个设备,在与单 die GPU 比较每芯片每秒 token 数时需要注意。

如何在 InferenceX 中解读

Ironwood 在 SparseCore 上实现的 ReduceScatter 先通过 die-to-die 链路合并芯片内的贡献,再在芯片之间交换部分和,这只有在两个 die 是独立设备时才可行。InferenceX 按每芯片报告 Ironwood 吞吐量,因此在每用户 20 tok/s 下的 9,364 tok/s/chip 覆盖了两个 die。