AI 推理术语表
硬件

TensorCore(TPU)

也称为 TensorCore、TPU TensorCore、TC

先用大白话

TensorCore 是 TPU 芯片里的主计算模块,包含矩阵单元、向量单元和片上存储,负责模型的稠密计算。

技术定义

TPU TensorCore 是 TPU die 上的稠密计算模块,把一个或多个 MXU systolic 阵列、一个向量处理单元(VPU),以及它们读写的 VMEM 暂存区组合在一起。

工程细节

Ironwood 每颗芯片有 2 个 TensorCore,每个计算 die 一个,另外还有 4 个第三代 SparseCore。TensorCore 内部的 MXU 负责矩阵乘法,VPU 负责逐元素和归约运算,VMEM 把操作数放在两者旁边。Google 的 TPU 文档用 TensorCore 指这一模块,它与 NVIDIA GPU 流式多处理器里的 Tensor Core 无关。当集合通信或 gather 在 TensorCore 上运行时,占用的是 MXU 和 VPU 本可以用于模型计算的周期。

为什么重要

Ironwood 的多项优化都在把不规则工作从 TensorCore 挪到 SparseCore 上,让稠密单元持续运转。把 ReduceScatter 移到 SparseCore 释放了 TensorCore 的执行时间;把 ragged gather-reduce 路径中的 top-k 权重 gather 移过去之后,DeepSeek-V3 微基准中的 TensorCore 开销从 29 微秒降到 14 微秒。

如何在 InferenceX 中解读

TPU InferenceX 预览把 Qwen3.5 397B 在 8k1k 上的部分收益归因于让 TensorCore 保持空闲:SparseCore 上的专家输入重排把服务吞吐量比原始 kernel 提高了 12%,而一个基于 VMEM 容量推导的阈值会在 SparseCore 卸载反而更慢时,把小集合通信留在 TensorCore 上。