AI 推理术语表
硬件

SparseCore

也称为 SparseCore、SparseCores、TPU SparseCore、SC

先用大白话

SparseCore 是 TPU 芯片上的辅助核心,负责 gather、数据搬运等不规则任务,让矩阵单元专心做乘法。

技术定义

SparseCore 是 TPU 上专门处理稀疏和不规则操作的核心,负责 embedding 查表、gather、permute 和数据搬运,与同一芯片上的稠密 TensorCore 并行运行。

工程细节

Ironwood 每颗芯片有 4 个第三代 SparseCore 和 2 个 TensorCore。稠密矩阵引擎处理不规则访问模式时效率很低,因此 TPU 团队把这类工作交给 SparseCore。在外部推理栈中,把每个专家的 token 收集成连续分组的 MoE permute、ragged gather-reduce 路径中的 top-k 权重 gather,以及 ReduceScatter 集合通信都在 SparseCore 上运行。TensorCore 继续执行专家矩阵乘法,SparseCore 同时重排数据并搬运部分和,双缓冲让两者重叠。

为什么重要

offload 并非没有代价。能装进 VMEM 的小集合通信放到 SparseCore 上可能因为启动开销而更慢,所以 Qwen3.5 用一个由 VMEM 容量推导出的阈值来决定哪些 all-reduce 和 all-gather 需要迁移。这个分工的调优是逐层延迟收益的常见来源。

如何在 InferenceX 中解读

SparseCore MoE permute 重写在 Ironwood 上使 8k1k 服务吞吐量提高 12%,同时降低了 TTFT 和 TPOT。把 top-k 权重 gather 迁移过去后,DeepSeek-V3 微基准中 TensorCore 开销从 29 微秒降到 14 微秒;集合通信阈值在并发 64 和 128 下分别带来 2.7% 和 5.7% 的收益。