AI 推理术语表
硬件

Tile 补齐

也称为 tile padding、shape padding、MXU padding、lane padding

先用大白话

tile 补齐指矩阵维度小于硬件 tile 时用零填满所浪费的计算。

技术定义

tile 补齐是把张量维度向上取整到计算单元或向量单元原生 tile 尺寸的过程,被补齐的单元占用硬件周期却不贡献结果。

工程细节

TPU 的 MXU 边长在旧代为 128,在 v6e 和 v7 为 256,向量单元处理的 tile 末维为 128 lane。XLA 会把更小的轴补齐到整个 tile。Llama 3 8B 的 head dim 为 128,正好是 256 宽 MXU 的一半,两个注意力矩阵乘法的利用率上限因此只有 50%。gpt-oss 的 head dim 为 64,上限降到 25%。DeepSeek MLA 把 query-key 维度拆成 128 加 64 共 192,在任何 2 的幂阵列上都不合适。在 batched attention kernel 中,每设备单个 FP8 KV head 曾让每个 tile 一半是填充,直到 sequence-on-lane 布局把 token 放到 128 lane 轴上。

为什么重要

GPU 矩阵核心消费小 tile,因此 head dim 64 或 128 以及切分后奇怪的 KV head 数在 H100 或 B200 上都接近峰值。在 TPU 上,同样的选择在写任何 kernel 之前就是直接的吞吐量损失。因此 bring-up 成本取决于模型与 tile 几何的匹配度,而不是模型的流行度。

如何在 InferenceX 中解读

sequence-on-lane KV 布局在报告的 Ironwood 配置中把可用 KV page 从 5,141 翻倍到 10,283,并发 128 下 8k1k 吞吐量提高 16.5%,中位 TTFT 下降 95%。ragged paged attention 中显式的 packing 维度就是为了绕开 XLA 的默认切分。