软件栈GEMM
GEMM
也称为 通用矩阵乘法、matrix multiply
先用大白话
GEMM 即通用矩阵乘法,是训练和推理神经网络时占据绝大部分算术量的那一种计算。
技术定义
GEMM 是通用的矩阵乘矩阵例程,神经网络中的线性层、注意力投影和专家计算最终都归结为它。
工程细节
Transformer 主要由线性变换堆叠而成,服务一个模型就是执行海量矩阵乘法。tensor core 专为加速它们而存在,峰值 TFLOP/s 规格也是针对这类稠密运算给出的。形状决定效率:prefill 产生接近方形的大矩阵乘法能喂饱算力,decode 产生的细长矩阵则受带宽限制。MoE 还带来分组 GEMM,把许多小型专家乘法合并成一次高效启动。
为什么重要
GEMM 效率是行业里一切性能主张的地基。在真实服务形状下,尤其是 decode 的细长矩阵上,实际交付与峰值 GEMM 吞吐量的差距,解释了规格表比例为何预测不了基准测试排名。
如何在 InferenceX 中解读
InferenceX 每条曲线背后都是来自 CUTLASS、hipBLASLt 和 Triton 生成代码的 GEMM kernel 堆栈,量化配置最终也站在各厂商在其调度器产生的形状上执行低精度 GEMM 的能力之上。
参考资料
在真实基准中理解这一概念
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
AMD MI355X GLM-5 推理:SGLang FP8 单节点每百万 token 成本比 B200 最高低 40%
GLM-5 发布 14 周后,AMD 在 MI355X 上同时实现了 SGLang FP8 的 MTP 和非 MTP 方案 — 通过 TileLang 实现的融合 MLA + FP8 KV 缓存在大部分性能 Pareto 前沿上将单节点 FP8 成本曲线翻转为 AMD 占优