AI 推理术语表
软件栈GEMM

GEMM

也称为 通用矩阵乘法、matrix multiply

先用大白话

GEMM 即通用矩阵乘法,是训练和推理神经网络时占据绝大部分算术量的那一种计算。

技术定义

GEMM 是通用的矩阵乘矩阵例程,神经网络中的线性层、注意力投影和专家计算最终都归结为它。

工程细节

Transformer 主要由线性变换堆叠而成,服务一个模型就是执行海量矩阵乘法。tensor core 专为加速它们而存在,峰值 TFLOP/s 规格也是针对这类稠密运算给出的。形状决定效率:prefill 产生接近方形的大矩阵乘法能喂饱算力,decode 产生的细长矩阵则受带宽限制。MoE 还带来分组 GEMM,把许多小型专家乘法合并成一次高效启动。

为什么重要

GEMM 效率是行业里一切性能主张的地基。在真实服务形状下,尤其是 decode 的细长矩阵上,实际交付与峰值 GEMM 吞吐量的差距,解释了规格表比例为何预测不了基准测试排名。

如何在 InferenceX 中解读

InferenceX 每条曲线背后都是来自 CUTLASS、hipBLASLt 和 Triton 生成代码的 GEMM kernel 堆栈,量化配置最终也站在各厂商在其调度器产生的形状上执行低精度 GEMM 的能力之上。