AI 推理术语表
软件栈

CUTLASS

也称为 CuTe、CUDA 线性代数模板库

先用大白话

CUTLASS 是 NVIDIA 的模板库,提供搭建接近硬件峰值速度的矩阵乘法 kernel 所需的积木。

技术定义

CUTLASS 是 NVIDIA 开源的可组合 C++ 模板库,用于构建面向各代 GPU tensor core 的 GEMM 及相关 kernel。

工程细节

峰值矩阵乘法性能要求对 tensor core 指令、共享内存搬运和异步流水线的精确编排,而且每代架构都不同。CUTLASS 把这套编排封装成可组合的部件,其 CuTe 层描述数据布局,kernel 作者可以拼装出接近峰值的 GEMM,并在尾部融合偏置、激活或量化缩放,而不必从零开始。推理引擎中大量高性能 kernel 直接建在它之上。

为什么重要

CUTLASS 是 NVIDIA 教生态使用每一代新 tensor core 的地方,包括 Blackwell 上的 FP4 和 FP8 路径。其模式向引擎扩散的速度,是新芯片多快达到宣称性能的真实变量。

如何在 InferenceX 中解读

InferenceX 在 NVIDIA 硬件上的结果背后,GEMM 和注意力 kernel 大量源于 CUTLASS 衍生代码,引擎镜像里这些库的版本升级是平台追踪到的曲线逐日变化的常见来源。