CUTLASS
也称为 CuTe、CUDA 线性代数模板库
先用大白话
CUTLASS 是 NVIDIA 的模板库,提供搭建接近硬件峰值速度的矩阵乘法 kernel 所需的积木。
技术定义
CUTLASS 是 NVIDIA 开源的可组合 C++ 模板库,用于构建面向各代 GPU tensor core 的 GEMM 及相关 kernel。
工程细节
峰值矩阵乘法性能要求对 tensor core 指令、共享内存搬运和异步流水线的精确编排,而且每代架构都不同。CUTLASS 把这套编排封装成可组合的部件,其 CuTe 层描述数据布局,kernel 作者可以拼装出接近峰值的 GEMM,并在尾部融合偏置、激活或量化缩放,而不必从零开始。推理引擎中大量高性能 kernel 直接建在它之上。
为什么重要
CUTLASS 是 NVIDIA 教生态使用每一代新 tensor core 的地方,包括 Blackwell 上的 FP4 和 FP8 路径。其模式向引擎扩散的速度,是新芯片多快达到宣称性能的真实变量。
如何在 InferenceX 中解读
InferenceX 在 NVIDIA 硬件上的结果背后,GEMM 和注意力 kernel 大量源于 CUTLASS 衍生代码,引擎镜像里这些库的版本升级是平台追踪到的曲线逐日变化的常见来源。
参考资料
在真实基准中理解这一概念
SGLang 0.5.6 在 B200 DeepSeek R1 FP4 上的表现:低并发下最高提升 1.8 倍
针对 DeepSeek V3 的分段 CUDA graph、统一事件循环和 JIT 内核将 8k/1k 吞吐量从 508 提升至 907 tok/s/GPU,使用相同的 16 GPU B200 资源池
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。