Triton
也称为 OpenAI Triton、Triton kernel 语言
先用大白话
Triton 是基于 Python 的加速器 kernel 编写语言,让 ML 工程师不写底层代码也能接近手工调优的速度。
技术定义
Triton 是开源的 kernel 编程语言和编译器,开发者用类 Python 代码编写高性能加速器 kernel,在维护后端的厂商之间可移植。
工程细节
传统上写出峰值性能的 kernel 需要 CUDA 或汇编级调优的厂商专家知识。Triton 抬高了抽象层级:开发者编写块级程序,编译器处理访存合并、分块和调度。NVIDIA、AMD 等厂商维护后端,同一份 kernel 源码可以面向多种架构。推理引擎用它实现融合算子、量化路径和没有厂商库可用的 MoE kernel。这个名字与 NVIDIA Triton Inference Server 重名,后者是另一个独立的模型服务产品。
为什么重要
Triton 降低了模型研究者与硬件性能之间的门槛,其跨厂商后端具有战略意义,因为用它写的 kernel 不会锁定在单一芯片家族上。厂商把 Triton 生态运营得好不好,已经成为其软件叙事的一部分。
如何在 InferenceX 中解读
InferenceX 配置中的引擎在 CUDA、CUTLASS 和 AITER 代码之外还携带大量 Triton kernel,因此编译器与后端成熟度是 NVIDIA 和 AMD 系统上引擎版本之间曲线移动的隐形推力之一。
参考资料
在真实基准中理解这一概念
MI355X 上 DeepSeek-V4-Pro 搭配 SGLang:26 天内每 GPU 吞吐量提升 110.5 倍
amd/deepseek_v4 分支合入了 TileLang 注意力索引器、Triton 稀疏 MLA、融合 RoPE/Hadamard、FlyDSL MoE 以及 FP4 权重,历经 31 个性能优化 PR——将首次点亮时 20 tok/s/GPU、2.4 tok/s/user 的水平提升至 8K/1K 负载下 2,256 tok/s/GPU、9.4 tok/s/user,吞吐量与交互性同步攀升
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM