AI 推理术语表
软件栈

Triton

也称为 OpenAI Triton、Triton kernel 语言

先用大白话

Triton 是基于 Python 的加速器 kernel 编写语言,让 ML 工程师不写底层代码也能接近手工调优的速度。

技术定义

Triton 是开源的 kernel 编程语言和编译器,开发者用类 Python 代码编写高性能加速器 kernel,在维护后端的厂商之间可移植。

工程细节

传统上写出峰值性能的 kernel 需要 CUDA 或汇编级调优的厂商专家知识。Triton 抬高了抽象层级:开发者编写块级程序,编译器处理访存合并、分块和调度。NVIDIA、AMD 等厂商维护后端,同一份 kernel 源码可以面向多种架构。推理引擎用它实现融合算子、量化路径和没有厂商库可用的 MoE kernel。这个名字与 NVIDIA Triton Inference Server 重名,后者是另一个独立的模型服务产品。

为什么重要

Triton 降低了模型研究者与硬件性能之间的门槛,其跨厂商后端具有战略意义,因为用它写的 kernel 不会锁定在单一芯片家族上。厂商把 Triton 生态运营得好不好,已经成为其软件叙事的一部分。

如何在 InferenceX 中解读

InferenceX 配置中的引擎在 CUDA、CUTLASS 和 AITER 代码之外还携带大量 Triton kernel,因此编译器与后端成熟度是 NVIDIA 和 AMD 系统上引擎版本之间曲线移动的隐形推力之一。