AI 推理术语表
软件栈

TileRT

也称为 TileRT engine、TileRT 引擎

先用大白话

TileRT 是面向极低延迟单用户生成的推理运行时,它把模型编译成一个常驻程序,而不是许多次内核启动。

技术定义

TileRT 是一款推理引擎,通过取消以单个 kernel 作为执行单元的范式,来实现超低延迟服务。

工程细节

常规运行时每个 decode 步骤都要依次派发一串 kernel,而在极小 batch 下,kernel 之间的启动与调度开销会盖过实际算术运算。常驻的 engine kernel 把工作保留在加速器上,这正是交互性坐标轴最右端得以企及的原因。

为什么重要

前沿曲线的高交互性一端与高吞吐一端是不同的工程问题,为其中一端调优的引擎很少能同时拿下另一端。对延迟敏感的产品来说,能达到每用户每秒数百 token 的方案很有价值,即便它的单芯片总吞吐量并不突出。

如何在 InferenceX 中解读

InferenceX 将 TileRT 作为独立的框架标签,并在每个 SKU 最佳配置视图中特意保留它;否则只按吞吐量取胜的曲线会丢掉 TileRT 真正服务的那些运行点。比较时请在匹配交互性下进行,而不要只看峰值吞吐量。