软件栈
TileRT
也称为 TileRT engine、TileRT 引擎
先用大白话
TileRT 是面向极低延迟单用户生成的推理运行时,它把模型编译成一个常驻程序,而不是许多次内核启动。
技术定义
TileRT 是一款推理引擎,通过取消以单个 kernel 作为执行单元的范式,来实现超低延迟服务。
工程细节
常规运行时每个 decode 步骤都要依次派发一串 kernel,而在极小 batch 下,kernel 之间的启动与调度开销会盖过实际算术运算。常驻的 engine kernel 把工作保留在加速器上,这正是交互性坐标轴最右端得以企及的原因。
为什么重要
前沿曲线的高交互性一端与高吞吐一端是不同的工程问题,为其中一端调优的引擎很少能同时拿下另一端。对延迟敏感的产品来说,能达到每用户每秒数百 token 的方案很有价值,即便它的单芯片总吞吐量并不突出。
如何在 InferenceX 中解读
InferenceX 将 TileRT 作为独立的框架标签,并在每个 SKU 最佳配置视图中特意保留它;否则只按吞吐量取胜的曲线会丢掉 TileRT 真正服务的那些运行点。比较时请在匹配交互性下进行,而不要只看峰值吞吐量。