AI 推理术语表
推理服务

离线推理

也称为 offline inference、batch inference、批量推理

先用大白话

离线推理处理一大堆没有用户在等的请求,唯一目标是每美元最多 token,而不是延迟。

技术定义

离线推理是没有交互截止时间的模型服务,请求成批处理,目标是总吞吐量和成本而不是单用户延迟。

工程细节

合成数据生成、文档处理、embedding 回填和评估扫描都不在乎单个请求何时返回。调度器因此可以放开手脚:跑内存允许的最大批次、按前缀复用最大化的方式排序请求、把加速器压在吞吐量极限上。在线服务处于同一权衡的另一端,用吞吐量换取每个用户不低于某个交互性下限。

为什么重要

同一套硬件在离线模式与紧延迟模式之间,每美元 token 数可以相差数倍,所以不说明工作点就报每百万 token 价格几乎没有意义。集群常常因此划分成不同的延迟档位。

如何在 InferenceX 中解读

InferenceX 吞吐量对交互性曲线的最右端,即批次最大、单用户速度最低处,近似离线运行。在一条曲线的两端各读一次,就能看到该配置从在线到离线的完整成本区间。