AI 推理术语表
智能体推理

多轮推理

也称为 multi-turn inference、多轮服务、多轮工作负载

先用大白话

多轮会话会连续向模型发送相关请求,把之前的对话和工具结果带入后续提示词。

技术定义

多轮推理为一系列相关的模型请求提供服务,后续输入包含前几轮留下的状态或对话历史。

工程细节

智能体会话可能包含数十甚至数百轮。模型输出和工具结果会扩展下一轮提示词,因此大量输入可能已有可复用的缓存状态。工具执行和请求依赖关系还会改变工作到达服务器的时间。

为什么重要

相互独立的提示词序列无法重现这些依赖关系,也无法重现不断增长的缓存工作集。缓存淘汰会导致重复 prefill;即使总吞吐量较高,某次响应过慢仍可能推迟下一轮。

如何在 InferenceX 中解读

Rubin 文章将多轮结构列为 AgentX 工作负载的主要特征。应在相同智能体场景内比较结果,不能直接套用固定长度、独立请求测试得出的排名。