智能体推理
多轮推理
也称为 multi-turn inference、多轮服务、多轮工作负载
先用大白话
多轮会话会连续向模型发送相关请求,把之前的对话和工具结果带入后续提示词。
技术定义
多轮推理为一系列相关的模型请求提供服务,后续输入包含前几轮留下的状态或对话历史。
工程细节
智能体会话可能包含数十甚至数百轮。模型输出和工具结果会扩展下一轮提示词,因此大量输入可能已有可复用的缓存状态。工具执行和请求依赖关系还会改变工作到达服务器的时间。
为什么重要
相互独立的提示词序列无法重现这些依赖关系,也无法重现不断增长的缓存工作集。缓存淘汰会导致重复 prefill;即使总吞吐量较高,某次响应过慢仍可能推迟下一轮。
如何在 InferenceX 中解读
Rubin 文章将多轮结构列为 AgentX 工作负载的主要特征。应在相同智能体场景内比较结果,不能直接套用固定长度、独立请求测试得出的排名。