AI 推理术语表
智能体推理

智能体推理

也称为 agentic inference、AI 智能体推理、agent 推理

先用大白话

智能体会通过多次模型请求完成一项任务,期间可能调用工具、保留会话状态,也可能把部分工作交给 subagent。

技术定义

智能体推理是为 AI agent 提供模型服务的过程。此类 agent 会在多个轮次间保留状态、调用工具、复用不断增长的上下文,并可能并行运行 subagent。

工程细节

一次智能体会话会在模型请求、工具执行和等待之间交替。后续请求通常携带大部分历史对话,因此 prefix cache 和 KV cache 容量会直接影响速度与成本。并行 subagent 还会产生各自具有时间关系和上下文增长过程的请求分支。

为什么重要

固定 input 和 output 长度无法覆盖智能体带来的全部服务压力。长共享前缀会改变 cache 行为,工具等待会让流量呈现突发性,并行分支则会争用推理容量。同一组软硬件在这种请求模式下可能出现不同的性能排序。

如何在 InferenceX 中解读

InferenceX 使用 AgentX 测量智能体推理。AgentX 与固定序列场景回答不同的容量问题,应分别比较。AgentX 采用闭环会话回放,同一会话中的后续请求会受前一轮完成时间影响。