智能体推理
也称为 agentic inference、AI 智能体推理、agent 推理
先用大白话
智能体会通过多次模型请求完成一项任务,期间可能调用工具、保留会话状态,也可能把部分工作交给 subagent。
技术定义
智能体推理是为 AI agent 提供模型服务的过程。此类 agent 会在多个轮次间保留状态、调用工具、复用不断增长的上下文,并可能并行运行 subagent。
工程细节
一次智能体会话会在模型请求、工具执行和等待之间交替。后续请求通常携带大部分历史对话,因此 prefix cache 和 KV cache 容量会直接影响速度与成本。并行 subagent 还会产生各自具有时间关系和上下文增长过程的请求分支。
为什么重要
固定 input 和 output 长度无法覆盖智能体带来的全部服务压力。长共享前缀会改变 cache 行为,工具等待会让流量呈现突发性,并行分支则会争用推理容量。同一组软硬件在这种请求模式下可能出现不同的性能排序。
如何在 InferenceX 中解读
InferenceX 使用 AgentX 测量智能体推理。AgentX 与固定序列场景回答不同的容量问题,应分别比较。AgentX 采用闭环会话回放,同一会话中的后续请求会受前一轮完成时间影响。
参考资料
在真实基准中理解这一概念
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM