智能体推理
子智能体请求突发
也称为 subagent bursts、sub-agent bursts、智能体突发流量
先用大白话
智能体同时启动多个短时运行的子任务,会突然增加请求量和服务器需要保存的新上下文。
技术定义
子智能体请求突发是指主智能体启动多个下级任务,各自发出请求序列,从而在短时间内增加推理需求。
工程细节
主会话可能已有很长的可复用前缀,新分支却可能从全新上下文开始。这些分支会产生重叠的 prefill 和 decode 工作,并暂时扩大 KV cache 工作集。分支的启动时间和依赖关系与请求数量同样重要。
为什么重要
较高的平均缓存命中率可能掩盖某些时段大量新增的 prefill 需求。容量规划还需考虑突发时序、缓存淘汰,以及那些必须完成后主任务才能继续的分支延迟。
如何在 InferenceX 中解读
Rubin 文章将子智能体突发、多轮会话、长上下文和高前缀复用共同列为工作负载特征。因此,AgentX 比较的是随时间变化的请求模式,而不是由相同提示词组成的恒定批次。