AI 推理术语表
智能体推理

子智能体请求突发

也称为 subagent bursts、sub-agent bursts、智能体突发流量

先用大白话

智能体同时启动多个短时运行的子任务,会突然增加请求量和服务器需要保存的新上下文。

技术定义

子智能体请求突发是指主智能体启动多个下级任务,各自发出请求序列,从而在短时间内增加推理需求。

工程细节

主会话可能已有很长的可复用前缀,新分支却可能从全新上下文开始。这些分支会产生重叠的 prefill 和 decode 工作,并暂时扩大 KV cache 工作集。分支的启动时间和依赖关系与请求数量同样重要。

为什么重要

较高的平均缓存命中率可能掩盖某些时段大量新增的 prefill 需求。容量规划还需考虑突发时序、缓存淘汰,以及那些必须完成后主任务才能继续的分支延迟。

如何在 InferenceX 中解读

Rubin 文章将子智能体突发、多轮会话、长上下文和高前缀复用共同列为工作负载特征。因此,AgentX 比较的是随时间变化的请求模式,而不是由相同提示词组成的恒定批次。