推理服务
RadixAttention
也称为 radix attention、radix tree 缓存、基数树前缀缓存
先用大白话
RadixAttention 把完成请求的 KV cache 按 token 内容存进基数树,任何新请求都能复用最长匹配前缀。
技术定义
RadixAttention 是 SGLang 的前缀缓存设计,请求结束后把 KV cache 条目保留在基数树中,让共享 token 前缀的请求之间自动复用。
工程细节
基数树按 token 内容索引缓存片段,一次查找就能定位新请求已被计算过的最长前缀。复用是自动且跨请求的:多轮对话、许多用户共享的系统提示词、从共同历史分叉出的 agent 分支都会命中相同的缓存节点。近期最少使用等淘汰策略约束树占用的内存上限。
为什么重要
前缀复用把重复的 prefill 计算变成缓存命中。在每一轮都重发不断增长历史的 agent 流量里,这部分节省可以主导端到端成本。把复用做成结构性能力而不是可选项,是 SGLang 在此类工作负载上表现出色的重要原因。
如何在 InferenceX 中解读
InferenceX 的 AgentX 轨迹保留了轮次之间和子智能体分支之间真实的共享前缀结构,因此具备强 radix 式复用能力的引擎在智能体场景中的首 token 时间和吞吐量,会明显好于固定序列场景的预测。