AI 推理术语表
推理服务

KV 感知路由

也称为 KV-aware routing、缓存感知路由、会话亲和性

先用大白话

KV 感知路由把请求发给已经持有该会话状态的 worker,而不是发给当前最空闲的那个。

技术定义

KV 感知路由依据已缓存前缀状态所在的位置来选择 worker,而不是只看队列深度或负载。

工程细节

不带可复用历史的请求发给谁都行,此时只需考虑负载均衡;但带着数 MB 已缓存前缀的请求不同,把它发给没有该前缀的空闲 worker,就要为整条提示词再付一次代价。因此 router 会跟踪 cache 事件、按会话哈希到固定 worker,并让数据并行 rank 对其持有状态的会话保持粘性。

为什么重要

在数据并行注意力下,每个 rank 只拥有缓存池的一部分,长会话一旦落到错误的 rank 上就要全部重算,实测命中率会远低于理论上限。仅有亲和性也不够:不加约束的粘性会把负载集中到单个热点 worker,因此缓存均衡也必须进入路由打分。

如何在 InferenceX 中解读

路由位于引擎之外,因此 InferenceX 把它视为方案的一部分:Dynamo vLLM、llm-d vLLM、Mooncake ATOMesh 这类标签同时标明编排层和运行时。它的开销正比于在线前缀的数量和长度,而不是生成的 token 数,所以在内核变快之后,它可能成为 agentic 流量下的瓶颈。