软件栈
llm-d
也称为 llm-d、llm-d 项目、Kubernetes LLM 服务、分布式推理编排
先用大白话
llm-d 是一个 Kubernetes 原生框架,在多节点上运行 vLLM,提供智能路由、前缀感知调度和 prefill 与 decode 分离。
技术定义
llm-d 是基于 Kubernetes 和 vLLM 构建的开源分布式推理服务框架,为大模型部署提供 KV 感知路由、prefill-decode 分离和多节点调度。
工程细节
单个 vLLM 实例只服务一个副本。生产部署需要一层把每个请求路由到最可能缓存了其前缀的副本,把 prefill 和 decode 拆到不同的池,并独立扩缩这些池。llm-d 提供这种编排,由 Red Hat、Google 等贡献者支持。llm-d 的 TPU 支持是 Google 外部化 prefill-decode 分离工作的一部分,与 TPU-Sync 传输库配套,让外部 TPU 客户能运行 Google 内部为 Gemini 使用的同一种分离式拓扑。
为什么重要
分离式服务和 KV 感知路由是 TPU 剩余每美元性能收益的主要来源,而它们只存在于引擎之上。让这些功能在 Google 之外可用,在广泛使用的编排层中提供 TPU 支持与引擎后端同样重要。
如何在 InferenceX 中解读
InferenceX 的单节点聚合结果不涉及 llm-d。计划中的 TPUv7 分离式与 GB200、GB300 NVL72 的对比,取决于 llm-d 和 TPU-Sync 的工作在外部栈中落地。
参考资料