AI 推理术语表
推理服务

聚合服务

也称为 aggregated serving、agg serving、prefill 与 decode 同置、非分离式服务

先用大白话

聚合服务把 prefill 和 decode 放在同一组芯片上运行,是引擎加入 prefill-decode 分离之前的默认部署形态。

技术定义

聚合服务是每个副本在同一组加速器上同时处理每个请求的 prefill 和 decode 阶段的部署模式,与使用独立 prefill 池和 decode 池的分离式服务相对。

工程细节

在聚合模式下,调度器在一组设备上交错执行提示词处理和 token 生成,通常配合 chunked prefill 以免长提示词阻塞 decode。它不需要在池之间传输 KV cache,运维更简单,但 prefill 和 decode 争用同一份算力和内存带宽,两个阶段也无法独立扩缩或调优。分离式服务把两者分开,在机柜级系统的高并发下通常更优,代价是需要 NVIDIA 上的 NIXL 或 TPU 上的 TPU-Sync 这样的快速传输通路。外部 TPU 栈目前只支持聚合模式。

为什么重要

拿聚合与分离式对比属于 apples to bananas:它把部署模式的差异混进了硬件对比。InferenceX 在每条曲线上标注模式,让读者能把两者分开。

如何在 InferenceX 中解读

InferenceX Official Preview 比较 TPUv7 聚合 FP8 服务与 B200、B300 聚合 FP8 服务,Ironwood 的每美元性能最高高出 50%。与 GB300 NVL72 分离式服务相比,TPUv7 聚合在低延迟和高延迟端具有竞争力,但在曲线中段落后约 30%,直到 TPU 的分离式服务优化完成。