聚合服务
也称为 aggregated serving、agg serving、prefill 与 decode 同置、非分离式服务
先用大白话
聚合服务把 prefill 和 decode 放在同一组芯片上运行,是引擎加入 prefill-decode 分离之前的默认部署形态。
技术定义
聚合服务是每个副本在同一组加速器上同时处理每个请求的 prefill 和 decode 阶段的部署模式,与使用独立 prefill 池和 decode 池的分离式服务相对。
工程细节
在聚合模式下,调度器在一组设备上交错执行提示词处理和 token 生成,通常配合 chunked prefill 以免长提示词阻塞 decode。它不需要在池之间传输 KV cache,运维更简单,但 prefill 和 decode 争用同一份算力和内存带宽,两个阶段也无法独立扩缩或调优。分离式服务把两者分开,在机柜级系统的高并发下通常更优,代价是需要 NVIDIA 上的 NIXL 或 TPU 上的 TPU-Sync 这样的快速传输通路。外部 TPU 栈目前只支持聚合模式。
为什么重要
拿聚合与分离式对比属于 apples to bananas:它把部署模式的差异混进了硬件对比。InferenceX 在每条曲线上标注模式,让读者能把两者分开。
如何在 InferenceX 中解读
InferenceX Official Preview 比较 TPUv7 聚合 FP8 服务与 B200、B300 聚合 FP8 服务,Ironwood 的每美元性能最高高出 50%。与 GB300 NVL72 分离式服务相比,TPUv7 聚合在低延迟和高延迟端具有竞争力,但在曲线中段落后约 30%,直到 TPU 的分离式服务优化完成。
参考资料
在真实基准中理解这一概念
TPU 推理外部化全速推进
InferenceX、最高 50% 的每美元性能优势、TPU 软件栈的快速外部化、不断扩大的客户群、Ironwood、TPUv8i,以及正在收窄的 CUDA 护城河
GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍
DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。