在 DeepSeek V4 Pro 上,NVIDIA 最有竞争力的方案是 GB300 Dynamo TRTLLM 和 GB200 Dynamo vLLM。两者都依靠 prefill-decode 分离,在合理的交互性下取得高吞吐。GB300 配置还额外采用了 DEP32 的宽专家并行解码实例,以在前沿曲线中段获得更高吞吐。

两个点在 token 速率上比在首 token 延迟上更接近
以每用户每秒 token 数衡量时,2xDEP8+1xDEP12 的 GB200 点与 3xDEP8+1xDEP16 的 GB300 点相当接近;但以首 token 延迟衡量时,两者差距明显更大。因此只看交互性坐标轴,会低估这两种配置行为上的差异。
总体而言,TTFT 对工作负载的「突发性」更敏感。GB300 那个点的总并发要高得多,因而会遇到更多子智能体流量,也就有更多冷 prefill。子智能体带着全新上下文启动,没有可复用的前缀,因此它的第一条请求是完整 prefill 而不是缓存命中;当足够多这样的请求同时到达时,尾部延迟就会被推高。

为什么这是 agentic 效应而不是硬件效应
在定长工作负载上完全看不到这些。在 8k1k 场景中,每条请求彼此独立且形状相同,因此提高并发只是放大 batch,并不改变已缓存与未缓存工作的构成。而在 AgentX 上,提高并发会改变流量本身的组成:会话更多意味着并行的子智能体分支更多,而这些分支是成簇到达的,不是平滑的请求流。
实际的读法是:一套为了在吞吐曲线上更靠右而调优的机架级配置,同时也接受了更具突发性的 prefill 负载;这个选择的代价落在首 token 延迟上,而不是同一张图所展示的 token 速率上。

本文结果只是 AgentX 1.0 的一个切面。完整分析、回放方法,以及该基准测试推动的 70 多个上游 PR,请见 AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?。每个数据点都可以在免费仪表板上自行探索。
本文由英文原文翻译而来,如有歧义以英文版为准。所有文章版权归 © SemiAnalysis 所有,保留所有权利。覆盖应用源代码的 AGPL-3.0 许可证不适用于文章内容。