全部模型与 GPU 组合
DeepSeekv4 Pro 0813 1.6TNVIDIA Blackwell

在 GB300 NVL72 上运行 DeepSeek V4 Pro

快速结论

DeepSeek V4 Pro 在 GB300 NVL72 上、每用户每秒 50 token 档位下单 GPU 可持续输出 2,939 token/s,按超大规模云价格折合每百万 token $0.22,推理引擎为 Dynamo SGLang。全部实测配置中最快 TTFT 为 0.3 ms,最快 TPOT 为 0.0 ms(两者各自取最优,可能来自不同配置)。

实测配置数

106

推理引擎

Dynamo SGLang, Dynamo TRTLLM, Dynamo vLLM

精度

fp4

运行日期

2026-06-032026-08-25

各交互档位下的吞吐表现

推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在单轮对话工作负载(8k 输入 / 1k 输出)下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。

单用户速度目标单 GPU 每秒 token 数每百万 token 成本推理引擎精度
30 tok/s--Dynamo SGLangfp4
50 tok/s2,939$0.22Dynamo SGLangfp4
75 tok/s1,224$0.52Dynamo SGLangfp4
100 tok/s3,563$0.18Dynamo SGLangfp4
150 tok/s1,223$0.52Dynamo SGLangfp4
200 tok/s306$2.10Dynamo SGLangfp4

实际部署成本

将每用户每秒 50 token 工作点的实测吞吐,按 SemiAnalysis AI Cloud TCO 模型的各档租用价格换算为每百万 token(输入加输出)成本。

价格档位$/GPU/小时每百万 token 成本
超大规模云$2.31$0.22
新兴云$2.79$0.26
零售租用$3.30$0.31

常见问题

DeepSeek V4 Pro 在 GB300 NVL72 上能跑多快?
在单轮对话工作负载(8k 输入 / 1k 输出)、每用户每秒 50 token 的交互档位下,GB300 NVL72 部署 DeepSeek V4 Pro 单 GPU 可持续输出 2,939 token/s,推理引擎为 Dynamo SGLang,精度 FP4。全部配置中的实测峰值吞吐为单 GPU 135,733 token/s。
在 GB300 NVL72 上部署 DeepSeek V4 Pro 的成本是多少?
按超大规模云 $/GPU/小时 价格、每用户每秒 50 token 档位计算,每百万 token(输入加输出)成本为 $0.22。新兴云与零售租用价格见上方表格;更慢的交互档位成本更低。
哪些推理引擎可以在 GB300 NVL72 上运行 DeepSeek V4 Pro?
本页数据来自 Dynamo SGLang、Dynamo TRTLLM、Dynamo vLLM,精度覆盖 FP4,包含 prefill 分离部署,并包含多节点部署。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
这些 DeepSeek V4 Pro 数据是如何测得的?
所有数字均由 InferenceX 集群在真实 GB300 NVL72 硬件上实测,通过在单轮对话工作负载(8k 输入 / 1k 输出)下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-08-25。推导方式与 InferenceX 总览排行榜完全一致。

继续探索数据