DeepSeek V4.1 Flash 552BNVIDIA Blackwell
在 GB200 NVL72 上运行 DeepSeek V4.1 Flash
快速结论
运行 DeepSeek V4.1 Flash 时,GB200 NVL72 在每用户每秒 50 token 的交互速度下,单 GPU 总吞吐量(输入加输出)可持续达到 73,744 token/s,按超大规模云价格折合每百万 token $0.007,推理引擎为 vLLM。全部实测配置中最快 TTFT 为 0.3 ms,最快 TPOT 为 0.0 ms(两者各自取最优,可能来自不同配置)。
实测配置数
8
推理引擎
vLLM
精度
fp4
运行日期
2026-09-11 → 2026-09-11
各交互档位下的吞吐表现
推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在AgentX coding agent 工作负载下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。
| 单用户速度目标 | 单 GPU 每秒 token 数 | 每百万 token 成本 | 推理引擎 | 精度 |
|---|---|---|---|---|
| 30 tok/s | - | - | vLLM | fp4 |
| 50 tok/s | 73,744 | $0.007 | vLLM | fp4 |
| 75 tok/s | 58,204 | $0.009 | vLLM | fp4 |
| 100 tok/s | 45,519 | $0.011 | vLLM | fp4 |
| 150 tok/s | 27,723 | $0.019 | vLLM | fp4 |
| 200 tok/s | 18,841 | $0.027 | vLLM | fp4 |
实际部署成本
将每用户每秒 50 token 工作点的实测吞吐,按 SemiAnalysis AI Cloud TCO 模型的各档租用价格换算为每百万 token(输入加输出)成本。
| 价格档位 | $/GPU/小时 | 每百万 token 成本 |
|---|---|---|
| 自有 - 超大规模云大批量 | $1.86 | $0.007 |
| 零售租用 | $4.00 | $0.015 |
常见问题
- DeepSeek V4.1 Flash 在 GB200 NVL72 上能跑多快?
- 在AgentX coding agent 工作负载下运行 DeepSeek V4.1 Flash,目标交互速度为每用户每秒 50 token 时,GB200 NVL72 的单 GPU 总吞吐量(输入加输出)可持续达到 73,744 token/s,推理引擎为 vLLM,精度为 FP4。全部配置中的实测峰值总吞吐量为单 GPU 78,100 token/s。
- 在 GB200 NVL72 上部署 DeepSeek V4.1 Flash 的成本是多少?
- 按超大规模云大批量自有 $/GPU/小时 价格、每用户每秒 50 token 档位计算,每百万 token(输入加输出)成本为 $0.007。零售租用价格见上方表格;更慢的交互档位成本更低。
- 哪些推理引擎可以在 GB200 NVL72 上运行 DeepSeek V4.1 Flash?
- 本页数据来自 vLLM,精度覆盖 FP4。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
- 这些 DeepSeek V4.1 Flash 数据是如何测得的?
- 所有数字均由 InferenceX 集群在真实 GB200 NVL72 硬件上实测,通过在AgentX coding agent 工作负载下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-09-11。推导方式与 InferenceX 总览排行榜完全一致。