全部模型与 GPU 组合
Qwen 3.5 397B-A17BNVIDIA Blackwell

在 GB300 NVL72 上运行 Qwen3.5

快速结论

Qwen3.5 可在 GB300 NVL72 上运行:目前已有 67 组实测配置,各档位实测结果见下方阶梯表。

实测配置数

67

推理引擎

Dynamo SGLang, Dynamo TRTLLM

精度

fp4, fp8

运行日期

2026-07-132026-08-25

各交互档位下的吞吐表现

推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在单轮对话工作负载(8k 输入 / 1k 输出)下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。

单用户速度目标单 GPU 每秒 token 数每百万 token 成本推理引擎精度
30 tok/s--Dynamo SGLangfp8
50 tok/s--Dynamo SGLangfp8
75 tok/s--Dynamo SGLangfp8
100 tok/s4,920$0.13Dynamo SGLangfp8
150 tok/s1,878$0.34Dynamo SGLangfp8
200 tok/s1,034$0.62Dynamo SGLangfp8

常见问题

Qwen3.5 在 GB300 NVL72 上能跑多快?
InferenceX 集群已为该组合完成 67 组实测配置,各交互档位的实测结果见上方阶梯表。
在 GB300 NVL72 上部署 Qwen3.5 的成本是多少?
每百万 token 成本由实测吞吐和 SemiAnalysis AI Cloud TCO 模型的 $/GPU/小时 价格换算得出,待该组合达到主交互档位后即会显示。
哪些推理引擎可以在 GB300 NVL72 上运行 Qwen3.5?
本页数据来自 Dynamo SGLang、Dynamo TRTLLM,精度覆盖 FP4、FP8,包含 prefill 分离部署,并包含多节点部署。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
这些 Qwen3.5 数据是如何测得的?
所有数字均由 InferenceX 集群在真实 GB300 NVL72 硬件上实测,通过在单轮对话工作负载(8k 输入 / 1k 输出)下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-08-25。推导方式与 InferenceX 总览排行榜完全一致。

继续探索数据