gpt-oss 120BNVIDIA Blackwell
在 GB200 NVL72 上运行 gpt-oss-120b
快速结论
gpt-oss-120b 可在 GB200 NVL72 上运行:目前已有 34 组实测配置,各档位实测结果见下方阶梯表。
实测配置数
34
推理引擎
Dynamo TRTLLM
精度
fp4
运行日期
2026-01-07 → 2026-01-07
各交互档位下的吞吐表现
推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在单轮对话工作负载(8k 输入 / 1k 输出)下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。
| 单用户速度目标 | 单 GPU 每秒 token 数 | 每百万 token 成本 | 推理引擎 | 精度 |
|---|---|---|---|---|
| 30 tok/s | - | - | - | - |
| 50 tok/s | - | - | - | - |
| 75 tok/s | - | - | - | - |
| 100 tok/s | - | - | - | - |
| 150 tok/s | - | - | - | - |
| 200 tok/s | - | - | - | - |
常见问题
- gpt-oss-120b 在 GB200 NVL72 上能跑多快?
- InferenceX 集群已为该组合完成 34 组实测配置,各交互档位的实测结果见上方阶梯表。
- 在 GB200 NVL72 上部署 gpt-oss-120b 的成本是多少?
- 每百万 token 成本由实测吞吐和 SemiAnalysis AI Cloud TCO 模型的 $/GPU/小时 价格换算得出,待该组合达到主交互档位后即会显示。
- 哪些推理引擎可以在 GB200 NVL72 上运行 gpt-oss-120b?
- 本页数据来自 Dynamo TRTLLM,精度覆盖 FP4,包含 prefill 分离部署,并包含多节点部署。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
- 这些 gpt-oss-120b 数据是如何测得的?
- 所有数字均由 InferenceX 集群在真实 GB200 NVL72 硬件上实测,通过在单轮对话工作负载(8k 输入 / 1k 输出)下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-01-07。推导方式与 InferenceX 总览排行榜完全一致。