Qwen 3.8 Flash Next 176B-A6BNVIDIA Blackwell
在 B300 上运行 Qwen3.8-Flash-Next
快速结论
Qwen3.8-Flash-Next 可在 B300 上运行:目前已有 5 组实测配置,各档位实测结果见下方阶梯表。
实测配置数
5
推理引擎
SGLang
精度
fp4
运行日期
2026-08-27 → 2026-08-27
各交互档位下的吞吐表现
推理部署是一种权衡:单 GPU 上并发用户越多,每个用户收到 token 的速度就越慢。下表在AgentX 智能体编码工作负载下按每个单用户速度目标读取实测前沿,取该工作点上最优的引擎与精度。
| 单用户速度目标 | 单 GPU 每秒 token 数 | 每百万 token 成本 | 推理引擎 | 精度 |
|---|---|---|---|---|
| 30 tok/s | - | - | SGLang | fp4 |
| 50 tok/s | - | - | SGLang | fp4 |
| 75 tok/s | - | - | SGLang | fp4 |
| 100 tok/s | 72,091 | $0.009 | SGLang | fp4 |
| 150 tok/s | 47,295 | $0.013 | SGLang | fp4 |
| 200 tok/s | - | - | SGLang | fp4 |
常见问题
- Qwen3.8-Flash-Next 在 B300 上能跑多快?
- InferenceX 集群已为该组合完成 5 组实测配置,各交互档位的实测结果见上方阶梯表。
- 在 B300 上部署 Qwen3.8-Flash-Next 的成本是多少?
- 每百万 token 成本由实测吞吐和 SemiAnalysis AI Cloud TCO 模型的 $/GPU/小时 价格换算得出,待该组合达到主交互档位后即会显示。
- 哪些推理引擎可以在 B300 上运行 Qwen3.8-Flash-Next?
- 本页数据来自 SGLang,精度覆盖 FP4。推理引擎持续重新构建并重跑基准,最优配置可能随时变化。
- 这些 Qwen3.8-Flash-Next 数据是如何测得的?
- 所有数字均由 InferenceX 集群在真实 B300 硬件上实测,通过在AgentX 智能体编码工作负载下扫描并发数绘制吞吐与交互速度前沿曲线;最新一次运行落在 2026-08-27。推导方式与 InferenceX 总览排行榜完全一致。