DeepSeek V4 Pro 1.6T
8K/1K
B200
vLLM · FP4
MI355X
$0.355比 B200 昂贵 17%
SGLang · FP4
B300
$0.245比 B200 便宜 19%
SGLang · FP4
GB200 NVL72
$0.514比 B200 昂贵 69%
Dynamo vLLM · FP4
GB300 NVL72
$0.213比 B200 便宜 30%
Dynamo SGLang · FP4STP
超大规模云(hyperscaler)成本 ↓ 越低越好 来源:InferenceX 与 SemiAnalysis Market July 2026 AI Cloud TCO Model
| 模型 · 场景 | B200 · 基准 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|---|---|---|
DeepSeek V4 Pro 1.6T8K/1K | vLLM · FP4 | $0.355比 B200 昂贵 17% SGLang · FP4 | $0.245比 B200 便宜 19% SGLang · FP4 | $0.514比 B200 昂贵 69% Dynamo vLLM · FP4 | $0.213比 B200 便宜 30% Dynamo SGLang · FP4 · STP |
DeepSeek V4 Pro 1.6T长上下文多轮真实智能体场景(AgentX) | vLLM · FP4 | $0.256比 B200 昂贵 407% MoRI SGLang · FP4 | $0.019比 B200 便宜 63% vLLM · FP4 | — 该场景暂无数据 | — 无精确 @50 结果 |
Kimi K3 2.8T长上下文多轮真实智能体场景(AgentX) | Dynamo vLLM · FP4 · STP | — 该场景暂无数据 | $0.144比 B200 便宜 89% vLLM · FP4 | $0.497比 B200 便宜 63% Dynamo vLLM · FP4 | — 该场景暂无数据 |
MiniMax M3 428B8K/1K | vLLM · FP8 | $0.113比 B200 昂贵 69% vLLM · FP4 | $0.056比 B200 便宜 16% vLLM · FP4 | $0.108比 B200 昂贵 62% Dynamo vLLM · FP8 · STP | $0.110比 B200 昂贵 65% Dynamo vLLM · FP8 · STP |
MiniMax M3 428B长上下文多轮真实智能体场景(AgentX) | — 无精确 @50 结果 | — 该场景暂无数据 | $0.012缺少可比较的 B200 基线 vLLM · FP4 | — 该场景暂无数据 | — 该场景暂无数据 |
GLM5.2长上下文多轮真实智能体场景(AgentX) | — 无精确 @50 结果 | $0.040缺少可比较的 B200 基线 SGLang · FP4 | — 无精确 @50 结果 | — 该场景暂无数据 | — 该场景暂无数据 |
Qwen3.5 397B8K/1K | SGLang · FP4 | $0.067比 B200 昂贵 67% SGLang · FP4 | $0.040与 B200 成本基本持平 SGLang · FP4 | $0.142比 B200 昂贵 251% Dynamo SGLang · FP8 · STP | $0.133比 B200 昂贵 230% Dynamo SGLang · FP8 · STP |
Qwen3.5 397B长上下文多轮真实智能体场景(AgentX) | — 无精确 @50 结果 | — 该场景暂无数据 | $0.006缺少可比较的 B200 基线 SGLang · FP4 | — 该场景暂无数据 | $0.007缺少可比较的 B200 基线 Dynamo SGLang · FP4 |
8K/1K
长上下文多轮真实智能体场景(AgentX)
长上下文多轮真实智能体场景(AgentX)
8K/1K
长上下文多轮真实智能体场景(AgentX)
长上下文多轮真实智能体场景(AgentX)
8K/1K
长上下文多轮真实智能体场景(AgentX)
— = 无结果。∞ = 缺少 B200 基线。
若某款芯片不支持 FP4 推测解码,则采用次优的可用配置。