DeepSeek V4 Pro 0813 1.6T
8K/1K
B200
Dynamo SGLang · FP4
MI355X
—
无法达到 @200
B300
$1.410成本比 B200 低 39%
SGLang · FP4
GB200 NVL72
—
无法达到 @200
GB300 NVL72
$2.096成本比 B200 低 9%
Dynamo SGLang · FP4
超大规模云厂商成本 ↓ 越低越好 来源:InferenceX 与 SemiAnalysis Market July 2026 Pricing Surveys & AI Cloud TCO Model
| 模型 · 场景 | B200 · 基准 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|---|---|---|
DeepSeek V4 Pro 0813 1.6T8K/1K | Dynamo SGLang · FP4 | — 无法达到 @200 | $1.410成本比 B200 低 39% SGLang · FP4 | — 无法达到 @200 | $2.096成本比 B200 低 9% Dynamo SGLang · FP4 |
DeepSeek V4 Pro 0813 1.6T长上下文、多轮交互的真实智能体场景(AgentX) | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 |
Kimi K3 2.8T长上下文、多轮交互的真实智能体场景(AgentX) | Dynamo vLLM · FP4 | — 无法达到 @200 | $0.310成本比 B200 低 37% vLLM · FP4 | — 无法达到 @200 | $0.281成本比 B200 低 43% Dynamo vLLM · FP4 |
MiniMax M3 428B8K/1K | vLLM · FP4 | $0.402成本比 B200 高 209% vLLM · FP4 | $0.168成本比 B200 高 29% vLLM · FP4 | — 无法达到 @200 | $0.487成本比 B200 高 275% Dynamo vLLM · FP8 |
MiniMax M3 428B长上下文、多轮交互的真实智能体场景(AgentX) | vLLM · FP4 | — 无法达到 @200 | $0.029成本比 B200 高 14% vLLM · FP4 | $0.068成本比 B200 高 170% Dynamo vLLM · FP4 | $0.039成本比 B200 高 55% Dynamo vLLM · FP4 |
GLM5.2/GLM5.3 744B长上下文、多轮交互的真实智能体场景(AgentX) | SGLang · FP4 | — 无法达到 @200 | $0.110成本比 B200 高 14% SGLang · FP4 | — 无精确 @200 结果 | — 无精确 @200 结果 |
Qwen3.5 397B8K/1K | SGLang · FP4 | — 无法达到 @200 | $0.119成本比 B200 高 8% SGLang · FP4 | $0.536成本比 B200 高 386% Dynamo SGLang · FP8 | $0.620成本比 B200 高 463% Dynamo SGLang · FP8 |
Qwen3.5 397B长上下文、多轮交互的真实智能体场景(AgentX) | SGLang · FP4 | — 无法达到 @200 | $0.019成本比 B200 高 32% SGLang · FP4 | $0.016成本比 B200 高 10% Dynamo SGLang · FP4 | $0.014与 B200 成本基本持平 Dynamo SGLang · FP4 |
DeepSeek R1 0528 671B维护模式目前已不再对该模型进行持续基准测试。8K/1K | SGLang · FP4 | $1.009成本比 B200 高 236% MoRI SGLang · FP4 | $1.061成本比 B200 高 253% SGLang · FP8 | — 无法达到 @200 | — 无法达到 @200 |
Kimi K2.5/2.6/2.7-Code 1T已弃用目前已不再对该模型进行持续基准测试。8K/1K | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 |
GLM5/5.1 744B已弃用目前已不再对该模型进行持续基准测试。8K/1K | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 |
gpt-oss 120B已弃用目前已不再对该模型进行持续基准测试。8K/1K | vLLM · FP4 · STP | $0.047成本比 B200 高 51% vLLM · FP4 · STP | — 该场景暂无数据 | — 该场景暂无数据 | — 该场景暂无数据 |
MiniMax M2.5/2.7 230B已弃用目前已不再对该模型进行持续基准测试。8K/1K | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 | — 无法达到 @200 |
Llama 3.3 70B Instruct已弃用目前已不再对该模型进行持续基准测试。8K/1K | — 无法达到 @200 | — 无法达到 @200 | — 该场景暂无数据 | — 该场景暂无数据 | — 该场景暂无数据 |
8K/1K
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
8K/1K
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
8K/1K
长上下文、多轮交互的真实智能体场景(AgentX)
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
— = 无结果。∞ = 缺少 B200 基线。
如果某款芯片没有可用的 FP4 投机解码配置,则改用次优配置。