AI 推理总览

一眼对比各活跃模型在 MI355X、B200、B300、GB200 与 GB300 上的表现。

8K→1K · 单轮 · 每 GPU 输出 tok/s @50 tok/s/用户 · 仅推测解码 · 各平台最佳验证配置

数据库快照截至 7月22日

  • DeepSeek V4 Pro 1.6T

    B200
    477TRTLLM · FP46月12日
    MI355X
    150ATOM¹ · FP46月2日

    相对 B200 −69%

    B300
    298TRTLLM · FP46月12日

    相对 B200 −38%

    100 档由 B300 领先

    GB200 NVL72
    无精确 @50 结果
    GB300 NVL72
    无精确 @50 结果
    查看详情
  • Kimi K2.5/2.6/2.7-Code 1T

    B200
    仅标准解码
    MI355X
    仅标准解码
    B300
    仅标准解码
    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • MiniMax M3 428B

    B200
    804vLLM · FP47月6日
    MI355X
    867ATOM¹ · FP47月3日

    相对 B200 +8%

    100 档由 B200 领先

    B300
    1,099vLLM · FP47月6日

    相对 B200 +37%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • GLM5.2

    B200
    无 8K/1K 数据
    MI355X
    无 8K/1K 数据
    B300
    无 8K/1K 数据
    GB200 NVL72
    无 8K/1K 数据
    GB300 NVL72
    无 8K/1K 数据
    查看详情
  • Qwen3.5 397B

    B200
    1,491TRTLLM · FP46月24日
    MI355X
    646SGLang · FP47月16日

    相对 B200 −57%

    B300
    1,647SGLang · FP47月4日

    相对 B200 +10%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情

每格展示该平台在该模型上表现最好的已验证推测解码服务配置,并标注精度。相对 B200 的差值只在同精度、同版本结果之间计算——绝不将 FP4 与 FP8 互比。对比对象是完整服务栈,而非单独的芯片。

∞ = 无可比结果

各档位数据基于各配置官方 Pareto 前沿插值;不进行外推。