AI 推理总览

一眼对比各活跃模型在 MI355X、B200、B300、GB200 与 GB300 上的表现。

8K→1K · 单轮 · 每 GPU 输出 tok/s @30 tok/s/用户 · 仅推测解码 · 各平台最佳验证配置

数据库快照截至 7月22日

  • DeepSeek V4 Pro 1.6T

    B200
    无精确 @30 结果
    MI355X
    339SGLang · FP47月14日
    B300
    386vLLM · FP47月12日
    GB200 NVL72
    1,021Dynamo vLLM · FP45月19日
    GB300 NVL72
    无精确 @30 结果
    查看详情
  • Kimi K2.5/2.6/2.7-Code 1T

    B200
    仅标准解码
    MI355X
    仅标准解码
    B300
    仅标准解码
    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • MiniMax M3 428B

    B200
    906vLLM · FP47月6日
    MI355X
    992ATOM¹ · FP47月3日

    相对 B200 +9%

    100 档由 B200 领先

    B300
    1,351vLLM · FP47月6日

    相对 B200 +49%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • GLM5.2

    B200
    无 8K/1K 数据
    MI355X
    无 8K/1K 数据
    B300
    无 8K/1K 数据
    GB200 NVL72
    无 8K/1K 数据
    GB300 NVL72
    无 8K/1K 数据
    查看详情
  • Qwen3.5 397B

    B200
    1,591TRTLLM · FP46月24日
    MI355X
    771SGLang · FP47月16日

    相对 B200 −52%

    B300
    1,003SGLang · FP85月21日

    FP8 与 FP4 · 无可比差值

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情

每格展示该平台在该模型上表现最好的已验证推测解码服务配置,并标注精度。相对 B200 的差值只在同精度、同版本结果之间计算——绝不将 FP4 与 FP8 互比。对比对象是完整服务栈,而非单独的芯片。

∞ = 无可比结果

各档位数据基于各配置官方 Pareto 前沿插值;不进行外推。