AI 推理总览

一眼对比各活跃模型在 MI355X、B200、B300、GB200 与 GB300 上的表现。

8K→1K · 单轮 · 每 GPU 输出 tok/s @100 tok/s/用户 · 仅推测解码 · 各平台最佳验证配置

数据库快照截至 7月22日

  • DeepSeek V4 Pro 1.6T

    B200
    117TRTLLM · FP46月12日
    MI355X
    57SGLang · FP47月14日

    相对 B200 −52%

    B300
    193SGLang · FP46月11日

    相对 B200 +64%

    GB200 NVL72
    无精确 @100 结果
    GB300 NVL72
    无精确 @100 结果
    查看详情
  • Kimi K2.5/2.6/2.7-Code 1T

    B200
    仅标准解码
    MI355X
    仅标准解码
    B300
    仅标准解码
    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • MiniMax M3 428B

    B200
    685vLLM · FP47月6日
    MI355X
    618ATOM¹ · FP47月3日

    相对 B200 −10%

    B300
    801vLLM · FP47月6日

    相对 B200 +17%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • GLM5.2

    B200
    无 8K/1K 数据
    MI355X
    无 8K/1K 数据
    B300
    无 8K/1K 数据
    GB200 NVL72
    无 8K/1K 数据
    GB300 NVL72
    无 8K/1K 数据
    查看详情
  • Qwen3.5 397B

    B200
    855SGLang · FP47月5日
    MI355X
    452SGLang · FP47月16日

    相对 B200 −47%

    B300
    1,053SGLang · FP47月4日

    相对 B200 +23%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情

每格展示该平台在该模型上表现最好的已验证推测解码服务配置,并标注精度。相对 B200 的差值只在同精度、同版本结果之间计算——绝不将 FP4 与 FP8 互比。对比对象是完整服务栈,而非单独的芯片。

∞ = 无可比结果

各档位数据基于各配置官方 Pareto 前沿插值;不进行外推。