AI 推理总览

一眼对比各活跃模型在 MI355X、B200、B300、GB200 与 GB300 上的表现。

8K→1K · 单轮 · 每 GPU 输出 tok/s @75 tok/s/用户 · 仅推测解码 · 各平台最佳验证配置

数据库快照截至 7月22日

  • DeepSeek V4 Pro 1.6T

    B200
    255TRTLLM · FP46月12日
    MI355X
    91ATOM¹ · FP46月2日

    相对 B200 −64%

    B300
    247SGLang · FP46月11日

    相对 B200 −3%

    100 档由 B300 领先

    GB200 NVL72
    无精确 @75 结果
    GB300 NVL72
    无精确 @75 结果
    查看详情
  • Kimi K2.5/2.6/2.7-Code 1T

    B200
    仅标准解码
    MI355X
    仅标准解码
    B300
    仅标准解码
    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • MiniMax M3 428B

    B200
    956vLLM · FP47月6日
    MI355X
    728ATOM¹ · FP47月3日

    相对 B200 −24%

    B300
    972vLLM · FP47月6日

    相对 B200 +2%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情
  • GLM5.2

    B200
    无 8K/1K 数据
    MI355X
    无 8K/1K 数据
    B300
    无 8K/1K 数据
    GB200 NVL72
    无 8K/1K 数据
    GB300 NVL72
    无 8K/1K 数据
    查看详情
  • Qwen3.5 397B

    B200
    1,244TRTLLM · FP46月24日
    MI355X
    519SGLang · FP47月16日

    相对 B200 −58%

    B300
    1,315SGLang · FP47月4日

    相对 B200 +6%

    GB200 NVL72
    仅标准解码
    GB300 NVL72
    仅标准解码
    查看详情

每格展示该平台在该模型上表现最好的已验证推测解码服务配置,并标注精度。相对 B200 的差值只在同精度、同版本结果之间计算——绝不将 FP4 与 FP8 互比。对比对象是完整服务栈,而非单独的芯片。

∞ = 无可比结果

各档位数据基于各配置官方 Pareto 前沿插值;不进行外推。