AI Inference Overview
Every active model across MI355X, B200, B300, GB200 and GB300 at a glance.
8K→1K · Single-turn · Output tok/s/GPU @30 tok/s/user · Speculative decode only · Best validated stack per platform
Database snapshot through Jul 22
| Model | B200 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 | Details |
|---|---|---|---|---|---|---|
DeepSeek V4 Pro 1.6T | no exact @30 result | no exact @30 result | View details | |||
Kimi K2.5/2.6/2.7-Code 1T | standard decode only | standard decode only | standard decode only | standard decode only | standard decode only | View details |
MiniMax M3 428B | +49% vs B200 | standard decode only | standard decode only | View details | ||
GLM5.2 | no 8K/1K data | no 8K/1K data | no 8K/1K data | no 8K/1K data | no 8K/1K data | View details |
Qwen3.5 397B | −52% vs B200 | FP8 vs FP4 · no comparable delta | standard decode only | standard decode only | View details |
- B200View detailsno exact @30 resultMI355XB300GB200 NVL72GB300 NVL72no exact @30 result
Kimi K2.5/2.6/2.7-Code 1T
B200View detailsstandard decode onlyMI355Xstandard decode onlyB300standard decode onlyGB200 NVL72standard decode onlyGB300 NVL72standard decode onlyMiniMax M3 428B
B200View detailsMI355XB300+49% vs B200
GB200 NVL72standard decode onlyGB300 NVL72standard decode onlyGLM5.2
B200View detailsno 8K/1K dataMI355Xno 8K/1K dataB300no 8K/1K dataGB200 NVL72no 8K/1K dataGB300 NVL72no 8K/1K dataQwen3.5 397B
B200View detailsMI355X−52% vs B200
B300FP8 vs FP4 · no comparable delta
GB200 NVL72standard decode onlyGB300 NVL72standard decode only
Each cell shows the platform's best validated speculative-decode serving configuration for that model, labeled with its precision. Deltas against B200 compare only same-precision, same-release results — FP4 is never measured against FP8. Results compare complete serving stacks rather than isolated silicon.
∞ = no comparable result
Tier values interpolate each configuration’s official Pareto frontier — no extrapolation.