InferenceX 研究

文章

关于智能体推理、AgentX 结果、芯片与推理框架经济性的基准测试文章。

不熟悉相关概念? 浏览 AI 推理术语表。

预计阅读 11 分钟

GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍

DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。

  • benchmark
  • gpu
  • inference
  • +9