InferenceX 研究

文章

关于智能体推理、AgentX 结果、芯片与推理框架经济性的基准测试文章。

不熟悉相关概念? 浏览 AI 推理术语表。

预计阅读 9 分钟

GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍

DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8

  • benchmark
  • gpu
  • inference
  • +9