InferenceX 研究

文章

关于智能体推理、AgentX 结果、芯片与推理框架经济性的基准测试文章。

不熟悉相关概念? 浏览 AI 推理术语表。

预计阅读 13 分钟

B200 NVFP4 vs H100 FP8 运行 MiniMax-M2.5:vLLM 下每美元性能最高提升 8.2 倍

vLLM PR #36307 为 MiniMax 在 B200 上解锁了 trtllm-gen FP8 MoE 模块化内核;结合 NVFP4,在 8K/1K 负载下性能/成本从 22 tok/s/user 时的 4.0 倍扩大到 110 tok/s/user 时的 8.2 倍

  • benchmark
  • gpu
  • inference
  • +6