数值精度
MXFP4
也称为 微缩放 FP4、OCP MX FP4
先用大白话
MXFP4 让每小组 4 位数字拥有自己的缩放值,使极紧凑的数字仍保留足够可用范围。
技术定义
MXFP4 是一种微缩放四位浮点格式,由小块数值共享缩放因子。
工程细节
块级缩放让四位值在局部保有可用动态范围,同时维持紧凑存储与传输;硬件和软件必须就块布局、缩放表示与矩阵内核达成一致。
为什么重要
MXFP4 用于 AMD 及跨厂商低精度路径。实际结果由检查点制备与内核覆盖决定,标称 bit 数无法完整描述。
如何在 InferenceX 中解读
InferenceX 把 MXFP4 记录为完整引擎和硬件方案的一部分。与 NVFP4 或 FP8 比较时,应匹配模型、序列长度、质量要求和交互性目标。
参考资料
在真实基准中理解这一概念
AMD MI355X Kimi K2.5 推理:vLLM 25 天内吞吐量提升 7.7 倍、交互性最高提升 15 倍
vLLM PR #35850 修复了 MI355X CDNA4 上的 AITER MLA 分发路径,解锁 TP=8 下的 Kimi K2.5 推理性能,随 vLLM 0.18 一同发布
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
OpenAI Jalapeño:比 NVIDIA Blackwell 更强
OpenAI 自研 ASIC 对比 Rubin:Jalapeño 的 TCO、每兆瓦吞吐量,以及那些够辣的细节