全部 AI 推理芯片
AMD · CDNA 3

AMD Instinct MI325X

概览

AMD Instinct MI325X 是 CDNA 3 的大内存版本:稠密 FP8 算力与 MI300X 相同(2,615 TFLOP/s),但配备 256 GB HBM3e,带宽 6 TB/s,是同代产品中最大的显存。一个 8 芯片全互联节点拥有超过 2 TB HBM,足以在节点内部署超大模型。

与 H200 相比,MI325X 的优势是单芯片显存更大、小时租价更低,但选择时也需要权衡 NVIDIA 软件生态的优势。对于内存受限的 decode 和长上下文推理,MI325X 的每美元带宽在 CDNA 4 之前的产品中位居前列。

规格参数

厂商AMD
架构CDNA 3
显存(可用)256 GB HBM3e
内存带宽6 TB/s
FP4 稠密 TFLOP/s不支持
FP8 稠密 TFLOP/s2,615
BF16 稠密 TFLOP/s1,307
Scale-up 互联Infinity Fabric
单芯片 scale-up 带宽448 GB/s
Scale-up 域规模8
Scale-up 拓扑全互连
Scale-out 网络RoCEv2 Ethernet
网卡Pollara 400GbE
单芯片 TDP1,000 W
单芯片综合功耗1.69 kW
自有 - 超大规模云大批量 $/芯片/小时$1.10
零售档 $/芯片/小时$1.60

左右滑动可查看全部规格参数。

来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model

InferenceX 如何测试这款芯片

InferenceX 在 ROCm vLLM 与 SGLang 上以共享模型集测试 MI325X,对比页面将它与 H200、MI355X 并列,使 NVIDIA 与 AMD 之间、代际之间的差距都处于持续测量之下。

常见问题

MI325X 云端租用每小时多少钱?
按 SemiAnalysis AI Cloud TCO 模型,MI325X 按超大规模云厂商大批量采购价自有约 $1.10/小时,零售档约 $1.60/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
MI325X 有多少显存?
MI325X 单芯片提供 256 GB 可用 HBM3e,内存带宽 6 TB/s;一个 8 芯片的 Infinity Fabric 域合计约 2,048 GB。
MI325X 的功耗是多少?
MI325X 的单芯片 TDP 为 1,000 W。计入主机 CPU、网卡和散热的分摊功耗后,每颗芯片对应的总功耗约为 1.69 kW。InferenceX 按这一口径计算每 token 能耗。
MI325X 支持 FP4 吗?
不支持。MI325X 最高支持 FP8,稠密算力 2,615 TFLOP/s;FP4 推理需要更新一代的芯片。
MI325X 的 LLM 推理速度有多快?
这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 MI325X 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。

查看实时基准测试结果

以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:

通过 SemiAnalysis 行业模型深入研究

InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。