AMD · CDNA 4
AMD Instinct MI355X
概览
AMD Instinct MI355X 是 CDNA 4 旗舰,也是 AMD 首款具备 FP4 Tensor 吞吐能力的加速器:稠密算力 10,066 FP4 / 5,033 FP8 TFLOP/s,配备 288 GB HBM3e(带宽 8 TB/s),单芯片显存为当前业界最大。8 颗芯片通过第五代 Infinity Fabric 全互联组网,单芯片带宽 538 GB/s。
MI355X 在带宽上对齐 B200 级别、显存反超,而小时租价明显更低,是 AMD 迄今在每美元性能上发起的最有力挑战。1,400 W 的 TDP 和 ROCm 推理软件栈的成熟度则是实时数据持续量化的两项代价。
规格参数
| 厂商 | AMD |
|---|---|
| 架构 | CDNA 4 |
| 显存(可用) | 288 GB HBM3e |
| 内存带宽 | 8 TB/s |
| FP4 稠密 TFLOP/s | 10,066 |
| FP8 稠密 TFLOP/s | 5,033 |
| BF16 稠密 TFLOP/s | 2,516 |
| Scale-up 互联 | 5th Gen Infinity Fabric |
| 单芯片 scale-up 带宽 | 538 GB/s |
| Scale-up 域规模 | 8 |
| Scale-up 拓扑 | Full Mesh |
| Scale-out 网络 | RoCEv2 Ethernet |
| 网卡 | Pollara 400GbE |
| 单芯片 TDP | 1,400 W |
| 单芯片整机功耗 | 2.09 kW |
| 超大规模云 $/芯片/小时 | $1.50 |
| Neocloud $/芯片/小时 | $2.09 |
| 零售档 $/芯片/小时 | $2.10 |
来源:$/芯片/小时 费率取自 SemiAnalysis AI Cloud TCO Model
InferenceX 如何测试这款芯片
MI355X 是 InferenceX 上追踪最密集的 AMD 芯片:每日运行 vLLM、SGLang 与 ATOM,AgentX agentic 编码 trace 与 GB300 NVL72、B300 直接对垒,并留下了最快的公开软件进步曲线之一,包括模型发布数周内的数量级提升。
常见问题
- MI355X 云端租用每小时多少钱?
- 按 SemiAnalysis AI Cloud TCO 模型,MI355X 在超大规模云约 $1.50/小时,neocloud 档约 $2.09/小时,零售档约 $2.10/小时。InferenceX 的每美元性能页面即使用这些费率将实测吞吐量换算为每百万 token 成本。
- MI355X 有多少显存?
- MI355X 单芯片提供 288 GB 可用 HBM3e,内存带宽 8 TB/s;一个 8 芯片的 5th Gen Infinity Fabric 域合计约 2,304 GB。
- MI355X 的功耗是多少?
- MI355X 单芯片 TDP 为 1,400 W,计入主机 CPU、网卡与散热分摊后整机约 2.09 kW。InferenceX 的每 token 能耗计算采用整机功耗口径。
- MI355X 支持 FP4 吗?
- 支持。MI355X 稠密 FP4 算力达 10,066 TFLOP/s(FP8 为 5,033),InferenceX 的精度对比页面持续追踪 FP4 与 FP8 的推理精度和吞吐量差异。
- MI355X 的 LLM 推理速度有多快?
- 这取决于模型、推理引擎、精度和交互性目标,因此 InferenceX 为 MI355X 发布持续更新的吞吐量-交互性 Pareto 前沿,而非单一数字。实时仪表板和对比页面展示每个覆盖模型上的最新结果。
查看实时基准测试结果
以上都是静态硬件数据。实际交付的 token 吞吐量、每百万 token 成本和每 token 能耗在仪表板上持续测量:
通过 SemiAnalysis 行业模型深入研究
InferenceX 测量实际交付的推理性能,而 SemiAnalysis 机构级行业模型覆盖这些芯片背后的市场:谁在出货、谁在采购、拥有成本是多少。