白皮书 · 执行摘要

AMD Instinct MI355X Kimi K3 每 GigaWatt 每年最高可创造 320 亿美元收入

执行摘要 - 智能体推理服务经济性分析

SemiAnalysis InferenceX 团队共 2 页
  • AMD
  • MI355X
  • Kimi K3
  • vLLM
  • AgentX
  • Economics

核心数字

每 GW·年收入
$32.6B
Kimi K3 按 OpenRouter 标价计费,60% 利用率
每 GW·年利润
$16.5B
按超大规模云厂商采购规模自建,算力成本 $1.50/GPU/hr;每芯片小时利润 $3.95
利润率
50.7%
扣除算力支出和 30% 模型授权费之后

按 $3.00/GPU/hr 租用(2026 年 8 月 3 年期租约价格):$10.3B 利润31.5% 利润率$2.45 每芯片小时

图表

Kimi K3 2.8T 智能体 每吉瓦每年收入与利润估算(P90 交互性 45 tok/s/user)

成本层级:
自有(超大规模云大批量)
利用率:
60%
模型许可费假设:
30%
更新时间:
2026-09-04
来源:
SemiAnalysis InferenceX™

TCO $/chip/hr: MI355X: 1.5

来源: SemiAnalysis Market August 2026 Pricing Surveys & AI Cloud TCO Model

每百万 token 售价: 输入 $3 · 缓存输入 $0.3 · 输出 $15(OpenRouter)

图 1:MI355X 运行 Kimi K3 2.8T、按每 GPU 小时 $1.50 自建时每 GW·年收入的堆叠柱状图。326 亿美元收入分为 63 亿美元算力支出、98 亿美元模型授权费和 165 亿美元利润,利润率 50.7%。
图 1. 按超大规模云厂商采购规模自建(每芯片小时 $1.50)时每 GW·年的收入与利润。柱子合计收入 326 亿美元;自下而上的分段依次为算力支出(63 亿美元)、模型授权费(98 亿美元)和利润(165 亿美元,利润率 50.7%)。

Kimi K3 2.8T 智能体 每吉瓦每年收入与利润估算(P90 交互性 45 tok/s/user)

成本层级:
自定义 $/GPU/hr(2026 年 8 月 3 年期租约价格)
利用率:
60%
模型许可费假设:
30%
更新时间:
2026-09-04
来源:
SemiAnalysis InferenceX™

TCO $/chip/hr: MI355X: 3

来源: SemiAnalysis Market August 2026 Pricing Surveys & AI Cloud TCO Model

每百万 token 售价: 输入 $3 · 缓存输入 $0.3 · 输出 $15(OpenRouter)

图 2:MI355X 运行 Kimi K3 2.8T、按每 GPU 小时 $3.00 租用时每 GW·年收入的堆叠柱状图。326 亿美元收入分为 126 亿美元算力支出、98 亿美元模型授权费和 103 亿美元利润,利润率 31.5%。
图 2. 按每芯片小时 $3.00 租用(2026 年 8 月 3 年期租约价格,以自定义 $/GPU/hr 输入)时每 GW·年的收入与利润。收入仍为 326 亿美元;算力支出翻倍至 126 亿美元,利润降至 103 亿美元,利润率 31.5%。

摘要

在 InferenceX 用于智能体工作负载的 45 tok/s/user 运行点上,1 GW 电网供电的 MI355X 算力在 vLLM 上运行 Kimi K3 2.8T,每年最高可产生 326 亿美元的 token 收入。该数字来自单个 8 GPU MI355X 节点(FP4 权重、MTP 投机解码、TP8)上的 AgentX trace 回放实测,按 Kimi K3 在 OpenRouter 的价格计费(每百万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00),并按 60% 利用率售出。两种成本情形界定了运营方的结果区间:以超大规模云厂商的采购规模自建集群,全口径成本为每 GPU 小时 $1.50,扣除 30% 模型授权费后剩余 165 亿美元利润,利润率 50.7%;以每 GPU 小时 $3.00(2026 年 8 月 MI355X 3 年期租约价格)租用同等规模集群,则剩余 103 亿美元,利润率 31.5%。

主要结论

  1. 每 GW·年 326 亿美元收入。按每 GPU 2.09 kW 的全口径功耗计算(芯片本身加上节点、网络和散热的分摊),1 GW 电网供电可容纳 478,469 张 MI355X GPU。在 P90 45 tok/s/user 运行点,每张 GPU 产生 6,115 tok/s,折合每 GPU 小时 $12.97 的毛收入,按 60% 利用率折减后为 $7.78。

  2. 算力不是最大的成本项。按 $1.50/GPU/hr 计算,集群每年成本 63 亿美元,低于以 30% 授权费支付给模型厂商的 98 亿美元。算力成本翻倍到 $3.00/GPU/hr 会增加 63 亿美元支出,利润从 165 亿美元降至 103 亿美元,运营方仍能保留 31.5% 的收入。

  3. 45 tok/s/user 位于实测曲线的中段,并非峰值。MI355X 在 vLLM 上的前沿曲线覆盖 10 到 116 tok/s/user 的 P90 交互性区间。把目标放宽到 30 tok/s/user,收入升至每 GW·年 428 亿美元;收紧到 60 tok/s/user,收入降至 173 亿美元,租用情形接近盈亏平衡。

  4. 利用率的盈亏平衡点很低。自建集群在 16.5% 利用率即可覆盖算力成本,租用集群为 33.0%。在两种成本情形下,利用率每提高 10 个百分点,每 GW·年收入增加 54 亿美元,利润增加 38 亿美元。

  5. 前缀缓存支撑了整个工作负载。智能体 trace 中 99.2% 是输入 token,vLLM 服务端在该运行点的 GPU 前缀缓存命中率为 93.7%,因此尽管输出 token 标价 $15,混合售价仅为每百万 token $0.59。

方法

  1. 每 GW·年 GPU 小时数 = 1,000,000 kW / 每 GPU 2.09 kW x 8,760 h = 41.9 亿 GPU 小时。

  2. 收入 = 每 GPU 小时毛收入 ($/GPU/hr) x GPU 小时数 x 利用率。

  3. 算力支出 = 成本档位 ($/GPU/hr) x GPU 小时数,无论集群是否繁忙都需支付。

  4. 模型授权费 = 收入 x 30%。

  5. 利润 = 收入 - 算力支出 - 授权费。

  6. 每 GPU 小时毛收入 ($/GPU/hr) = tok/s/GPU x 3,600 x 混合 $/M tok;混合价格按插值点的输入占比(99.2%)、缓存命中率(93.7%,缓存输入按 $0.30 计费)和输出占比(0.8%)加权。

  7. 插值方法:在 (P90 交互性, tok/s/GPU) 平面取左上 Pareto 前沿,使用单调三次 Hermite 样条(Steffen 1990),不做外推。

假设条件

项目取值
模型Kimi K3 2.8T (moonshotai/Kimi-K3),FP4 权重
硬件AMD Instinct MI355X,8 GPU,TP8,单节点
框架vLLM,ROCm nightly 镜像 vllm/vllm-openai-rocm:nightly-7c5dc571
投机解码MTP
工作负载InferenceX AgentX 智能体 trace 回放
运行点P90 交互性 45 tok/s/user
Token 价格每百万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00(OpenRouter,moonshotai/kimi-k3)
利用率售出基准测试吞吐量的 60%
模型授权费收入的 30%
全口径功耗每 GPU 2.09 kW(SemiAnalysis AI Cloud TCO Model)
成本情形 A每 GPU 小时 $1.50,以超大规模云厂商采购规模自建(SemiAnalysis AI Cloud TCO Model)
成本情形 B每 GPU 小时 $3.00,2026 年 8 月 MI355X 3 年期租约价格
每年小时数8,760
数据日期2026-09-04

数据来源

获取完整执行摘要

两页 PDF 包含两张图、假设条件表和数据来源链接。

下载 PDF