InferenceXbySemiAnalysis logo
首页AgentX新总览仪表板性能对比技术文章关于
Star1,586EN
SemiAnalysis logo

InferenceX 持续开展开源的 agentic 推理基准测试,发布来自真实环境、可复现、可审计的性能数据,并获得 OpenAI、Meta、Oracle、Microsoft 等万亿美元级 AI 基础设施运营方的信赖。

SemiAnalysisSemiAnalysis 官网订阅通讯关于 SemiAnalysis
法律信息原住民传统领地声明隐私政策Cookie 政策
参与贡献基准测试仓库AgentX 测试框架可视化工具
更多
业界评价AgentX遥测数据技术文章API 文档芯片可靠性每美元性能模型架构AI 推理术语表芯片规格与价格GPU 排行榜模型在 GPU 上的实测结果

如果这些数据对您的工作有帮助,欢迎在 GitHub 上点个 Star,或分享给同事。

© 2026 semianalysis.com. 版权所有。

DeepSeekv4 Pro 0813 1.6T · 芯片对比

DeepSeekv4 Pro 0813 1.6T — H200 vs MI300X

H200(NVIDIA Hopper)与 MI300X(AMD CDNA 3)在 DeepSeekv4 Pro 0813 1.6T 上的正面 AI 推理基准测试对比。涵盖各类 LLM 工作负载的延迟、吞吐量与成本。使用下方图表控件切换序列、精度和指标——交互方式与主推理图表相同。

AgentX 回放真实的编码 agent 会话,而不是固定长度的 prompt,因此上下文随轮次不断增长,每个请求的大部分内容由 cache 提供而无需重新计算。这让对比变成一个系统问题:跨节点的 KV 传输、prefix 感知路由与 cache 容量,都会与芯片原始吞吐量一同影响曲线。固定序列负载仍然是衡量 kernel 与芯片性能的干净基线,因此两种场景回答的是关于同一硬件的不同问题。 进一步了解 AgentX →

H200 在 DeepSeekv4 Pro 0813 1.6T 上以 49 tok/s/user 运行时达到 4362 tok/s/chip(每百万 token $0.08)。MI300X 在此工作点没有数据。

H200:4102 tok/s/chip,每百万 token $0.08(DeepSeekv4 Pro 0813 1.6T 上以 72 tok/s/user 运行)。MI300X 在此点尚未测试。

在 DeepSeekv4 Pro 0813 1.6T 上以 94 tok/s/user 运行时,H200 吞吐量为 3407 tok/s/chip,每百万 token 成本 $0.10;MI300X 在此目标点没有基准测试数据。 (数据反映此 URL 的默认 agentic-traces · fp8 选择——如果您在控件中更改序列、精度或模型,下方表格和图表会自动更新。)

查看每美元性能对比 →

Interpolated from real benchmark data. Edit target interactivity values below to compare at different operating points.
Metric
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Throughput (tok/s/chip)
H200:4361.5MI300X:—
H200:4101.8MI300X:—
H200:3407.2MI300X:—
Cost ($/M tok)
H200:$0.078MI300X:—
H200:$0.083MI300X:—
H200:$0.099MI300X:—
tok/s/MW
H200:3183598MI300X:—
H200:2994014MI300X:—
H200:2487026MI300X:—
Concurrency
H200:~8MI300X:—
H200:~7MI300X:—
H200:~5MI300X:—

推理性能

不同模型、硬件配置和服务参数下,来自 AgentX 场景的智能体推理指标与固定序列推理指标。

按标准化价格计算的每 GPU 小时 token 收入 vs. 交互性

DeepSeek V4 Pro 0813 1.6T • FP4 • 8K / 1K • 来源:SemiAnalysis InferenceX™ • 输入 $1/百万 token · 输出 $1/百万 token

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算每百万 token 成本,而非按芯片总数计算。因此,与聚合配置进行token 成本的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算输入吞吐量,而非按芯片总数计算。因此,与聚合配置进行输入吞吐量的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算输出吞吐量,而非按芯片总数计算。因此,与聚合配置进行输出吞吐量的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算功耗,而非按芯片总数计算。因此,与聚合配置进行功耗的直接对比并不完全等价。

注意:分离式推理配置(如 MoRI SGLang、Dynamo TRTLLM)按解码芯片或预填充 芯片计算能耗,而非按芯片总数计算。因此,与聚合配置进行每 token 能耗的直接对比并不完全等价。

暂无数据

请调整模型、序列长度、精度、日期范围或芯片选项。

按住 Shift 滚动以缩放 · 拖动以平移 · 双击以重置 · 点击数据点固定提示框

    交互性(interactivity)指模型流式输出回答时,单个用户接收生成 token 的速率——即新内容出现在屏幕上的快慢。数值越高体验越流畅;运营方需要在交互性与批量吞吐量之间权衡。

    表示该运行点下每块 GPU 每小时可获得的 token 毛收入。标准化模式下,未缓存输入和输出均按每百万 1 美元计价,缓存输入按每百万 0.10 美元计价。OpenRouter 模式采用所选模型当前公开的价格;未提供缓存读取价格时,按输入价格的 10% 计算。未缓存输入、缓存输入与输出分别计价。输入 token 占比优先采用口径一致的实测输入/输出吞吐量。解耦运行的两类速率使用不同 GPU 分母时,固定序列采用 ISL:OSL,Agentic trace 采用实测 prompt/generation token 构成。已报告 external cache 时,Agentic 缓存命中率由 GPU 与 external cache 相加;否则由 GPU 与 CPU cache 相加。Historical Trends 会在计价前分别插值总吞吐量、输入 token 占比和缓存命中率。缓存指标仅覆盖部分 frontier 数据点时,不应用缓存折扣。该指标把吞吐量与交互性的权衡转换为面向业务的 SLA 曲线。

    计算公式: $/GPU/hr = 每 GPU 秒的(未缓存输入 × 输入价格 + 缓存输入 × 缓存读取价格 + 输出 × 输出价格),再换算为一小时