智能体推理基准测试

本页面展示 InferenceX 的智能体推理与固定序列 AI 推理基准测试结果:跨 Chip、推理框架与模型对比吞吐量(token/s/Chip)、交互性(token/s/用户)、首 token 延迟(TTFT)等指标。智能体推理数据来自 AgentX;该场景对公开智能体编码轨迹衍生出的长上下文、多轮、含 subagent 工作负载进行回放。每个数据点都来自公开的 GitHub Actions 工作流,可复现、可审计。

图表中的模型、Chip、框架与指标名称均沿用业界通用英文名称。

推理性能

不同模型、硬件配置和服务参数下,来自 AgentX 场景的智能体推理指标与固定序列推理指标。

厂商:
部署模式:
投机解码: