AgentX v1.0 测试方法

AgentX 基准测试数据集

AgentX 根据参与者自愿提供的 Claude Code 会话构建回放工作负载。公开 trace 会移除 prompt、源代码和 tool payload,仅保留请求长度、prefix 复用关系、subagent 分支和时间信息。

查看 AgentX 性能结果

AgentX 的行业影响

面向智能体负载的优化

AgentX 推出后的最初几个月,最有价值的成果并非开源数据集,而是 AgentX 合作伙伴提交的 50 多个上游 PR。这些改动以 AgentX 为北极星,面向真实智能体负载进行优化。

查看优化详情

AgentX 教程

通过详细遥测数据解析智能体负载

点击 AgentX 曲线上的任一数据点,都可查看该次运行的详细数据,包括 11 张单点遥测图、逐请求时间线和单会话火焰图。本教程将逐一介绍这些视图。

阅读遥测数据教程

AgentX 如何构建一次回放

  1. 01

    采集

    参与者自愿启用 HTTP 代理后,代理会在会话期间记录请求与响应的时间信息、token 数量、会话 ID 和 subagent ID。

  2. 02

    转换

    原始 prompt、源代码、tool argument 和 tool result 均会移除。Input 按 64-token block 转换为会话内串联 hash,在不暴露内容的前提下保留相同 prefix。

  3. 03

    重建

    AIPerf 用确定性生成的 coding token 和 tool-use token 填充这些 block,再将每个会话重建为有向无环图(DAG)。图中包含 main agent 轮次、并行 subagent、辅助请求,以及轮次间的 tool 执行时间。

  4. 04

    回放与测量

    每种配置先用固定 seed 执行 warmup,建立 cache 状态;随后在不同并发客户端数量下进行一小时 profiling。每次回放都会加入独立的 cache-bust 标记,避免无关会话共享 prefix。

AgentX v1.0 数据集概况

AgentX v1.0 数据集包含从内部自愿采集的 trace 中筛选出的 393 个 Claude Code 会话。入选会话需至少包含 20 个请求,Claude Code 版本不低于 2.1.139,同时运行的 subagent 不超过 10 个。处理过程中还会移除重复请求、客户端特有的安全监控和标题生成请求,以及重建后 input 长度超过 990k token 的请求。

v1.0 trace 概况

会话数
393
单请求 input token 数中位数
142k
单请求 output token 数中位数
444
含 subagent 的会话
44%
  • full: 完整的 AgentX v1.0 回放集,包含最长 1M token 的上下文。
  • 256k: 适用于最大上下文配置为 256k token 的模型和推理引擎。

回放控制

从稳态开始测量
固定 seed 会从每段会话 25%–75% 的区间内选择起点。正式 profiling 前,primer 请求和每条回放通道额外执行的 10 个 warmup 请求会先建立 KV cache。
确定性回放
固定 seed 决定会话采样、起点和合成内容。对外报告的指标仅覆盖一小时 profiling 窗口,不包含 warmup。
投机解码
合成 token 可能影响 draft token 的接受率,因此 AgentX 会按 model、speculator、draft length 和 thinking mode 的组合,采用 SPEED-Bench 的实测结果固定 acceptance length。
DRAM offload
对于没有标准 DRAM 配置的服务器,可用 DRAM 上限为 3 TB。GB200 NVL72、GB300 NVL72 和 TPUv7 标准系统按实际装机容量计算;每种配置只能使用与其 GPU 分配比例相对应的 DRAM。

如何解读 AgentX 结果

这里的 concurrency 指同时运行的 agent 客户端数量,而不是固定大小的 request batch。AgentX 采用 closed-loop 模式,因此速度更快的配置会完成更多请求,实际遇到的工作负载组合可能略有差异;低并发时这种差异最明显。报告吞吐量时,应同时给出首 token 延迟(TTFT)和 interactivity;单看一个 latency 指标不足以反映整次运行。

AgentX 衡量推理系统性能。合成 payload 不能用于模型质量评估。

客户端无法观测服务端的 chat template、专有 tokenizer、服务端 tool、加密 reasoning 内容,也无法准确获知图片和文档展开后的 token 数量。AgentX 对这些输入使用确定性 placeholder 和针对不同模型的 padding。重建后的 trace 会复现请求长度、时间关系、会话拓扑和 KV 复用模式,但不包含原始会话内容。

查看完整测试方法

数据集

正在加载数据集…