AgentX v1.0 测试方法
AgentX 基准测试数据集
AgentX 根据参与者自愿提供的 Claude Code 会话构建回放工作负载。公开 trace 会移除 prompt、源代码和 tool payload,仅保留请求长度、prefix 复用关系、subagent 分支和时间信息。
查看 AgentX 性能结果 →AgentX 的行业影响
面向智能体负载的优化
AgentX 推出后的最初几个月,最有价值的成果并非开源数据集,而是 AgentX 合作伙伴提交的 50 多个上游 PR。这些改动以 AgentX 为北极星,面向真实智能体负载进行优化。
查看优化详情 →AgentX 教程
通过详细遥测数据解析智能体负载
点击 AgentX 曲线上的任一数据点,都可查看该次运行的详细数据,包括 11 张单点遥测图、逐请求时间线和单会话火焰图。本教程将逐一介绍这些视图。
阅读遥测数据教程 →AgentX 如何构建一次回放
- 01
采集
参与者自愿启用 HTTP 代理后,代理会在会话期间记录请求与响应的时间信息、token 数量、会话 ID 和 subagent ID。
- 02
转换
原始 prompt、源代码、tool argument 和 tool result 均会移除。Input 按 64-token block 转换为会话内串联 hash,在不暴露内容的前提下保留相同 prefix。
- 03
重建
AIPerf 用确定性生成的 coding token 和 tool-use token 填充这些 block,再将每个会话重建为有向无环图(DAG)。图中包含 main agent 轮次、并行 subagent、辅助请求,以及轮次间的 tool 执行时间。
- 04
回放与测量
每种配置先用固定 seed 执行 warmup,建立 cache 状态;随后在不同并发客户端数量下进行一小时 profiling。每次回放都会加入独立的 cache-bust 标记,避免无关会话共享 prefix。
AgentX v1.0 数据集概况
AgentX v1.0 数据集包含从内部自愿采集的 trace 中筛选出的 393 个 Claude Code 会话。入选会话需至少包含 20 个请求,Claude Code 版本不低于 2.1.139,同时运行的 subagent 不超过 10 个。处理过程中还会移除重复请求、客户端特有的安全监控和标题生成请求,以及重建后 input 长度超过 990k token 的请求。
v1.0 trace 概况
- 会话数
- 393
- 单请求 input token 数中位数
- 142k
- 单请求 output token 数中位数
- 444
- 含 subagent 的会话
- 44%
- full: 完整的 AgentX v1.0 回放集,包含最长 1M token 的上下文。
- 256k: 适用于最大上下文配置为 256k token 的模型和推理引擎。
回放控制
- 从稳态开始测量
- 固定 seed 会从每段会话 25%–75% 的区间内选择起点。正式 profiling 前,primer 请求和每条回放通道额外执行的 10 个 warmup 请求会先建立 KV cache。
- 确定性回放
- 固定 seed 决定会话采样、起点和合成内容。对外报告的指标仅覆盖一小时 profiling 窗口,不包含 warmup。
- 投机解码
- 合成 token 可能影响 draft token 的接受率,因此 AgentX 会按 model、speculator、draft length 和 thinking mode 的组合,采用 SPEED-Bench 的实测结果固定 acceptance length。
- DRAM offload
- 对于没有标准 DRAM 配置的服务器,可用 DRAM 上限为 3 TB。GB200 NVL72、GB300 NVL72 和 TPUv7 标准系统按实际装机容量计算;每种配置只能使用与其 GPU 分配比例相对应的 DRAM。
如何解读 AgentX 结果
这里的 concurrency 指同时运行的 agent 客户端数量,而不是固定大小的 request batch。AgentX 采用 closed-loop 模式,因此速度更快的配置会完成更多请求,实际遇到的工作负载组合可能略有差异;低并发时这种差异最明显。报告吞吐量时,应同时给出首 token 延迟(TTFT)和 interactivity;单看一个 latency 指标不足以反映整次运行。
AgentX 衡量推理系统性能。合成 payload 不能用于模型质量评估。
客户端无法观测服务端的 chat template、专有 tokenizer、服务端 tool、加密 reasoning 内容,也无法准确获知图片和文档展开后的 token 数量。AgentX 对这些输入使用确定性 placeholder 和针对不同模型的 padding。重建后的 trace 会复现请求长度、时间关系、会话拓扑和 KV 复用模式,但不包含原始会话内容。
查看完整测试方法 →