智能体推理
智能体编码工作负载
也称为 agentic coding workload、编码智能体工作负载、软件工程智能体工作负载
先用大白话
编码智能体读取代码仓库、修改代码并运行工具,随后继续请求模型,直到完成任务;这一连串请求就是智能体编码工作负载。
技术定义
智能体编码工作负载由软件 agent 产生,包含多轮模型生成、代码仓库检查、工具调用、代码修改以及委派给 subagent 的子任务。
工程细节
随着 agent 累积指令、文件、工具结果和历史回答,请求长度会持续增长。许多轮次会复用较大的共享前缀。工具执行造成不均匀的停顿,subagent 则可能生成时间重叠的请求分支,因此其流量形状与固定长度提示词不同。
为什么重要
编码智能体可能通过一串相互依赖的调用让推理系统持续工作数分钟甚至数小时。Cache 策略、调度公平性、内存容量和尾延迟都会影响任务进度,仅看峰值 decode 吞吐量无法描述这种体验。
如何在 InferenceX 中解读
AgentX 使用从轨迹提取的请求形状与确定性合成内容表示该工作负载。它测量推理系统性能。模型能否完成编码任务需要单独做质量评估,因此质量分数与 AgentX 服务结果应分别解读。
参考资料
在真实基准中理解这一概念
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM