
预计阅读 12 分钟
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本
- benchmark
- agents
- agentic
- +3
InferenceX 研究
关于智能体推理、AgentX 结果、芯片与推理框架经济性的基准测试文章。
不熟悉相关概念? 浏览 AI 推理术语表。
2 篇文章

预计阅读 12 分钟
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本

预计阅读 6 分钟
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容