推理服务
前缀缓存
也称为 prefix caching、提示词缓存、自动前缀缓存
先用大白话
前缀缓存会记住重复开头的处理结果,例如相同系统提示词,让模型下次可以跳过这部分工作。
技术定义
当前多个请求以相同 token 序列开头时,前缀缓存会复用已有 KV 缓存状态。
工程细节
重复系统提示词、共享文档或共同对话前缀在缓存仍可用时无需再次预填充。命中缓存可显著减少提示词计算与首 token 时间。
为什么重要
具有重复前缀的生产工作负载可能明显快于随机 token 基准;收益取决于命中率、缓存容量、淘汰策略与请求能否路由到持有所需状态的节点。
如何在 InferenceX 中解读
InferenceX 在定长场景的随机数据集上禁用前缀缓存,避免把缓存策略混入完整提示词处理的测量,因此那些数字应视为无命中基线。AgentX 则相反:命中率本身就是上报指标,会与该点所在的 offload 层级一并展示,因为复用正是这类工作负载的本质特征。
参考资料
在真实基准中理解这一概念
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升
NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200