推理服务
长上下文
也称为 long context、长上下文推理、长上下文服务
先用大白话
长上下文指模型一次要处理非常大量的对话、代码或文档,此时压力主要落在内存上,而不是原始算力上。
技术定义
长上下文指提示词和累积的对话历史达到数万甚至数十万 token 的推理场景,此时 KV cache 容量、内存带宽和缓存复用主导服务行为。
工程细节
KV cache 随上下文中的每个 token 增长,prefill 开销增长得更快,因此长上下文流量会在算力耗尽之前先耗尽 HBM。编码智能体是最典型的来源:每一轮都把文件、工具输出和历史回答追加到可能持续数小时的会话中。模型架构用滑动窗口、潜在注意力、线性注意力和稀疏注意力应对,服务栈则用前缀缓存、向 DRAM 和 NVMe 的 KV cache offloading 以及上下文并行应对。
为什么重要
在短固定序列上测出的硬件与引擎排名无法直接迁移到长上下文流量,因为约束条件从算术吞吐量转移到了 KV 容量和数据搬运。并发上限表现为容量悬崖,而应对这些悬崖的系统能力,决定了智能体、检索流水线和文档分析是否具备可服务的经济性。
如何在 InferenceX 中解读
InferenceX 从两个方向覆盖长上下文:固定序列场景钉住输入输出长度,例如 8K 输入 1K 输出;AgentX 则回放上下文逐轮增长、逼近真实 agent 工作集的多轮编码会话,并让并发扫描跨越 HBM 容量悬崖。