AI 推理术语表
推理服务

PagedAttention

也称为 paged attention、分页 KV cache、KV cache 分页

先用大白话

PagedAttention 像虚拟内存分页一样,把 KV cache 存进固定大小的小块,避免缓存内存浪费在用不到的空间上。

技术定义

PagedAttention 是一种 KV cache 管理技术,通过映射表寻址的固定大小块来分配缓存,而不是为每个请求预留一整块连续区域。

工程细节

按请求连续分配必须为最长可能输出预留空间,而其中大部分永远用不上。分页借用了操作系统的做法:缓存块随序列增长按需分配,序列结束立即释放,共享相同前缀的序列还能通过写时复制共用缓存块。碎片率降到接近零,同样的 HBM 里能容纳多得多的序列。

为什么重要

这个由 vLLM 提出的思想解锁了让连续批处理真正获益的批次规模,并成为各推理引擎的标准做法。约束长上下文和智能体工作负载并发能力的,是有效 KV 容量而不是裸内存大小。

如何在 InferenceX 中解读

InferenceX 配置中的所有引擎都以分页或分块形式管理 KV 内存。AgentX 这类长上下文场景的高并发数据点之所以可达,正是因为分页让数百个会话增长收缩时缓存浪费保持很小。