AI 推理术语表
推理服务

Embedding prefetch

也称为 Engram prefetch、行预取

先用大白话

Embedding prefetch 在前面层仍在计算时,就开始取回后续层将要使用的行。

技术定义

Embedding prefetch 提前检索指定 embedding 行,使内存访问与使用这些数据之前的模型计算重叠。

工程细节

Engram 行地址取决于 token ID,而不是隐藏状态。只要 ID 已经可用,运行时就能确定所需行,无需等中间各层执行完毕。可用于重叠的时间窗口到消费层需要这些数据时结束。

为什么重要

Prefetch 可以隐藏部分延迟,但不会减少传输字节数,也不能消除带宽限制。服务系统仍需分配缓冲区、协调完成状态,并保证不会在检索完成前使用数据。

如何在 InferenceX 中解读

文章把 DRAM 路径的竞争力归因于包括异步执行和重叠在内的优化,并未独立测出通用 prefetch 加速比。应比较完整配置及其并发范围,不能仅从机制推导固定收益。