AI 推理术语表
模型架构

稀疏 embedding 查表

也称为 sparse embedding lookup

先用大白话

稀疏查表只读取选中的少量 embedding 行,不读取整张参数表。

技术定义

稀疏 embedding 查表根据输入相关的索引集合,只取回被选中的行,因此每 token 访问的数据量可以远小于表的总容量。

工程细节

文章中的 Engram 配置在两个层上分别请求 24 行。整个模型每处理一个 token 位置约读取 12.4 KiB;分布到四个 GPU 时,每 GPU 约为 3.1 KiB。

为什么重要

稀疏流量使 offload 具备可行性,但也带来不规则访存。行选择、反量化、传输开销和数据复用共同决定较慢层级能否及时供数,避免拖延模型其余部分。

如何在 InferenceX 中解读

将 Engram 表放回 HBM 只会加速稀疏查表,并不直接加速 decoder 计算或通信。因此文章比较完整 AgentX 服务曲线,而没有假定查表提速必然按同样比例改善端到端性能。