模型架构
稀疏 embedding 查表
也称为 sparse embedding lookup
先用大白话
稀疏查表只读取选中的少量 embedding 行,不读取整张参数表。
技术定义
稀疏 embedding 查表根据输入相关的索引集合,只取回被选中的行,因此每 token 访问的数据量可以远小于表的总容量。
工程细节
文章中的 Engram 配置在两个层上分别请求 24 行。整个模型每处理一个 token 位置约读取 12.4 KiB;分布到四个 GPU 时,每 GPU 约为 3.1 KiB。
为什么重要
稀疏流量使 offload 具备可行性,但也带来不规则访存。行选择、反量化、传输开销和数据复用共同决定较慢层级能否及时供数,避免拖延模型其余部分。
如何在 InferenceX 中解读
将 Engram 表放回 HBM 只会加速稀疏查表,并不直接加速 decoder 计算或通信。因此文章比较完整 AgentX 服务曲线,而没有假定查表提速必然按同样比例改善端到端性能。