AI 推理术语表
模型架构

Engram

也称为 Engram 条件记忆

先用大白话

Engram 直接检索重复 token 模式对应的已学习向量,减少模型逐层重建这些模式的工作。

技术定义

Engram 是一种可学习的条件记忆机制,在单 token embedding 之外增加多 token 查表,并把取回的特征融入模型计算。

工程细节

查表地址取决于 token ID,而非中间隐藏状态。因此,运行时可以在到达 Engram 层之前确定所需行,并让检索与前面层的计算重叠。取回的特征会影响下游层及专家选择。

为什么重要

稀疏访问使大型参数表具备 offload 到 DRAM 的条件。在推理时移除表会改变已经训练好的模型,因此消融不能代替对分别训练、质量匹配的架构进行比较。

如何在 InferenceX 中解读

文章中的 DeepSeek-V4.1-Flash 配置约有 189 GiB 的 Engram 内存占用。DRAM 与 SSD 对比保留了 Engram 功能,只改变服务路径;消融实验回答的则是另一类模型质量问题。