模型架构
N-gram embedding
也称为 多 token embedding
先用大白话
N-gram embedding 为一小段 token 序列提供可直接查表获取的已学习向量。
技术定义
N-gram embedding 将由 n 个 token 组成的局部序列映射为已学习的向量特征,把可表示的模式从单个 token 扩展到多个 token。
工程细节
重复出现的人名、代码片段和常见表述都可能触发这种查表。文章通过 Engram gate 分数检查示例,但按有趣程度选取,并未将其视为具有代表性的记忆使用排名。
为什么重要
局部 token 模式允许在隐藏状态计算完成前确定地址,因此支持 prefetch 和稀疏参数 offload;但这并不证明每次取回的特征在每次出现时都有用。
如何在 InferenceX 中解读
Gate 扫描无法确定某类模式在训练中出现的频率,也不能计算其占用的表容量。较高 gate 分数同样不等于高访问频率,不能单凭它决定应缓存哪些行。