AI 推理术语表
模型架构

N-gram embedding

也称为 多 token embedding

先用大白话

N-gram embedding 为一小段 token 序列提供可直接查表获取的已学习向量。

技术定义

N-gram embedding 将由 n 个 token 组成的局部序列映射为已学习的向量特征,把可表示的模式从单个 token 扩展到多个 token。

工程细节

重复出现的人名、代码片段和常见表述都可能触发这种查表。文章通过 Engram gate 分数检查示例,但按有趣程度选取,并未将其视为具有代表性的记忆使用排名。

为什么重要

局部 token 模式允许在隐藏状态计算完成前确定地址,因此支持 prefetch 和稀疏参数 offload;但这并不证明每次取回的特征在每次出现时都有用。

如何在 InferenceX 中解读

Gate 扫描无法确定某类模式在训练中出现的频率,也不能计算其占用的表容量。较高 gate 分数同样不等于高访问频率,不能单凭它决定应缓存哪些行。