模型架构
上下文相关门控
也称为 context-dependent gating、Engram gate 分数
先用大白话
Gate 根据模型当前上下文,控制取回的记忆特征贡献多少。
技术定义
上下文相关门控根据取回记忆特征与当前表示的匹配程度调整权重,而不是始终给予固定贡献。
工程细节
文章通过 Engram gate 分数检查名字、代码片段和常见短语。计算 gate 本身需要已经取回的 key,因此读取之后发现 gate 很低,并不会自动省掉这次内存读取。
为什么重要
若要跳过检索,需要另一个在读取之前运行的有用性预测器。这会引入新的实现和准确性问题,并不是利用已有 gate 数值就能免费得到的优化。
如何在 InferenceX 中解读
公开示例按有趣程度而非 gate 强度选取。示例和强 gate 都不能证明缓存热度,因此评估 Engram 时应将 gate 解读、存储放置以及服务性能分开测量。