AI 推理术语表
推理服务

缓存热度

也称为 cache hotness、热 embedding 行、行访问频率

先用大白话

热数据行访问频繁或最近被访问,把它留在较快层级可能省去重复检索。

技术定义

缓存热度描述数据在特定工作负载和时间窗口内的访问频率或近期访问情况,用来判断哪些数据可能受益于更快的存储。

工程细节

推荐系统通常把高频或近期访问的 embedding 行留在快层,把冷行放到 SSD。Engram gate 分数回答的是另一问题:取回的特征在当前上下文中有多大贡献。

为什么重要

贡献权重大的行不一定经常被请求。缓存策略需要访问轨迹及资源约束,不能仅根据有趣示例或较大的 gate 激活值来决定。

如何在 InferenceX 中解读

文章明确指出,强 gate 不能识别缓存热行。示例扫描也没有测量各类内容占据的表容量,因而无法据此分配缓存,更不能证明某些已学习内容浪费了内存。