推理服务
参数 offloading
也称为 parameter offloading、模型权重 offload、Engram offloading
先用大白话
参数 offloading 把已学习的模型数据放到加速器显存之外,只获取计算需要的部分。
技术定义
参数 offloading 将已学习的模型参数存储在主机 DRAM 或 SSD 等较低层级中,再由加速器访问推理所需的数据。
工程细节
Engram 的行地址由 token ID 决定,适合按行稀疏检索。它与 KV cache offloading 不同,后者搬运的是特定请求生成的注意力状态。两者可能竞争同一存储层级,也可能为彼此释放容量。
为什么重要
把参数移出 HBM 可以为 KV cache 腾出空间,或减少每个副本需要的 GPU 数量。但收益必须超过访问成本,并取决于内核、互连、内存分配以及工作负载。
如何在 InferenceX 中解读
文章报告 B300 的 DRAM offload 配置从 TP4 改为 TP2 后,Pareto 曲线最多改善 1.6x。未经优化的 B200 SSD 路径却落后于 DRAM,说明存储便宜并不直接意味着每 token 成本更低。