前缀缓存复用
本页面展示前缀缓存复用情况:选定模型与配置后,按并发数逐档以堆叠柱形拆分 prompt token 的来源,分为芯片 HBM 缓存命中、主机层缓存命中与未复用(重新计算)三部分,并可叠加 trace 的理论上限。所有数值均来自运行时实测的缓存计数,可追溯到对应的 GitHub Actions 运行记录。
图表中的模型、芯片、框架与指标名称均沿用业界通用英文名称。
前缀缓存复用
随并发数上升,一个配置的 prompt token 从哪里来:命中芯片 HBM 缓存、命中其后的主机层缓存,还是重新计算。每个堆叠柱形对应一行实测数据,数值取自运行时自身的缓存计数。