AI 推理术语表
推理服务

缓存输入 token

也称为 cached input tokens、缓存提示词 token、缓存读取 token

先用大白话

缓存输入 token 是提示词中可以复用先前处理结果的部分,能减少再次读取同一内容的工作。

技术定义

缓存输入 token 是通过复用已有模型状态处理的输入 token,无需为其重新执行完整 prefill。

工程细节

前几轮对话经常再次出现在后续提示词中。是否命中缓存取决于状态是否保留、请求路由和可用存储。服务商可能对缓存输入、未缓存输入和生成输出分别定价,收入计算也必须区分这三类 token。

为什么重要

缓存 token 仍属于已服务的工作负载,但它不代表与输出 token 相同的新增计算量或销售价值。潜在前缀复用比例、实测缓存命中率和缓存命中的售价,是不同的量。

如何在 InferenceX 中解读

Rubin 文章在多项比较中使用总 token 吞吐量,并在经济性讨论中区分缓存输入、未缓存输入和输出价格。不能直接将总 token 倍率套用到仅针对输出的价格上估算收入。