AI 推理术语表
推理服务

草稿模型

也称为 draft model、speculator、投机草稿模型

先用大白话

草稿模型是投机解码中那个又小又快的模型,先猜出若干后续 token,交给大模型一次性验证。

技术定义

草稿模型是投机解码中的轻量提议组件,生成候选 token 序列,由目标模型在单次批量前向中完成验证。

工程细节

草稿有多种形式:同家族的独立小模型、像 EAGLE 那样训练到目标模型上的额外预测头,或某些模型自带的多 token 预测头。草稿廉价地抢先生成几个 token,目标模型一次性检查全部候选,接受的 token 一起输出。被拒绝时回退到目标模型的输出,因此结果与目标分布一致。

为什么重要

草稿质量决定接受长度,接受长度决定加速比。匹配良好的草稿能在小批次下把 decode 速度提高数倍,而不匹配或过于激进的草稿会浪费验证算力,高负载下甚至拖慢服务。

如何在 InferenceX 中解读

InferenceX 记录每个结果背后的投机方法和接受长度,并发布用于复现的黄金接受长度分布,因为不切实际的接受率是基准测试数字脱离生产行为的经典方式。