推理服务
草稿模型
也称为 draft model、speculator、投机草稿模型
先用大白话
草稿模型是投机解码中那个又小又快的模型,先猜出若干后续 token,交给大模型一次性验证。
技术定义
草稿模型是投机解码中的轻量提议组件,生成候选 token 序列,由目标模型在单次批量前向中完成验证。
工程细节
草稿有多种形式:同家族的独立小模型、像 EAGLE 那样训练到目标模型上的额外预测头,或某些模型自带的多 token 预测头。草稿廉价地抢先生成几个 token,目标模型一次性检查全部候选,接受的 token 一起输出。被拒绝时回退到目标模型的输出,因此结果与目标分布一致。
为什么重要
草稿质量决定接受长度,接受长度决定加速比。匹配良好的草稿能在小批次下把 decode 速度提高数倍,而不匹配或过于激进的草稿会浪费验证算力,高负载下甚至拖慢服务。
如何在 InferenceX 中解读
InferenceX 记录每个结果背后的投机方法和接受长度,并发布用于复现的黄金接受长度分布,因为不切实际的接受率是基准测试数字脱离生产行为的经典方式。
参考资料
在真实基准中理解这一概念
SGLang 0.5.6 在 B200 DeepSeek R1 FP4 上的表现:低并发下最高提升 1.8 倍
针对 DeepSeek V3 的分段 CUDA graph、统一事件循环和 JIT 内核将 8k/1k 吞吐量从 508 提升至 907 tok/s/GPU,使用相同的 16 GPU B200 资源池
GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。