Paper: SpecInfer/Medusa: Speculative Decoding加速推理


一句话概括

推测解码通过小模型草拟、大模型验证的方式,在不改变输出分布的前提下将LLM推理速度提升2-3倍。

核心思想

自回归解码的根本瓶颈在于逐token生成,无法充分利用GPU并行能力。推测解码的核心洞察是:用一个更快的草稿模型一次性生成多个候选token,再由目标大模型并行验证这些token。由于验证多个token的成本与生成单个token相当(受限于内存带宽而非计算),这样就能在保证输出质量不变的情况下加速推理。

关键创新

主要方法包括:(1)经典推测解码——使用独立小模型作为草稿模型;(2)Medusa——在目标模型上添加多个预测头,自回归草稿变为并行草稿;(3)SpecInfer——使用多个小模型构建推测树,提高接受率;(4)Eagle——利用特征层面的自回归实现更准确的草稿。

深远影响

推测解码已被集成到主流推理框架(vLLM、TensorRT-LLM)中,成为生产环境标配。它证明了一种免费加速的可能性——在数学上保证输出分布完全一致的同时获得显著提速。

启发与思考

推测解码揭示了一个重要洞察:LLM生成的大部分token实际上是容易的,只有少数token需要大模型的全部能力。这为自适应计算提供了实证依据,也启发了分层推理系统的设计。