Paper: 从DistilBERT到DeepSeek-R1-Distill: 知识蒸馏的演进
一句话概括
知识蒸馏从早期的logit匹配发展到大模型时代的推理能力迁移,成为构建高效小模型的核心范式。
核心思想
知识蒸馏让小模型(学生)学习大模型(教师)的行为而非原始标签,从而获得超越其规模的能力。早期DistilBERT通过匹配BERT的softmax输出和中间层表示,在保留97%性能的同时减少40%参数。大模型时代的蒸馏发生了质变:从对齐输出分布转向直接用大模型生成的高质量数据来微调小模型,即所谓的数据蒸馏。
关键创新
演进的关键节点:(1)经典蒸馏——soft label匹配+中间层对齐(DistilBERT, TinyBERT);(2)数据蒸馏——用GPT-4输出训练小模型(Alpaca, Vicuna);(3)推理蒸馏——DeepSeek-R1-Distill将R1的长链推理能力蒸馏到小模型中,让7B/14B模型展现出惊人的推理能力。
深远影响
知识蒸馏使得大模型的能力可以被压缩并部署到资源受限的环境中。DeepSeek-R1-Distill系列证明,通过精心的蒸馏策略,小模型可以获得远超其规模预期的推理能力,模糊了大小模型的传统能力边界。
启发与思考
蒸馏的演进反映了一个深刻的问题:大模型的能力本质上是什么?如果推理能力可以被蒸馏到小模型,那说明这些能力可能是一种可迁移的知识结构而非简单的参数规模效应。