Paper: A Survey of Quantization Methods for Efficient Neural Network Inference


一句话概括

系统综述神经网络量化技术,涵盖从基础概念到前沿方法的完整知识体系。

核心思想

量化将神经网络的权重和激活值从高精度浮点数(FP32)映射到低精度表示(INT8/INT4等),从而减少内存占用、加速计算并降低能耗。综述系统介绍了均匀量化与非均匀量化、对称与非对称量化、逐层/逐通道/逐组量化等基本概念,以及训练后量化(PTQ)和量化感知训练(QAT)两大范式。

关键创新

建立了量化方法的完整分类体系:(1)量化粒度——从逐层到逐通道再到更细粒度;(2)混合精度量化——不同层使用不同位宽;(3)校准方法——如何选择量化参数最小化精度损失;(4)针对不同硬件的量化方案适配。

深远影响

量化是LLM民主化的关键使能技术。GPTQ、AWQ等后续工作使得70B模型可以在消费级GPU上运行。量化技术直接推动了llama.cpp等开源项目的繁荣和端侧大模型部署的可行性。

启发与思考

量化的核心挑战在于精度与效率的权衡。随着模型规模增大,量化反而更容易——大模型对量化的鲁棒性更强。这暗示大模型中存在大量冗余信息,也为极低比特量化(2-bit、1-bit)提供了研究动力。