AWQ自适应权重量化
一句话总结
AWQ通过观察激活值分布找出「显著」权重通道并给予保护,实现了比GPTQ更好的INT4量化质量和更快的量化速度。
核心概念
AWQ的核心观察:并非所有权重同等重要,少量(约1%)权重通道对应着较大的激活值,对这些通道进行量化会造成不成比例的精度损失。AWQ的策略不是跳过这些通道不量化,而是通过对权重乘以一个缩放因子(per-channel scaling)让显著通道的量化误差更小。缩放因子通过最小化量化前后输出差异来优化。这种方法不需要反向传播或Hessian计算,速度比GPTQ快很多。
为什么重要
AWQ在INT4量化的精度上通常优于或持平GPTQ,且量化速度更快(不需要复杂的矩阵求逆)。AWQ的硬件适配性更好,在不同推理框架中都有良好支持(vLLM、TensorRT-LLM等)。
实践要点
使用AutoAWQ工具链可以方便地完成量化;校准数据需求比GPTQ更少;AWQ量化的模型在vLLM中有专门的高效kernel支持。建议与GPTQ对比在目标任务上的效果再做选择。
常见误区
误区一:AWQ在所有场景下都优于GPTQ——在某些模型和任务上GPTQ可能更好,需要实测。误区二:AWQ不需要校准数据——仍然需要少量数据来确定激活值分布和缩放因子。