Paper: AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
一句话概括
通过观察激活值分布来识别关键权重通道,实现比GPTQ更简洁高效的LLM量化方法。
核心思想
AWQ的核心洞察是:并非所有权重同等重要,少量(约1%)权重通道对模型输出影响巨大,跳过这些通道的量化就能大幅降低误差。但直接使用混合精度会带来硬件不友好的问题。AWQ巧妙地通过对重要权重通道乘以缩放因子来等效保护这些通道,使得均匀量化也能保留关键信息。
关键创新
两大创新:(1)基于激活值幅度来判断权重重要性——激活值大的通道对应的权重更重要,这比基于权重本身的判断更准确;(2)逐通道缩放策略——对重要权重通道进行放大,量化后的舍入误差相对值变小,等效于提升了这些通道的精度。方法极其简洁,无需反向传播或复杂优化。
深远影响
AWQ因其简洁性和高效性被广泛采用,成为与GPTQ并列的主流LLM量化方案。其硬件友好的设计使得量化模型可以直接利用INT4 GEMM内核加速推理,在vLLM等框架中被作为默认量化选项。
启发与思考
AWQ证明了观察数据比纯看参数更有效的直觉——用激活信息指导权重量化是一种跨域信息利用。其简洁的缩放技巧也提醒我们:最优雅的解决方案往往不是最复杂的。