Interview: LoRA作为正则化手段的理论分析及与Dropout的对比
题目解析
LoRA除了参数高效外还具有隐式正则化效果,理解这一点对于解释为什么LoRA有时比全参数微调效果更好至关重要。
解答思路
LoRA的正则化来自低秩约束:ΔW=BA限制了参数更新矩阵的秩,这等价于对ΔW施加了核范数(nuclear norm)正则化,鼓励权重更新集中在少数几个重要的方向上。这与L2正则化惩罚参数幅度不同,LoRA惩罚的是参数更新的”复杂度”(有效自由度)。与Dropout的对比:Dropout通过随机丢弃神经元引入噪声,是一种隐式的模型集成;LoRA通过限制更新空间维度来约束模型容量。两者可以互补使用。
关键要点
- LoRA的正则化是结构性的(限制秩),Dropout的正则化是随机性的(注入噪声);2. 低rank的LoRA正则化更强,高rank的LoRA正则化更弱;3. 在小数据场景下,LoRA的正则化效果更明显;4. LoRA和Dropout同时使用时,Dropout率需要适当降低。
加分回答
从PAC-Bayes理论看,LoRA限制了假设空间的复杂度,降低了泛化误差上界。另外LoRA还有一个隐含的”参数锚定”效果——冻结主干参数意味着模型不会偏离预训练分布太远,这本身就是一种正则化。可以证明全参数微调+强L2正则化在某些条件下等价于LoRA。
常见踩坑
常见误解是认为LoRA效果不如全参微调是因为参数不够——实际上在小数据场景LoRA可能更好正是因为正则化效果。另一个坑是在LoRA上再加很强的L2正则化,导致欠拟合。