[论文解读] Exploring Weight Importance and Hessian Bias in Model Pruning
本文通过对比基于海森矩阵、基于大小和自然重要性的三种重要性准则,对模型剪枝进行了系统分析,揭示了海森矩阵结构会引入隐式偏差,该偏差对剪枝性能具有决定性影响。研究推导出精确的渐近公式,表明基于海森矩阵的剪枝对特征协方差缩放具有鲁棒性,而当权重大小与海森重要性发生偏离时,基于大小的剪枝会灾难性地失效,尤其在初始化不当时更为明显。
Model pruning is an essential procedure for building compact and computationally-efficient machine learning models. A key feature of a good pruning algorithm is that it accurately quantifies the relative importance of the model weights. While model pruning has a rich history, we still don't have a full grasp of the pruning mechanics even for relatively simple problems involving linear models or shallow neural nets. In this work, we provide a principled exploration of pruning by building on a natural notion of importance. For linear models, we show that this notion of importance is captured by covariance scaling which connects to the well-known Hessian-based pruning. We then derive asymptotic formulas that allow us to precisely compare the performance of different pruning methods. For neural networks, we demonstrate that the importance can be at odds with larger magnitudes and proper initialization is critical for magnitude-based pruning. Specifically, we identify settings in which weights become more important despite becoming smaller, which in turn leads to a catastrophic failure of magnitude-based pruning. Our results also elucidate that implicit regularization in the form of Hessian structure has a catalytic role in identifying the important weights, which dictate the pruning performance.
研究动机与目标
- 理解过参数化模型中模型剪枝的基本机制,特别是海森矩阵结构与权重重要性的作用。
- 比较三种剪枝准则(基于海森矩阵、基于大小和自然重要性)的鲁棒性与性能。
- 量化海森矩阵结构带来的隐式偏差对剪枝结果的影响,特别是在线性模型和两层ReLU网络中的表现。
- 识别在权重大小较大时,为何基于大小的剪枝仍会失效,并阐明正确初始化的作用。
- 在受控协方差缩放条件下,推导出剪枝方法的精确渐近性能公式,实现精确比较。
提出的方法
- 作者通过特征协方差矩阵(海森矩阵)的对角缩放构造一类等价的线性问题,同时保持标签不变,从而实现对海森偏差的受控研究。
- 在高维极限下推导出剪枝性能的精确渐近公式,表明海森矩阵和自然重要性具有尺度不变性,而基于大小的重要性的表现则极为脆弱。
- 对于两层ReLU网络,采用简化的初始化模型分析海森结构如何支配训练动态及权重贡献。
- 提出“更大的海森值赢得更多”定理,量化在训练过程中,基于海森矩阵的权重组相对贡献。
- 运用高维概率工具,包括集中不等式和极限定理,分析在样本量和网络规模均较大的情形下,优化与剪枝行为的表现。
- 通过广义误差和剪枝引起的准确率损失的解析表达式比较剪枝性能,这些表达式均在高维极限下推导得出。
实验结果
研究问题
- RQ1在线性模型中,特征协方差缩放(海森结构)如何影响基于大小与基于海森矩阵的剪枝性能?
- RQ2为何在过参数化设置中,即使权重大小较大,基于大小的剪枝仍会失效?
- RQ3海森结构在多大程度上诱导隐式偏差,从而改善或损害剪枝性能?
- RQ4正确初始化在多大程度上影响深度网络中权重大小与基于海森矩阵的重要性的对齐?
- RQ5能否在高维设置下推导出精确的渐近公式,以比较不同剪枝准则的性能?
主要发现
- 基于海森矩阵和自然重要性对特征协方差矩阵(海森矩阵)的对角缩放具有不变性,而基于大小的重要性的表现则对这种缩放极为敏感,因此在过确定设置下表现脆弱。
- 在过参数化设置中,海森结构变得至关重要:海森矩阵的隐式偏差可提升基于海森矩阵的剪枝性能,同时降低基于大小的剪枝性能。
- 本文推导出精确的渐近公式,精确捕捉了不同剪枝方法之间的性能差异,揭示了当主协方差方向与重要权重不对齐时存在负向偏差。
- 对于两层ReLU网络,海森结构支配训练动态,使得即使权重大小较小,海森值较大的权重在学习中贡献更多。
- 建立了“更大的海森值赢得更多”定理,表明在训练过程中,基于海森矩阵的重要性在决定贡献方面占主导地位,尤其在过参数化区域更为显著。
- 当权重大小与海森重要性方向相反时,基于大小的剪枝会灾难性地失效,这种现象甚至可能在正确训练后仍发生,原因在于优化过程中的隐式偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。