[论文解读] Attention-Based Guided Structured Sparsity of Deep Neural Networks
本文提出了一种基于注意力机制的结构化稀疏方法——引导式结构化稀疏(Guided Structured Sparsity, GSS),通过引入组方差损失来保持活跃神经元,从而在保留关键信息瓶颈的同时强制实现网络中的组稀疏性。在90%稀疏度下,该方法在CIFAR-10上相比最佳基线模型准确率提升了6%,且与无引导剪枝方法相比,准确率下降幅度减少了2.6倍。
Network pruning is aimed at imposing sparsity in a neural network architecture by increasing the portion of zero-valued weights for reducing its size regarding energy-efficiency consideration and increasing evaluation speed. In most of the conducted research efforts, the sparsity is enforced for network pruning without any attention to the internal network characteristics such as unbalanced outputs of the neurons or more specifically the distribution of the weights and outputs of the neurons. That may cause severe accuracy drop due to uncontrolled sparsity. In this work, we propose an attention mechanism that simultaneously controls the sparsity intensity and supervised network pruning by keeping important information bottlenecks of the network to be active. On CIFAR-10, the proposed method outperforms the best baseline method by 6% and reduced the accuracy drop by 2.6x at the same level of sparsity.
研究动机与目标
- 为解决网络剪枝中不可控稀疏性导致的参数量不足模型严重准确率下降问题。
- 开发一种方法,在剪枝过程中通过保留部分活跃神经元来维持重要信息瓶颈。
- 使用统一的、与层无关的机制,在卷积层和全连接层中实现结构化稀疏性。
- 提供一种可微分的、基于注意力的正则化方法,以引导稀疏性实施,同时最小化准确率退化。
提出的方法
- 该方法引入了一个复合损失函数,结合了Softmax损失、ℓ₂正则化、组稀疏性损失(Lgs)和组方差损失(Lgv)。
- 在卷积层中按通道、在全连接层中按神经元强制实现组稀疏性,从而实现对整个滤波器或神经元的结构化剪枝。
- 组方差损失(Lgv)促进权重分布呈现偏态特征——大多数组接近零,但少数组显著较大,从而保留关键信息通路。
- 通过按组数对损失函数进行归一化,以稳定训练过程,并确保在各层间实现一致的稀疏性控制。
- 注意力机制通过强调高方差、活跃的组来动态调节稀疏性强度,防止对关键特征的过度剪枝。
- 该方法兼容任意层类型,可无缝集成到标准训练流程中,无需修改网络架构。
实验结果
研究问题
- RQ1注意力机制是否能通过保留关键信息瓶颈来改善深度神经网络中的结构化稀疏性?
- RQ2与标准结构化稀疏性相比,使用组方差损失的引导式稀疏性在准确率与稀疏性之间的权衡上表现如何?
- RQ3在高稀疏度下,该方法在多大程度上能减少准确率下降?
- RQ4所提出的方法是否能有效应用于卷积层和全连接层,并保持一致的性能表现?
主要发现
- 在CIFAR-10数据集上,90%稀疏度下,该方法实现了16.13%的错误率,优于最佳基线方法(18.71%),准确率提升6个百分点。
- 与无引导剪枝方法相比,该方法在相同稀疏度下使准确率下降减少了2.6倍,表现出更强的鲁棒性。
- 在MNIST数据集上,90%稀疏度下,该方法实现了1.21%的测试错误率,优于次佳方法(1.43%),准确率提升0.22个百分点。
- 组方差损失有效维持了一小部分高幅度权重组,确保剪枝过程中信息瓶颈保持活跃。
- 该方法在卷积层和全连接层中均表现出一致的性能,证实了其泛化能力。
- 在更高稀疏度下,该方法相比所有基线方法均展现出更优的准确率保持能力,如图2所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。