[论文解读] Learning Sparse Neural Networks via Sensitivity-Driven Regularization
该论文提出了一种基于敏感度的正则化方法,通过一种新颖的正则化项(源自反向传播的雅可比矩阵)逐步减小对网络输出影响较小的参数(即敏感度较低的参数)的大小,从而实现深度神经网络的稀疏化。该方法在保持或提升测试准确率的同时,实现了显著更高的稀疏度(最高可达当前最先进方法的两倍),在MNIST和ImageNet基准测试中均优于标准的L2和L1正则化技术。
The ever-increasing number of parameters in deep neural networks poses challenges for memory-limited applications. Regularize-and-prune methods aim at meeting these challenges by sparsifying the network weights. In this context we quantify the output sensitivity to the parameters (i.e. their relevance to the network output) and introduce a regularization term that gradually lowers the absolute value of parameters with low sensitivity. Thus, a very large fraction of the parameters approach zero and are eventually set to zero by simple thresholding. Our method surpasses most of the recent techniques both in terms of sparsity and error rates. In some cases, the method reaches twice the sparsity obtained by other techniques at equal error rates.
研究动机与目标
- 解决在内存和带宽受限设备上部署大型过参数化深度神经网络的挑战。
- 在不损害模型性能的前提下提升网络稀疏度,特别是在参数数量最多的全连接层中。
- 开发一种正则化方法,选择性地剪枝敏感度较低的参数,同时保留关键参数。
- 评估基于敏感度的正则化对模型泛化能力以及稀疏度-准确率权衡的影响。
提出的方法
- 该方法引入一种基于参数输出敏感度的正则化项,通过网络输出对每个参数的雅可比矩阵计算敏感度。
- 敏感度源自反向传播梯度,可实现高效计算,额外开销极小。
- 通过正则化项逐步将低敏感度参数推向零,从而支持后续通过阈值化操作将其设为零。
- 采用两种公式:特定敏感度(按参数)和非特定敏感度(全局平均),两者均集成到训练过程的损失函数中。
- 采用“正则化-剪枝”流程:先使用基于敏感度的正则化进行训练,再通过阈值化实现稀疏化。
- 该方法具有通用性,适用于任何可微的神经网络架构,无架构限制。
实验结果
研究问题
- RQ1基于敏感度的正则化能否有效识别并剪枝不重要的参数,同时不降低模型准确率?
- RQ2与标准的L2和L1正则化相比,基于敏感度的正则化在稀疏度和泛化能力方面表现如何?
- RQ3该方法是否能在与最先进技术相当或更低的误差率下实现更高的稀疏度?
- RQ4使用特定敏感度与非特定敏感度公式对稀疏度和性能的影响如何?
- RQ5基于敏感度的正则化是否能超越标准正则化技术,提升模型泛化能力?
主要发现
- 在MNIST上,使用非特定敏感度公式的该方法实现了31.34%的稀疏度,Top-1错误率为0.97%,在稀疏度-准确率权衡上优于其他方法。
- 在ImageNet上的VGG-16上,该方法将Top-1错误率从Han et al.的10.88%降低至9.80%,在相近稀疏度下实现了更好的泛化性能。
- 基于敏感度的正则化器在训练过程中测试损失低于L2正则化,表明其泛化性能更优。
- 该方法在MNIST上实现了网络复杂度降低十倍的同时保持性能,展现出强大的稀疏化能力。
- 对于更深的网络(如VGG-16),特定敏感度公式(S^spec)在ImageNet上实现了更高的稀疏度(30.92%),优于非特定版本(29.29%)。
- 该方法引入的计算开销极小,因为敏感度是反向传播的副产品,可高效计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。