[论文解读] On improving deep learning generalization with adaptive sparse connectivity
该论文提出NPSET方法,通过在内在稀疏的多层感知机(MLPs)中应用迭代神经元剪枝,增强稀疏进化训练(SET),将参数量减少约50%,同时提升泛化能力。该方法保持线性参数缩放,并在15个数据集上实现优于全连接网络的测试准确率,通过自适应稀疏性和隐式正则化实现更优的泛化性能。
Large neural networks are very successful in various tasks. However, with limited data, the generalization capabilities of deep neural networks are also very limited. In this paper, we empirically start showing that intrinsically sparse neural networks with adaptive sparse connectivity, which by design have a strict parameter budget during the training phase, have better generalization capabilities than their fully-connected counterparts. Besides this, we propose a new technique to train these sparse models by combining the Sparse Evolutionary Training (SET) procedure with neurons pruning. Operated on MultiLayer Perceptron (MLP) and tested on 15 datasets, our proposed technique zeros out around 50% of the hidden neurons during training, while having a linear number of parameters to optimize with respect to the number of neurons. The results show a competitive classification and generalization performance.
研究动机与目标
- 解决在训练数据有限时深度神经网络的泛化与过拟合问题。
- 克服传统剪枝方法因需预训练全连接网络而带来的可扩展性限制。
- 通过整合神经元剪枝改进稀疏进化训练(SET)过程,进一步降低模型复杂度。
- 通过实证验证,内在稀疏网络的自适应连接性优于全连接网络的泛化性能。
- 证明动态连接性演化带来的隐式正则化可增强泛化能力,而无需显式正则化技术。
提出的方法
- 提出NPSET,一种新型训练方法,将稀疏进化训练(SET)与迭代神经元剪枝结合,动态移除非信息性隐藏神经元。
- 每γ个周期后,基于参数量对输出连接最少的神经元进行基于幅度的剪枝,减少活跃神经元和连接数。
- 在整个训练过程中保持稀疏初始拓扑,避免全连接网络带来的二次方参数开销。
- 采用两阶段训练策略:先进行带剪枝的训练,随后在无剪枝条件下继续SET训练以稳定性能。
- 通过超参数搜索调整α=0.04(剪枝阈值)、β=10(连接移除率)和γ=40(剪枝频率)以获得最佳性能。
- 将NPSET与SET、全连接MLP以及直接SET/FC-MLP基线模型进行对比,确保在相同最终架构下的公平评估。
实验结果
研究问题
- RQ1与仅使用SET的稀疏MLP相比,结合SET的迭代神经元剪枝是否能进一步提升泛化性能?
- RQ2在小到中等规模数据集上,使用自适应连接性的内在稀疏MLP是否比全连接网络具有更好的泛化性能?
- RQ3通过连接移除与重连实现的稀疏连接动态演化,在多大程度上起到隐式正则化作用?
- RQ4与标准剪枝和SET相比,NPSET在参数效率和模型压缩方面表现如何?
- RQ5NPSET是否能在减少模型规模和计算成本的同时,实现高于全连接MLP的测试准确率?
主要发现
- 在15个数据集中的8个上,NPSET的测试准确率优于SET,其中在CLL-SUB-111数据集上提升最大,达+8.11%。
- 在gisette数据集上,NPSET达到97.64%的准确率,优于SET(97.43%)和全连接基线(97.60%)。
- 在Yale数据集上,全连接MLP出现完美过拟合(100%训练准确率),而NPSET和SET均保持泛化差距,表明更强的鲁棒性。
- NPSET的压缩率比SET高出6-7倍,平均在各数据集上将模型参数量减少约50%。
- 学习曲线显示,NPSET和SET的训练与测试准确率差距显著小于全连接MLP,表明泛化能力更强。
- 该方法在未使用显式正则化(如Dropout、L1/L2)的情况下仍取得优异性能,表明结构稀疏性和动态连接性演化可提供隐式正则化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。