[论文解读] Convergence of a Relaxed Variable Splitting Method for Learning Sparse Neural Networks via $\ell_1, \ell_0$, and transformed-$\ell_1$ Penalties
本文提出了一种松弛变量分裂方法(RVSM),通过结合阈值化与梯度下降,对在 $β$-正则化 $Â𝕎_1$、$Â𝕎_0$ 和变换后 $Â𝕎_1$ 惩罚下的稀疏单隐藏层 ReLU 卷积神经网络进行训练。在高斯输入下,该方法证明了以高概率全局收敛至接近真实权重向量的极限点,通过一种新颖的阈值化操作在训练过程中实现稀疏性。
Sparsification of neural networks is one of the effective complexity reduction methods to improve efficiency and generalizability. We consider the problem of learning a one hidden layer convolutional neural network with ReLU activation function via gradient descent under sparsity promoting penalties. It is known that when the input data is Gaussian distributed, no-overlap networks (without penalties) in regression problems with ground truth can be learned in polynomial time at high probability. We propose a relaxed variable splitting method integrating thresholding and gradient descent to overcome the lack of non-smoothness in the loss function. The sparsity in network weight is realized during the optimization (training) process. We prove that under $\ell_1, \ell_0$; and transformed-$\ell_1$ penalties, no-overlap networks can be learned with high probability, and the iterative weights converge to a global limit which is a transformation of the true weight under a novel thresholding operation. Numerical experiments confirm theoretical findings, and compare the accuracy and sparsity trade-off among the penalties.
研究动机与目标
- 开发一种可证明收敛的方法,用于在非光滑稀疏诱导惩罚下训练稀疏单隐藏层卷积神经网络(ReLU 激活)。
- 通过将阈值化整合进变量分裂框架,克服损失函数在原点处的非光滑性,从而避免标准梯度下降的障碍。
- 在神经网络稀疏化背景下,为 $Â𝕎_1$、$Â𝕎_0$ 和变换后 $Â𝕎_1$ 惩罚建立理论收敛保证。
- 证明通过所提出的方法,稀疏性可在优化过程中自然出现,而非通过事后剪枝。
- 在 VGG-16 和 ResNet18 上对方法进行实证验证,比较不同惩罚下的准确率与稀疏性权衡。
提出的方法
- 提出一种松弛变量分裂方法(RVSM),将权重更新解耦为梯度下降步骤与阈值化操作,以处理非光滑性。
- 将拉格朗日公式与 $Â𝕎_1$、$Â𝕎_0$ 和变换后 $Â𝕎_1$ 惩罚项结合,以促进网络权重的稀疏性。
- 提出一种基于 $Â𝕎_0$ 惩罚的 Moreau 包络导出的新颖阈值化操作,以近似非凸稀疏性,同时保持可微性。
- 基于权重空间中的角度与下降性质,采用几何论证证明尽管在零点处不可微,仍可实现收敛。
- 在高斯输入分布下的总体损失函数上应用该方法,利用损失景观的已知几何特性。
- 通过独立处理每一层,将方法适配至深层网络,从而可应用于 VGG-16 和 ResNet18。
实验结果
研究问题
- RQ1在 $Â𝕎_1$、$Â𝕎_0$ 和变换后 $Â𝕎_1$ 惩罚下,结合阈值化与梯度下降的松弛变量分裂方法是否能对稀疏神经网络训练实现全局收敛?
- RQ2所提出的 RVSM 方法是否能在训练过程中实现稀疏性而无需事后剪枝,且能否以高概率恢复真实权重向量?
- RQ3在准确率与稀疏性权衡方面,$Â𝕎_1$、$Â𝕎_0$ 和变换后 $Â𝕎_1$ 惩罚下的收敛行为与最终稀疏性如何比较?
- RQ4RVSM 方法能否扩展至 VGG-16 和 ResNet18 等深层网络,同时保持稀疏性与性能?
- RQ5在所提出方法下,极限权重向量与真实权重之间的理论误差界是什么?
主要发现
- 在高斯输入下,RVSM 方法以高概率全局收敛至一个极限点,该极限点为真实权重向量在新颖阈值化操作下的变换形式。
- 极限权重向量与真实权重 $\boldsymbol{w}^*$ 的距离在 $O(k\beta\sin\gamma)$ 以内,建立了与真实值的定量误差估计。
- 在 VGG-16 上的数值实验表明,$Â𝕎_0$ 正则化实现了最高稀疏性(86.89%),准确率损失适中(92.54%),而 $ÂWnd_1$ 维持了最高准确率(93.7%)与 35.68% 的稀疏性。
- 在 ResNet18 上,使用 $Â𝕎_0$ 正则化的 RVSM 实现了 93.70% 的稀疏性,显著优于 ADMM(47.08% 稀疏性),同时保持了相近的准确率(94.89% vs. 94.84%)。
- 该方法实现了逐层独立稀疏化,使其可应用于深层网络而无需修改网络架构。
- 理论收敛性依赖于涉及角度与下降性质的几何论证,克服了损失函数在原点处的不可微性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。