[论文解读] Regularized Binary Network Training
该论文提出了一种正则化二值神经网络训练方法,通过引入一种新型的SignSwish激活函数以改善梯度近似,采用可学习的正则化函数以促使权重趋近于±1,并引入每层可训练的缩放因子,从而提升收敛性和准确性。该方法在ImageNet上实现了最先进性能,AlexNet的top-1准确率达到了46.1%,ResNet-18达到了53.0%,优于XNOR-Net和BinaryNet。
There is a significant performance gap between Binary Neural Networks (BNNs) and floating point Deep Neural Networks (DNNs). We propose to improve the binary training method, by introducing a new regularization function that encourages training weights around binary values. In addition, we add trainable scaling factors to our regularization functions. Additionally, an improved approximation of the derivative of the sign activation function in the backward computation. These modifications are based on linear operations that are easily implementable into the binary training framework. Experimental results on ImageNet shows our method outperforms the traditional BNN method and XNOR-net.
研究动机与目标
- 缩小二值神经网络(BNNs)与全精度深度神经网络(DNNs)在资源受限设备上的性能差距。
- 解决由于反向传播过程中在±1附近发生梯度饱和而导致的BNN训练不稳定与收敛性差的问题。
- 通过一种新型正则化函数促使权重收敛至±1,从而提升二值网络的泛化能力和鲁棒性。
- 通过引入每层或每滤波器的可学习缩放因子,缓解硬二值化带来的准确率下降问题。
提出的方法
- 提出SignSwish(SSwish),一种可微分且有界的激活函数,源自Swish,引入可学习的缩放参数β,以改善在±1附近的梯度流动。
- 提出一种新型正则化函数 R₁(w) = |α − |w||(曼哈顿距离)和 R₂(w) = (α − |w|)²(欧几里得距离),其中α为每层可学习的缩放参数,用于促使权重收敛至±1。
- 将正则化项整合进总损失函数中,表示为 J(W,b) = L(W,b) + λₜ∑ₕ R(Wₕ,αₕ),实现权重与缩放因子的联合优化。
- 使用|W|的中位数或均值分别作为R₁和R₂中α*的初始化值,确保初始化与正则化目标一致。
- 在激活前使用批量归一化,并保留首层和末层为全精度,以保持准确性,与先前的BNN方法保持一致。
- 在消融研究中使用固定β值,通过调节β以控制梯度饱和点,提升训练稳定性。
实验结果
研究问题
- RQ1与标准的直通估计器相比,可学习的有界激活函数是否能改善二值神经网络中的梯度近似?
- RQ2一种惩罚偏离±1偏差的正则化函数是否能提升二值网络训练的收敛性和准确率?
- RQ3每层或每滤波器的可学习缩放因子是否能缓解BNN中因硬二值化导致的准确率损失?
- RQ4与现有BNN方法相比,改进的梯度近似、正则化和缩放因子的组合在ImageNet上的性能表现如何?
主要发现
- 所提方法在使用AlexNet的ImageNet上实现了46.1%的top-1准确率,优于XNOR-Net(44.2%)和BinaryNet(41.2%)。
- 在ResNet-18上,该方法实现了53.0%的top-1准确率,优于XNOR-Net(51.2%)和BinaryNet(42.2%)。
- 使用β=10的SignSwish实现了最佳性能,表明其在±1附近的梯度流动优于标准STE。
- R₁正则化与SignSwish(β=10)的组合在两种架构上均取得最高准确率,表明权重在±1处实现了有效聚类。
- 消融研究证实,SignSwish、正则化和缩放因子三者协同作用,共同带来性能增益。
- 即使首层和末层保持全精度,该方法仍保持高性能,与先前BNN实践一致,验证了其稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。