[论文解读] Learning Frequency Domain Approximation for Binary Neural Networks
该论文提出了一种名为频率域近似(FDA-BNN)的新方法,通过在频域中使用正弦函数的傅里叶级数近似符号函数的梯度,实现二值神经网络的训练。通过保留大部分信号能量所在的低频分量,并利用噪声自适应模块校正高频近似误差,FDA-BNN在CIFAR-10和ImageNet上均实现了最先进(SOTA)的准确率,相较于现有方法,在ResNet-18上最高提升了1.2%的top-1准确率。
Binary neural networks (BNNs) represent original full-precision weights and activations into 1-bit with sign function. Since the gradient of the conventional sign function is almost zero everywhere which cannot be used for back-propagation, several attempts have been proposed to alleviate the optimization difficulty by using approximate gradient. However, those approximations corrupt the main direction of factual gradient. To this end, we propose to estimate the gradient of sign function in the Fourier frequency domain using the combination of sine functions for training BNNs, namely frequency domain approximation (FDA). The proposed approach does not affect the low-frequency information of the original sign function which occupies most of the overall energy, and high-frequency coefficients will be ignored to avoid the huge computational overhead. In addition, we embed a noise adaptation module into the training phase to compensate the approximation error. The experiments on several benchmark datasets and neural architectures illustrate that the binary network learned using our method achieves the state-of-the-art accuracy. Code will be available at extit{https://gitee.com/mindspore/models/tree/master/research/cv/FDA-BNN}.
研究动机与目标
- 解决由于符号函数不可微导致的二值神经网络(BNNs)优化困难问题。
- 在现有方法可能扭曲主梯度方向的基础上,改进符号函数的梯度近似。
- 保留符号函数中占主导地位的低频分量,这些分量承载了其绝大部分能量,以实现更精确的反向传播。
- 通过截断高频傅里叶项并利用噪声自适应模块补偿残余误差,降低计算成本。
- 通过频域中改进的梯度估计,实现在BNN中的最先进性能。
提出的方法
- 使用由正弦函数组成的有限傅里叶级数近似符号函数的梯度,当使用无限项时可实现无损表示。
- 将傅里叶级数截断为固定项数(n),以减少计算开销,重点保留主导信号能量的低频分量。
- 在训练过程中引入噪声自适应模块,以补偿因截断高频傅里叶系数而引入的近似误差。
- 在训练过程中逐步增加傅里叶项数(n),使网络能够逐步学习到对符号函数更优的近似。
- 在反向传播中使用基于傅里叶的近似替代直通估计器(STE),实现BNN的端到端训练。
- 将该方法应用于二值卷积层中的权重和激活,其中首层和末层保持全精度以用于分类。
实验结果
研究问题
- RQ1与现有BNN中的梯度估计器相比,符号函数的频域近似是否能更准确地保留主梯度方向?
- RQ2将傅里叶级数截断为有限项数是否在降低计算成本的同时仍保持足够的表征能力?
- RQ3噪声自适应模块是否能有效校正基于傅里叶的梯度估计器中因截断高频分量而产生的近似误差?
- RQ4所提出的FDA-BNN方法是否在CIFAR-10和ImageNet等标准基准上实现了优于最先进BNN的准确率?
- RQ5训练过程中傅里叶项数的逐步增加如何影响收敛性和最终性能?
主要发现
- 在ResNet-18上使用ImageNet时,FDA-BNN实现了60.2%的top-1准确率和82.3%的top-5准确率,分别比Bireal-Net + PReLU基线高出1.2%和1.0%。
- 当用FDA-BNN替换ReActNet中的梯度计算时,模型实现了66.0%的top-1准确率和86.4%的top-5准确率,分别优于原始ReActNet 0.5%和0.3%。
- 在AlexNet上,FDA-BNN实现了46.2%的top-1准确率和69.7%的top-5准确率,比LNS高出1.8%的top-1准确率。
- 该方法在多种架构和数据集上均保持高性能,展现出良好的泛化能力和鲁棒性。
- 消融实验确认,训练过程中增加傅里叶项数(n)可提升性能,验证了渐进式学习策略的有效性。
- 噪声自适应模块通过减少傅里叶近似中截断高频分量带来的误差,对性能提升有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。