Skip to main content
QUICK REVIEW

[论文解读] Regularizing Activation Distribution for Training Binarized Deep Networks

Ruizhou Ding, Ting-Wu Chin|arXiv (Cornell University)|Apr 4, 2019
Advanced Neural Network Applications参考文献 44被引用 20
一句话总结

本文提出一种分布损失,用于正则化二值化神经网络(BNNs)中的激活分布,从而在不牺牲能效的前提下提升训练稳定性和准确性。通过显式惩罚退化、饱和或激活不良的通道,该方法在多种优化器和超参数设置下均实现稳健训练,在ImageNet上实现了1比特权重和激活的最先进准确率。

ABSTRACT

Binarized Neural Networks (BNNs) can significantly reduce the inference latency and energy consumption in resource-constrained devices due to their pure-logical computation and fewer memory accesses. However, training BNNs is difficult since the activation flow encounters degeneration, saturation, and gradient mismatch problems. Prior work alleviates these issues by increasing activation bits and adding floating-point scaling factors, thereby sacrificing BNN's energy efficiency. In this paper, we propose to use distribution loss to explicitly regularize the activation flow, and develop a framework to systematically formulate the loss. Our experiments show that the distribution loss can consistently improve the accuracy of BNNs without losing their energy benefits. Moreover, equipped with the proposed regularization, BNN training is shown to be robust to the selection of hyper-parameters including optimizer and learning rate.

研究动机与目标

  • 解决因激活退化、饱和和梯度不匹配导致的1比特权重和激活BNN训练困难问题。
  • 克服先前方法通过增加网络宽度或使用浮点数缩放因子带来的局限,这些方法会降低能效。
  • 开发一种可微、可学习的正则化机制,显式调节激活分布,避免训练不稳定性。
  • 证明所提方法可在保持纯逻辑计算和最小内存占用的前提下提升BNN准确率。

提出的方法

  • 构建一种分布损失 $ L_D $,对偏离理想、行为良好的分布形状(例如,以零为中心且正负比例均衡)的激活分布施加惩罚。
  • 引入基于平滑直方图估计的可微近似,以实现通过损失的反向传播。
  • 通过超参数 $ \\-lambda \$ 将分布损失与标准分类损失结合,以平衡正则化与准确率。
  • 在反向传播过程中应用该损失,以促使每通道激活避免退化(恒定输出)、饱和(零梯度)和梯度不匹配(STE近似不佳)。
  • 采用预激活批量归一化与基于ReLU的结构以稳定训练,分布损失作为激活流的正则化器。
  • 通过确保整个损失函数可微,实现端到端训练,使梯度能够通过分布损失流向网络权重。

实验结果

研究问题

  • RQ1显式正则化激活分布是否能提升1比特权重和激活BNN的训练稳定性和准确率?
  • RQ2所提出的分布损失是否能减少二值化网络中的退化、饱和和梯度不匹配?
  • RQ3该方法是否能在不引入浮点数运算或增加网络宽度的前提下提升BNN准确率?
  • RQ4该分布损失对优化器、学习率及其他超参数的变化是否具有鲁棒性?
  • RQ5该正则化效果是否在不同网络架构(包括VGG型和残差网络)中均成立?

主要发现

  • 在CIFAR-10上,所提分布损失显著提升BNN准确率,当 $ \\-lambda = 0.2 $ 时达到90.12%的top-1准确率,优于基线BNN的87.39%。
  • 在ImageNet上,该方法在1比特权重和激活下实现了44.1%的top-1准确率,达到当前最先进水平,优于先前SOTA方法。
  • 分布损失减少了激活退化:直方图显示恒定输出的通道更少,正向比例更均衡。
  • 使用分布损失训练的BNN对优化器选择具有鲁棒性——Adam、SGD带动量、Nesterov和RMSprop均带来一致的性能提升。
  • 该方法在 $ \\-lambda \$ 值范围(0.2至2000)内均有效,准确率始终高于基线,表明对正则化强度的敏感度较低。
  • 分布损失在训练初期迅速衰减,表明激活分布快速稳定,这与更快收敛和更好泛化能力相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。