Skip to main content
QUICK REVIEW

[论文解读] Shifting Mean Activation Towards Zero with Bipolar Activation Functions

Lars Hiller Eidnes, Arild Nøkland|arXiv (Cornell University)|Sep 12, 2017
Neural Networks and Applications参考文献 20被引用 10
一句话总结

本文提出双极激活函数——ReLU 和 ELU 的扩展形式,通过在神经元间交替符号翻转,将层的激活均值推向零,从而在无需批量归一化的情况下提升深度网络的训练稳定性。实验表明,该方法在深度 RNN 和 CNN 中实现更快收敛与更低的测试误差,在 Penn Treebank 和 Text8 上取得非门控模型的最先进结果,并在无批量归一化的 CIFAR-10 任务中表现更优。

ABSTRACT

We propose a simple extension to the ReLU-family of activation functions that allows them to shift the mean activation across a layer towards zero. Combined with proper weight initialization, this alleviates the need for normalization layers. We explore the training of deep vanilla recurrent neural networks (RNNs) with up to 144 layers, and show that bipolar activation functions help learning in this setting. On the Penn Treebank and Text8 language modeling tasks we obtain competitive results, improving on the best reported results for non-gated networks. In experiments with convolutional neural networks without batch normalization, we find that bipolar activations produce a faster drop in training error, and results in a lower test error on the CIFAR-10 classification task.

研究动机与目标

  • 解决深度网络中非零均值激活的问题,该问题会减缓学习速度并加剧梯度消失/爆炸问题。
  • 通过设计能自然促进零均值激活的激活函数,消除对批量归一化等归一化层的依赖。
  • 通过修改激活函数,改善深度普通 RNN 和前馈网络的训练动态与收敛速度。
  • 评估双极激活函数是否能在无需显式归一化的情况下,于语言建模与图像分类任务中实现有竞争力的性能。

提出的方法

  • 通过在偶数索引神经元上应用 f(x),奇数索引神经元上应用 -f(-x),提出双极激活函数,确保激活均值向零偏移。
  • 将该方法应用于 ReLU、Leaky ReLU 和 ELU 变体,分别构建 BReLU、BLeakyReLU 和 BELU。
  • 使用层序单位方差(LSUV)初始化方法,保持各层激活的单位方差。
  • 在深度 RNN 中采用残差连接、权重共享和 Dropout 以提升训练稳定性。
  • 在 Penn Treebank 和 Text8 上训练模型进行字符级语言建模,在 CIFAR-10 上使用卷积网络训练,完全移除批量归一化。
  • 采用学习率调度与数据增强策略,以在无批量归一化的情况下稳定 CNN 的训练。

实验结果

研究问题

  • RQ1双极激活函数是否能在无批量归一化的情况下减少深度网络中的激活均值偏移?
  • RQ2使用双极激活是否能提升深度普通 RNN 的训练稳定性和收敛速度?
  • RQ3双极激活是否能在无门控机制(如 LSTM)的情况下实现语言建模任务的有竞争力性能?
  • RQ4双极激活是否能使 CNN 在无批量归一化的情况下支持更高学习率并实现更快的误差下降?
  • RQ5双极激活与 LSUV 初始化的组合是否足以替代深度网络中的显式归一化层?

主要发现

  • 在 Penn Treebank 和 Text8 数据集上,36 层 BELU-RNN 模型达到 1.423 BPC 的测试误差,优于此前报告的非门控网络最佳结果(Skipping-RNN 的 1.48 BPC)。
  • BELU-RNN 模型表现具有竞争力,在 Text8 上的测试误差优于多种门控模型(如 LSTM 和 MI-LSTM)。
  • 在 CIFAR-10 上,采用 BReLU 的定向响应网络(ORN)将测试误差从 ReLU 的 9.20% 降低至 4.91%,Wide ResNet 的误差从 9.78% 降至 6.03%。
  • 采用双极激活的网络可将学习率提高至标准 ReLU 的 64 倍,表明训练稳定性显著提升。
  • 双极激活下训练误差下降更快,且在 ORN 和 WRN 架构中,最终测试误差始终低于标准 ReLU 或 ELU。
  • 结果表明,双极激活结合 LSUV 初始化可替代批量归一化,在深度网络中实现更快收敛与更好泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。