Skip to main content
QUICK REVIEW

[論文レビュー] FReLU: Flexible Rectified Linear Units for Improving Convolutional Neural Networks

Suo Qiu, Xiangmin Xu|arXiv (Cornell University)|Jun 25, 2017
Advanced Neural Network Applications被引用数 7
ひとこと要約

この論文では、可学習バイアスパラメータを導入することでReLUを拡張し、柔軟な負の活性化を可能にする学習可能な活性化関数FReLUを提案する。計算コストを増加させることなくモデルの表現力が向上し、CIFAR-10、CIFAR-100、ImageNetベンチマークにおいて、バッチ正規化を用いる場合に特に顕著に、ReLU、PReLU、ELU、SReLUよりも高速な収束と高い精度を達成する。

ABSTRACT

Rectified linear unit (ReLU) is a widely used activation function for deep convolutional neural networks. However, because of the zero-hard rectification, ReLU networks miss the benefits from negative values. In this paper, we propose a novel activation function called \emph{flexible rectified linear unit (FReLU)} to further explore the effects of negative values. By redesigning the rectified point of ReLU as a learnable parameter, FReLU expands the states of the activation output. When the network is successfully trained, FReLU tends to converge to a negative value, which improves the expressiveness and thus the performance. Furthermore, FReLU is designed to be simple and effective without exponential functions to maintain low cost computation. For being able to easily used in various network architectures, FReLU does not rely on strict assumptions by self-adaption. We evaluate FReLU on three standard image classification datasets, including CIFAR-10, CIFAR-100, and ImageNet. Experimental results show that the proposed method achieves fast convergence and higher performances on both plain and residual networks.

研究の動機と目的

  • ReLUの限界、すなわち負の情報の欠落とゼロ中心の活性化の欠如を解消するため、可学習なリクトフィケーションポイントを導入すること。
  • 制御された負の活性化を通じて、畳み込みニューラルネットワークの表現力と一般化能力を向上させること。
  • 計算効率とバッチ正規化との互換性を維持する活性化関数を設計すること。
  • 負の値がネットワーク性能に有意に寄与することを実証的に検証すること。

提案手法

  • FReLUは、可学習バイアスパラメータ $ b_l $ を導入することでReLUを変更し、$ frelu(x) = \begin{cases} x + b_l & \text{if } x > 0 \\ b_l & \text{if } x \leq 0 \end{cases} $ と定義する。これにより出力が垂直方向にシフト可能となる。
  • 可学習パラメータ $ b_l $ はネットワークと同時にエンドツーエンドで学習され、活性化しきい値の適応的調整が可能になる。
  • 前方伝搬と逆伝搬は計算的に効率的であり、指数関数などの高コストな演算を回避する。
  • FReLUはバッチ正規化と互換性があり、アーキテクチャの変更を必要としない。
  • この手法は、プレインネットワークおよび残差ネットワーク、特にResNetとNINアーキテクチャに適用可能である。
  • 勾配消失を回避するため、対称的な重み初期化を活用した慎重なパラメータ初期化が行われている。

実験結果

リサーチクエスチョン

  • RQ1ReLUに可学習バイアスを導入することで、制御された負の活性化が可能になり、モデル性能の向上が達成できるか?
  • RQ2標準的な画像分類データセットにおいて、FReLUはReLU、PReLU、ELU、SReLUよりも精度と収束速度で優れているか?
  • RQ3FReLUはバッチ正規化と組み合わせた場合、ELUと比較してどのように性能を発揮するか?
  • RQ4FReLUはスパarsityや計算効率を損なうことなく、有用な負の情報を効果的に捉えることができるか?
  • RQ5FReLUの自己適応的性質により、強い仮定を必要とせずにさまざまなネットワークアーキテクチャに一般化可能か?

主な発見

  • NINモデルを用いたCIFAR-10では、FReLUがテスト誤差7.30%(±0.20)を達成し、ReLU(8.05%)、PReLU(8.86%)、ELU(8.08%)、SReLU(7.93%)を上回った。
  • NINを用いたCIFAR-100では、FReLUがテスト誤差28.47%(±0.21)を達成し、ReLU(29.46%)、PReLU(33.73%)、ELU(28.33%)を顕著に上回った。
  • CIFAR-10用ResNet-110では、FReLUがテスト誤差6.20%(±0.23)を達成し、元のアーキテクチャでReLU(6.82%)とELU(8.21%)を上回った。
  • 修正された残差ブロックを用いることで、CIFAR-100用ResNet-110ではFReLUが5.71%の誤差を達成し、ELU(5.86%)とReLU(28.48%)を上回った。
  • ImageNetでは、FReLUがNINでトップ-1誤差をReLUの35.65%から34.82%に低下させ、CaffeNetの最良成績51.20%と同等の性能を達成し、ELU(51.20%)とReLU(53.00%)を上回った。
  • FReLUはELUよりも高速な収束を示し、バッチ正規化とも良好に連携していた。特に残差ブロックに直接置き換えた場合、ELUは性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。