Skip to main content
QUICK REVIEW

[論文レビュー] Training Neural Networks by Using Power Linear Units (PoLUs)

Yikang Li, Pak Lun Kevin Ding|arXiv (Cornell University)|Feb 1, 2018
Advanced Neural Network Applications参考文献 19被引用数 8
ひとこと要約

本稿では、正の入力に対して恒等写像を、負の入力に対してべき関数を組み合わせることで非線形性を向上させる、新しいニューラルネットワークの活性化関数であるパワー線形ユニット(PoLUs)を提案する。PoLUsは勾配消失を軽減し、バイアスシフトを緩和し、応答領域を拡大することで、ResNet-50 や VGG16 を含む複数のアーキテクチャにおいて、MNIST、CIFAR-10、CIFAR-100、SVHN、ImageNet で最先端の性能を達成する。

ABSTRACT

In this paper, we introduce "Power Linear Unit" (PoLU) which increases the nonlinearity capacity of a neural network and thus helps improving its performance. PoLU adopts several advantages of previously proposed activation functions. First, the output of PoLU for positive inputs is designed to be identity to avoid the gradient vanishing problem. Second, PoLU has a non-zero output for negative inputs such that the output mean of the units is close to zero, hence reducing the bias shift effect. Thirdly, there is a saturation on the negative part of PoLU, which makes it more noise-robust for negative inputs. Furthermore, we prove that PoLU is able to map more portions of every layer's input to the same space by using the power function and thus increases the number of response regions of the neural network. We use image classification for comparing our proposed activation function with others. In the experiments, MNIST, CIFAR-10, CIFAR-100, Street View House Numbers (SVHN) and ImageNet are used as benchmark datasets. The neural networks we implemented include widely-used ELU-Network, ResNet-50, and VGG16, plus a couple of shallow networks. Experimental results show that our proposed activation function outperforms other state-of-the-art models with most networks.

研究の動機と目的

  • ReLU の限界、たとえば死滅ニューロンやバイアスシフトを解消するため、より頑健な活性化関数を設計すること。
  • 応答領域の多様性を高めることで、深層ニューラルネットワークの非線形性の能力を向上させること。
  • 既存の関数(例:ELU)の制約を克服し、負の活性化領域における勾配の傾きと飽和の独立制御を可能にすること。
  • PoLU の優位性を、ResNet-50 や VGG16 を含む多様なアーキテクチャとデータセット上で実証的に検証すること、特にバッチ正則化が存在しない状況での性能を含む。

提案手法

  • 正の入力に対して恒等関数(f(x) = x)を用いることで、勾配消失を防ぐ。
  • 負の入力に対してはべき関数(x < 0 のとき f(x) = -|x|^n、n > 1)を適用し、飽和とノイズ耐性を実現する。
  • べき乗パラメータ n を用いることで、勾配の傾きと飽和を独立して制御可能であり、ELU と異なり指数関数による結合とは異なる。
  • 負の入力に対しても出力がゼロでないよう設計されており、平均活性化のドリフトを軽減し、バイアスシフトを緩和する。
  • 理論的分析により、PoLU は層内の応答領域の数を増加させ、表現能力を向上させることを示す。
  • 実験では、ResNet-50 や VGG16 を含む複数のネットワークとデータセットで、ReLU、ELU、PReLU、Leaky ReLU と比較して PoLU を評価する。

実験結果

リサーチクエスチョン

  • RQ1負の領域におけるべき関数ベースの活性化関数が、ReLU や ELU を超えて深層ネットワークの性能を向上させられるか?
  • RQ2負の活性化領域における勾配の傾きと飽和の独立制御が、より良い一般化性能と高速収束をもたらすか?
  • RQ3PoLU は ReLU や ELU に比べて、応答領域の数をどの程度増加させるか?
  • RQ4バッチ正則化が存在しない状況において、PoLU は異なるネットワークアーキテクチャとデータセットでどの程度の性能を発揮するか?
  • RQ5勾配安定性と表現能力のバランスをとる最適なべき乗パラメータ n の値は何か?

主な発見

  • PoLU は、MNIST、CIFAR-10、CIFAR-100、SVHN、ImageNet において、複数のアーキテクチャで ReLU や ELU よりも優れた性能を発揮する。
  • ImageNet では、初期の学習段階は類似していたが、最終学習エポックでは ELU よりも高い最終精度と低い損失を達成した。
  • 1エポックあたりの計算時間が5%増加しても、PoLU は ReLU と同等の訓練損失に、より少ないエポックで到達した。
  • n=2 の PoLU がテストされた値の中で最も優れた性能を示したが、n>2 ではゼロ付近での過剰な勾配勾配により不安定化が生じた。
  • バッチ正則化が存在しない深層ネットワークでは、PoLU と ReLU の性能差が顕著に現れ、PoLU がバイアスシフトの緩和に有効であることを示した。
  • 全結合層を含むネットワークでは、PoLU、ELU、ReLU 間の性能差が縮小したため、活性化関数の利点がアーキテクチャに依存することを示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。