Skip to main content
QUICK REVIEW

[論文レビュー] PLU: The Piecewise Linear Unit Activation Function

Andrei Nicolae|arXiv (Cornell University)|Sep 3, 2018
Neural Networks and Applications参考文献 3被引用数 21
ひとこと要約

本稿では、tanhの滑らかな非線形性とReLUの勾配安定性を組み合わせた、新しい活性化関数であるPiecewise Linear Unit (PLU) を提案する。PLUは、学習可能なパラメータを有する3つの線形セグメントを用いて、ReLUよりも複雑な非線形関数をよりよく近似する。勾配消失を回避し、特に浅いネットワークや非線形関数のフィッティングタスクにおいて、tanhに近い性能を達成する。

ABSTRACT

Successive linear transforms followed by nonlinear "activation" functions can approximate nonlinear functions to arbitrary precision given sufficient layers. The number of necessary layers is dependent on, in part, by the nature of the activation function. The hyperbolic tangent (tanh) has been a favorable choice as an activation until the networks grew deeper and the vanishing gradients posed a hindrance during training. For this reason the Rectified Linear Unit (ReLU) defined by max(0, x) has become the prevailing activation function in deep neural networks. Unlike the tanh function which is smooth, the ReLU yields networks that are piecewise linear functions with a limited number of facets. This paper presents a new activation function, the Piecewise Linear Unit (PLU) that is a hybrid of tanh and ReLU and shown to outperform the ReLU on a variety of tasks while avoiding the vanishing gradients issue of the tanh.

研究の動機と目的

  • ReLUの区分線形性に起因するゼロ勾配のため、滑らかで高次非線形関数をフィッティングする能力に制限があることに対処すること。
  • tanhの勾配消失問題を克服しつつ、より良い関数近似を実現するための高い非線形性を維持すること。
  • 計算効率が良く、逆関数が存在し、ReLUの「死んだニューロン」問題を回避する活性化関数を設計すること。
  • PLUの性能を複数の関数近似タスクおよび実世界の分類ベンチマークで評価すること。

提案手法

  • PLUは3セグメントの区分線形関数として定義される:$\text{PLU}(x) = \max(\alpha(x+c)-c, \min(\alpha(x-c)+c, x))$。ここで、$\alpha$ と $c$ は学習可能なパラメータまたは固定ハイパーパrameterである。
  • 関数は、有界な範囲でtanh関数の形状を近似するように構築されているが、勾配飽和を防ぐために非有界に保たれる。
  • PLUは全域で逆関数が存在し、逆関数は $\text{PLU}^{-1}(x) = \min\left(\frac{x+c}{\alpha}-c, \max\left(\frac{x-c}{\alpha}+c\right)\right)$ で与えられる。これにより、逆可逆ネットワークへの応用が可能である。
  • 本手法は、浅いおよび深い順方向ネットワーク、CIFAR-10における畳み込みネットワーク、パラメトリック関数フィッティングおよび3次元表面フィッティングタスクで評価された。
  • すべての実験でAdam最適化アルゴリズムを用い、標準的なハイパーパrameterを設定した。PLUはReLU、tanh、恒等関数と比較された。
  • 関数近似タスクでは平均二乗誤差(MSE)損失が使用され、画像分類タスクでは交差エントロピー損失と正解率指標が用いられた。

実験結果

リサーチクエスチョン

  • RQ1区分線形活性化関数が、sin(x) やパラメトリック曲線などの滑らかで高次非線形関数の近似においてReLUを上回ることができるか?
  • RQ2PLUは勾配消失問題を回避しながら、tanhと同等の性能を維持できるか?
  • RQ3実世界の画像分類タスクにおける深層畳み込みネットワークにおいて、PLUはReLUやtanhと比較して優れた性能を示すか?
  • RQ4PLUは逆関数が存在するか?逆可逆活性化関数を必要とするアーキテクチャに利用可能か?
  • RQ5PLUの線形セグメント数の増加により、浅いネットワークにおける関数近似性能が向上するか?

主な発見

  • sin(x) の近似において、PLUはReLUに比べて平均二乗誤差(MSE)損失を2桁低く抑え、tanhと同等の性能を達成した。
  • パラメトリック関数フィッティングにおいて、PLUはReLUよりも顕著に多くの線形セグメントを生成し、ターゲット曲線に近いフィットを実現した。
  • 双曲抛物面 $x^2 - y^2$ の3次元表面近似において、PLUは視覚的フィットと訓練損失の両面でReLUを上回り、tanhに近い性能を示した。
  • CIFAR-10では、データの近似線形性のためReLUが良好に機能したが、PLUとtanhはReLUよりも高速に学習を完了させ、勾配安定性が裏付けられた。
  • PLUは実数全般で逆関数が存在し、tanh(定義域 $(-1,1)$ に限る)やReLU(非可逆)とは異なり、全域で逆関数が存在することを示した。
  • PLUはReLUの「死んだニューロン」問題を回避し、どこでも非ゼロ勾配を維持しており、安定した学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。