Skip to main content
QUICK REVIEW

[論文レビュー] Soft-Root-Sign Activation Function

Yuan Zhou, Dandan Li|arXiv (Cornell University)|Mar 1, 2020
Advanced Neural Network Applications参考文献 46被引用数 16
ひとこと要約

本論文は、可学習パラメータを用いてゼロ平均の活性化を達成し、分布の安定性を向上させることで、ReLUの欠点(非ゼロ平均、負の値の欠落、非有界出力)を解消する、滑らかで非単調的かつ有界な活性化関数であるSoft-Root-Sign (SRS) を提案する。SRSは画像分類、機械翻訳、生成モデルの分野でReLUや他の最先端の活性化関数を上回り、アブレーションスタディによりバッチ正規化との互換性と重み初期化へのロバスト性が確認された。

ABSTRACT

The choice of activation function in deep networks has a significant effect on the training dynamics and task performance. At present, the most effective and widely-used activation function is ReLU. However, because of the non-zero mean, negative missing and unbounded output, ReLU is at a potential disadvantage during optimization. To this end, we introduce a novel activation function to manage to overcome the above three challenges. The proposed nonlinearity, namely "Soft-Root-Sign" (SRS), is smooth, non-monotonic, and bounded. Notably, the bounded property of SRS distinguishes itself from most state-of-the-art activation functions. In contrast to ReLU, SRS can adaptively adjust the output by a pair of independent trainable parameters to capture negative information and provide zero-mean property, which leading not only to better generalization performance, but also to faster learning speed. It also avoids and rectifies the output distribution to be scattered in the non-negative real number space, making it more compatible with batch normalization (BN) and less sensitive to initialization. In experiments, we evaluated SRS on deep networks applied to a variety of tasks, including image classification, machine translation and generative modelling. Our SRS matches or exceeds models with ReLU and other state-of-the-art nonlinearities, showing that the proposed activation function is generalized and can achieve high performance across tasks. Ablation study further verified the compatibility with BN and self-adaptability for different initialization.

研究の動機と目的

  • ReLUの制限、すなわち非ゼロ平均の活性化、負の値の抑制(負の値の欠落)、非有界出力といった問題を解消し、最適化と一般化の障壁を低減すること。
  • 滑らかで非単調的かつ有界な新しい活性化関数を設計し、活性化分布の安定化に寄与する適応的パラメータを備えること。
  • バッチ正規化との互換性を向上させ、重み初期化への感受性を低減すること。
  • 画像分類、機械翻訳、生成モデルといった多様なタスクにおいてSRSの実証的妥当性を検証すること。
  • 勾配の挙動、ソフトな非活性範囲、有界出力といったSRSの根本的特性が、その性能向上にどのように寄与するかを分析すること。

提案手法

  • 可学習パラメータを用いた非線形活性化関数として、$ f(x) = \alpha \cdot \text{sign}(x) \cdot \sqrt{\beta \cdot x^2 + \epsilon} $ で定義されるSoft-Root-Sign (SRS) を提案する。ここで $ \alpha $ と $ \beta $ は可学習パラメータである。
  • 微分可能で滑らかで非単調な関数を導入し、出力が有界であることを保ちながら、ReLUの非有界性とは対照的である。
  • 深層学習フレームワークへの統合を容易にするために、カスタムニューラルネットワークレイヤーを採用し、最小限の変更で実装可能である。
  • 可学習パラメータ $ \alpha $ と $ \beta $ を動的に調整することで、活性化の平均と勾配の流れを最適化し、ゼロ平均出力と改善された勾配伝搬を実現する。
  • ResNetを用いた画像分類、Transformerを用いた機械翻訳、VAEを用いた生成モデルなど、複数のタスクにわたりSRSを適用する。
  • Gaussian、Xavier、Heなどの異なる初期化スキームを用いた条件下で、SRSとReLU、他の非線形関数とのアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1ReLUの非ゼロ平均と非有界出力が引き起こす最適化の課題を、有界で滑らかで非単調な活性化関数SRSが軽減できるか。
  • RQ2SRSはReLUや他の現代的な活性化関数と比較して、一般化性能や収束速度を向上させられるか。
  • RQ3SRSはバッチ正規化とどの程度互換性があり、異なる重み初期化スキームに対してもロバストか。
  • RQ4SRSの出力の形状は、滑らかさと最適化可能性の観点から、ReLUや他の非線形関数と比較してどのように異なるか。
  • RQ5SRSの性能向上に最も寄与している要因は、有界出力や可学習パラメータといった特定の特性のうち、どれか。

主な発見

  • Gaussian初期化下でFashion-MNISTデータセットにおいて、SRSはテスト誤差12.58%を達成し、ReLU(12.96%)や他のベースラインと比較して、すべての初期化スキームで優れた性能を示した。
  • SRSネットワークは、隠れ層において急速に正の値に偏るReLUとは異なり、ゼロに近い安定した活性化平均を示し、収束が速かった。
  • CIFAR-10における画像分類では、SRSはReLUや他の最先端の活性化関数(SwishやSELUを含む)と同等またはそれを上回る性能を発揮した。
  • WMT 2014 En-Deにおける機械翻訳では、SRSはBLEUスコアでReLUや他の非線形関数を上回り、より優れた系列モデル化能力を示した。
  • CIFAR-10における生成モデル(VAE)では、SRSはReLUやELUよりも高品質なサンプルとより良い対数尤度スコアを生成した。
  • アブレーションスタディにより、SRSはバッチ正規化と互換性があり、初期化への感受性が低く、より高い学習率や広い初期化スキームを許容できることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。