[論文レビュー] Is it Time to Swish? Comparing Deep Learning Activation Functions Across NLP tasks
この論文は、MLP、CNN、RNNを用いて、8つのNLPタスクにおいて21種類の活性化関数を大規模な実験的に比較する初の研究である。その結果、ペナルティ付きtanh関数が安定性と一般化性能において他の関数を上回り、特に困難な系列タグ付けタスクにおいてLSTMセル内の標準的なシグモイド/tanhゲートに置き換えることで、2パーセンテージポイントの向上を達成した。
Activation functions play a crucial role in neural networks because they are the nonlinearities which have been attributed to the success story of deep learning. One of the currently most popular activation functions is ReLU, but several competitors have recently been proposed or 'discovered', including LReLU functions and swish. While most works compare newly proposed activation functions on few tasks (usually from image classification) and against few competitors (usually ReLU), we perform the first large-scale comparison of 21 activation functions across eight different NLP tasks. We find that a largely unknown activation function performs most stably across all tasks, the so-called penalized tanh function. We also show that it can successfully replace the sigmoid and tanh gates in LSTM cells, leading to a 2 percentage point (pp) improvement over the standard choices on a challenging NLP task.
研究の動機と目的
- 多様なNLPタスクとアーキテクチャにわたる活性化関数の包括的で大規模な実験的評価が不足しているという問題に取り組む。
- 最近提案された活性化関数(例:swish)が画像分類を越えてNLPにも一般化するかを調査する。
- 複数のNLPタスクおよびハイパーパramータ設定において安定して性能を発揮する活性化関数を同定する。
- 飽和型関数(例:ペナルティ付きtanh)がLSTMゲーティング機構におけるシグモイドおよびtanhの代替として成功するかを評価する。
- 深さやドロップアウトなどのハイパーパramータが活性化関数の性能に与える影響を評価する。
提案手法
- 文書分類、文類似分類、系列タグ付けを含む8つのNLPタスクにおいて、21種類の活性化関数を評価した。
- 標準的なNLPアーキテクチャ3種類(多層パーセプトロン(MLP)、畳み込みニューラルネットワーク(CNN)、再帰ニューラルネットワーク(RNN))を用いた。
- 安定性を評価するために、トップ精度とハイパーパramータ設定における平均性能の両方を比較した。
- ハイパーパramータ(例:層数、ドロップアウト率)が活性化関数の性能に与える影響をモデル化するため、回帰分析を実施した。
- LSTMセル内の標準的なシグモイドおよびtanhゲートをペナルティ付きtanhに置き換え、困難な系列タグ付けベンチマークで評価した。
- Ramachandranら(2017)が提案した自動探索ベースの関数(swishを含む)を採用し、標準的および新規の代替関数と比較した。
実験結果
リサーチクエスチョン
- RQ1どの活性化関数が多様なNLPタスクおよびアーキテクチャにおいて最も安定した性能を示すか?
- RQ2画像分類で自動探索によって発見された活性化関数(例:swish)は、NLPタスクに対しても一般化できるか?
- RQ3飽和型関数(例:ペナルティ付きtanh)は、LSTMゲーティング機構におけるシグモイドおよびtanhの代替として成功するか?
- RQ4ネットワークの深さやドロップアウトなどのハイパーパラメータが、異なる活性化関数の相対的性能に与える影響は何か?
- RQ5NLPモデルにおいて、ハイパーパラメータ設定の観点から、最高性能と安定性の間にトレードオフが存在するか?
主な発見
- ペナルティ付きtanh関数は、全8つのNLPタスクにおいて最も安定した性能を示し、一貫性の面で他の関数を上回った。
- ペナルティ付きtanh関数を用いることで、困難な系列タグ付けタスクにおいてLSTM性能が2パーセンテージポイント向上した。
- swishはいくつかのタスクで良好な性能を示したが、ペナルティ付きtanhほど安定せず、常に上位にランクインしたわけではなかった。
- Ramachandranら(2017)が自動探索で発見した大多数の活性化関数はNLPタスクへの一般化に失敗したが、swishを除いてはそうではなかった。
- 有限の範囲を持つ飽和型関数(例:ペナルティ付きtanh)は、ハイパーパラメータ設定全体で優れた安定性を示したが、非飽和型関数は高いピーク性能を示す一方で一貫性に欠ける傾向にあった。
- 活性化関数の性能は事前に予測できず、関数ごとにハイパーパラメータへの感受性が顕著に異なった。ペナルティ付きtanhとswishは、深さやドロップアウトに対してより高い耐性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。