Skip to main content
QUICK REVIEW

[論文レビュー] Regularization and Reparameterization Avoid Vanishing Gradients in Sigmoid-Type Networks

Leni Ven, Johannes Lederer|arXiv (Cornell University)|Jun 4, 2021
Machine Learning and ELM被引用数 6
ひとこと要約

この論文は、tanh活性化関数を用いるようなシグモイド型ネットワークにおける消失勾配問題を、重み正則化とパrameter再スケーリングによって効果的に防止できることを提案している。数学的に二つの異なる要因——個々のパラメータが大きいことと、複数層にわたる累積的影響——を同定し、ℓ₂正則化とスケーリングが両方の問題を解消することで、シグモイドネットワークが深層学習におけるReLUの代替として再び有効であることを示している。

ABSTRACT

Deep learning requires several design choices, such as the nodes' activation functions and the widths, types, and arrangements of the layers. One consideration when making these choices is the vanishing-gradient problem, which is the phenomenon of algorithms getting stuck at suboptimal points due to small gradients. In this paper, we revisit the vanishing-gradient problem in the context of sigmoid-type activation. We use mathematical arguments to highlight two different sources of the phenomenon, namely large individual parameters and effects across layers, and to illustrate two simple remedies, namely regularization and rescaling. We then demonstrate the effectiveness of the two remedies in practice. In view of the vanishing-gradient problem being a main reason why tanh and other sigmoid-type activation has become much less popular than relu-type activation, our results bring sigmoid-type activation back to the table.

研究の動機と目的

  • シグモイド型ネットワークにおける消失勾配問題を、特にtanhや関連する活性化関数の文脈で再検討すること。
  • 消失勾配の原因として二つの明確に異なる要因を同定すること:個々の大きなパラメータと、複数層にわたる共同的影響。
  • 二つの単純で数学的に裏付けられた解決策を提案・検証すること:大きなパラメータに対するℓ₂正則化と、深層アーキテクチャにおけるスケーリング。
  • これらの解決策が、顕著な計算コストを増加させることなく、シグモイドネットワークにおける学習の安定性と性能を回復させられることを示すこと。

提案手法

  • 消失勾配問題を解析的にモデル化するために、l 個のtanhニューロンからなる単純な順方向ネットワークを用い、各ニューロンに1つのトレーニング可能な重みを有する。
  • 二つの状態(大規模な個々のパラメータを持つ場合と、多数の層がスタックされた場合)における勾配の挙動を分析する。
  • ℓ₂正則化を大規模パラメータ状態の解決策として導入し、勾配の減衰が抑えられることを示す。
  • 重みまたは活性化を再スケーリングする再パラメータ化(スケーリング)技術を提案し、深層ネットワークにおける勾配安定化を実現する。
  • 複数のランダムシードを用いた分類タスクにおいて、実験的に手法を評価し、精度と勾配統計を比較する。
  • 両方の手法を1つの実験で組み合わせ、相乗効果を評価する。ReLUとの比較も含む。

実験結果

リサーチクエスチョン

  • RQ1シグモイド型ネットワークにおける消失勾配問題の明確な数学的要因は何か?
  • RQ2ℓ₂正則化は、シグモイドネットワークにおける大きな個々のパラメータによって引き起こされる消失勾配を効果的に緩和できるか?
  • RQ3再パラメータ化(スケーリング)は、多数の層を持つ深層シグモイドネットワークにおける勾配消失を防げるか?
  • RQ4正則化とスケーリングを併用することで、実際のシナリオにおいてReLUネットワークと同等またはそれ以上の性能を達成できるか?
  • RQ5これらの単純で理論的に裏付けられた技術により、現代の深層学習におけるシグモイド型活性化関数の実用的妥当性が回復できるか?

主な発見

  • シグモイドネットワークにおける個々の大きなパラメータは、消失勾配を引き起こすが、ℓ₂正則化によって効果的に緩和できる。
  • 多数の層を持つ深層ネットワークでは、勾配消失が累積的影響に起因し、重みまたは活性化の再スケーリングによって解消できる。
  • ℓ₂正則化とスケーリングの併用は、大規模パラメータ状態および深層ネットワーク状態の両方において、標準的な学習に比べて収束が速く、テスト精度も高い。
  • 実行時間の測定結果から、これらの解決策は顕著な計算コストを増加させないことが示された。
  • 実験結果から、正則化とスケーリングを施したtanhネットワークは、標準的な学習を上回り、一部の設定ではReLUをも凌駆する性能を示した。
  • 本研究は、これらの単純で数学的に正当化された技術を組み合わせることで、シグモイド型活性化関数が深層学習において依然として強力な選択肢であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。