Skip to main content
QUICK REVIEW

[論文レビュー] On ADMM in Deep Learning: Convergence and Saturation-Avoidance

Jinshan Zeng, Shao-Bo Lin|arXiv (Cornell University)|Feb 6, 2019
Sparse and Compressive Sensing Techniques参考文献 82被引用数 10
ひとこと要約

本稿では、シグモイド活性化関数を用いた深層ニューラルネットワークのトレーニングに特化した新しいADMMベースの最適化手法(sigmoid-ADMM)を提案する。この手法は勾配飽和を回避し、O(1/k) のレートでKKT点へのグローバル収束を保証する。深層シグモイドネットワークが2層の隠れ層を持つReLUネットワークを近似可能であることを示し、単純な関数の近似において、ReLU-SGDに比べて安定性と性能に優れていることが実験的に示された。

ABSTRACT

In this paper, we develop an alternating direction method of multipliers (ADMM) for deep neural networks training with sigmoid-type activation functions (called extit{sigmoid-ADMM pair}), mainly motivated by the gradient-free nature of ADMM in avoiding the saturation of sigmoid-type activations and the advantages of deep neural networks with sigmoid-type activations (called deep sigmoid nets) over their rectified linear unit (ReLU) counterparts (called deep ReLU nets) in terms of approximation. In particular, we prove that the approximation capability of deep sigmoid nets is not worse than that of deep ReLU nets by showing that ReLU activation function can be well approximated by deep sigmoid nets with two hidden layers and finitely many free parameters but not vice-verse. We also establish the global convergence of the proposed ADMM for the nonlinearly constrained formulation of the deep sigmoid nets training from arbitrary initial points to a Karush-Kuhn-Tucker (KKT) point at a rate of order ${\cal O}(1/k)$. Besides sigmoid activation, such a convergence theorem holds for a general class of smooth activations. Compared with the widely used stochastic gradient descent (SGD) algorithm for the deep ReLU nets training (called ReLU-SGD pair), the proposed sigmoid-ADMM pair is practically stable with respect to the algorithmic hyperparameters including the learning rate, initial schemes and the pro-processing of the input data. Moreover, we find that to approximate and learn simple but important functions the proposed sigmoid-ADMM pair numerically outperforms the ReLU-SGD pair.

研究の動機と目的

  • SGDでトレーニングされる深層ReLUネットワークにおける近似と最適化の不整合、特に勾配消失/爆発とハイパーパrameterへの感受性の問題を解消すること。
  • 勾配フリーの最適化手法(ADMM)を考案し、シグモイド型活性化関数に起因する飽和を回避する。シグモイド関数は滑らかな関数の近似に優れた性質を有することが知られている。
  • 非線形制約を伴う深層シグモイドネットワークに対して、ADMMのグローバル収束を確立し、収束速度をO(1/k)とする。
  • 深層シグモイドネットワークが2層の隠れ層を持つReLUネットワークを有限のパラメータ数で近似可能であるが、逆は成り立たないことを示し、近似性能の優位性を確立すること。
  • 単純な関数近似タスクにおいて、提案手法であるsigmoid-ADMMがReLU-SGDに比してより安定で数値的に優れた性能を示すことを実験的に検証すること。

提案手法

  • 深層シグモイドネットワークのトレーニングを、非線形制約付き最適化問題として定式化し、ADMM分解のための変数ブロックにネットワークを交互に分割する。
  • 交替方向乗数法(ADMM)を用いて最適化問題を解き、重み、活性化、および双対変数(ラグランジュ乗数)を交互に更新する。
  • 非線形活性化関数を分離するために補助変数を導入し、ADMMが深層ネットワークの非凸的かつ非滑らかな構造を扱えるようにする。
  • 収束を保証するためのペナルティパラメータの更新則を採用し、Kurdyka-Łojasiewicz(KŁ)不等式と降下補題の解析を用いて理論的保証を導出する。
  • 収束解析に用いる滑らか化されたラグランジアン(記号:\hat{\cal L})を導入し、プロキシマル項と双対上昇ステップを組み込む。
  • 反復列の有界性、十分な降下、相対誤差の制御、KŁ性質の証明により収束を確立し、KKT点へのグローバル収束を導く。

実験結果

リサーチクエスチョン

  • RQ1ADMMは、理論的収束保証のもとで、深層シグモイドネットワークのトレーニングに効果的に適用可能か?
  • RQ2提案手法であるsigmoid-ADMMは、SGDトレーニングで深刻な問題を引き起こすシグモイド活性化関数の飽和問題を回避できるか?
  • RQ3有限のパラメータ数で、深層シグモイドネットワークはReLUネットワークを近似可能か?逆に、ReLUネットワークが深層シグモイドネットワークを普遍的に近似可能か?
  • RQ4単純な関数近似タスクにおいて、sigmoid-ADMMの性能はReLU-SGDに比べて安定性と数値的精度で優れているか?
  • RQ5提案ADMM手法の収束速度はどの程度か?また、一般の滑らかな活性化関数に対しても成り立つか?

主な発見

  • 提案手法であるsigmoid-ADMMは、やや弱い仮定のもとで、任意の初期点から出発しても、KKT点へのグローバル収束をO(1/k)の速度で達成する。
  • 深層シグモイドネットワークは、2層の隠れ層と有限のパラメータ数でReLU活性化関数を近似可能であるが、ReLUネットワークは深層シグモイドネットワークを普遍的に近似できない。
  • sigmoid-ADMMはReLU-SGDに比べて数値的により安定しており、学習率、初期化、入力前処理の影響に不感であることが示された。
  • 実験結果から、分かちがたい線形関数や滑らかな関数といった、単純だが重要な関数の近似において、sigmoid-ADMMがReLU-SGDを上回ることを示した。
  • 理論的解析は、シグモイドに限らず、一般の滑らかな活性化関数のクラスにも拡張可能である。
  • 理論的分析により、反復列が有界であり、目的関数が単調に減少することが確認され、収束が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。