Skip to main content
QUICK REVIEW

[論文レビュー] An improvement of the convergence proof of the ADAM-Optimizer

Sebastian Bock, Josef Goppold|arXiv (Cornell University)|Apr 27, 2018
Stochastic Gradient Optimization Techniques参考文献 3被引用数 125
ひとこと要約

この論文はADAMオプティマの収束証明を改善し、元の Kingma–Ba の証明のギャップに対処し、条件下で 1/sqrt(T) の収束を示す系化を提示しつつ、未解の予想を指摘する。

ABSTRACT

A common way to train neural networks is the Backpropagation. This algorithm includes a gradient descent method, which needs an adaptive step size. In the area of neural networks, the ADAM-Optimizer is one of the most popular adaptive step size methods. It was invented in \cite{Kingma.2015} by Kingma and Ba. The $5865$ citations in only three years shows additionally the importance of the given paper. We discovered that the given convergence proof of the optimizer contains some mistakes, so that the proof will be wrong. In this paper we give an improvement to the convergence proof of the ADAM-Optimizer.

研究の動機と目的

  • ニューラルネットワークの学習における適応学習率の利用を動機づけ、ADAMオプティマの理論的な収束を検討する。
  • Kingma and Baによる元のADAMの収束証明の誤りを特定し、対処する。
  • 収束解析の改善を提案し、証明を完成させる可能性のある予想を明確に述べる。

提案手法

  • ADAMアルゴリズムとモーメント推定(m_tおよびv_t)とそれらの更新をレビューする。
  • (Conjecture 4.2)を導入し、二乗のバイアスモーメントと過去の勾配に関する界限について述べる。
  • 最適解からの累積偏差を定量化する誤差和R(T)を定義し、R(T)の上界を導出する(Theorem 4.4)。
  • 境界勾配と境界パラメータ更新の下で、R(T)/T = O(1/√T) を示す系補題(Corollary 4.5)を導出する。
  • 更新項と収束界への寄与を、成分ごと(各座標ごと)に構造化して分析する。

実験結果

リサーチクエスチョン

  • RQ1ADAMオプティマは、与えられた確率的更新則の下で、凸で微分可能な誤差関数に対して収束するのか。
  • RQ2ADAMの更新の下で、累積誤差R(T)の界とTに対するスケーリングはどうなるのか。
  • RQ3境界勾配と境界重み更新の下で、R(T)/Tの1/√T収束率を示す系補題を確立できるか。
  • RQ4元のADAMの収束証明を完成させるために必要な予想または欠落要素は何か。

主な発見

  • 誤差和R(T)の上界が確立され、勾配、ステップサイズ、モーメント推定を含む項を組み合わせて示される。
  • 前提の下で、R(T)は√Tおよび1/(1−λ)^2などの項でスケールする項によって境界付けられる。
  • Corollary 4.5は、R(T)/T = O(1/√T) を示し、境界勾配と境界ウェイト更新の下でADAM法のサブ線形収束を示唆する。
  • 分析はConjecture 4.2という勾配に関連する界限に依存しており、元の証明を完成させるための未解の要件として認識されている。
  • 本論文は改良された収束証明を結論づけており、予想を完全に固めることがADAMの収束特性への信頼性を高める可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。