Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Newton and Cubic Newton Methods with Simple Local Linear-Quadratic Rates

Dmitry Kovalev, Konstantin Mishchenko|arXiv (Cornell University)|Dec 3, 2019
Stochastic Gradient Optimization Techniques参考文献 44被引用数 16
ひとこと要約

本稿では、1回の反復あたり1つの勾配とヘッセ行列を計算するだけで、不偏推定や大規模バッチサイズを必要とせず、局所的線形・2次収束を達成する2つの新しい確率的2次最適化手法—Stochastic Newton (SN) と Stochastic Cubic Newton (SCN)—を提案する。従来の手法とは異なり、バイアスのある更新でも、2次最適化に特化した新しいリャプノフ関数を導入することで、1次最適化手法よりも高速に収束し、問題の曲率に適応する。

ABSTRACT

We present two new remarkably simple stochastic second-order methods for minimizing the average of a very large number of sufficiently smooth and strongly convex functions. The first is a stochastic variant of Newton's method (SN), and the second is a stochastic variant of cubically regularized Newton's method (SCN). We establish local linear-quadratic convergence results. Unlike existing stochastic variants of second order methods, which require the evaluation of a large number of gradients and/or Hessians in each iteration to guarantee convergence, our methods do not have this shortcoming. For instance, the simplest variants of our methods in each iteration need to compute the gradient and Hessian of a {\em single} randomly selected function only. In contrast to most existing stochastic Newton and quasi-Newton methods, our approach guarantees local convergence faster than with first-order oracle and adapts to the problem's curvature. Interestingly, our method is not unbiased, so our theory provides new intuition for designing new stochastic methods.

研究の動機と目的

  • 大規模バッチサイズや不偏勾配・ヘッセ行列推定を必要とせず、高速な局所的収束を達成する確率的2次最適化手法の開発。
  • 既存の確率的ニュートン手法が高分散またはバイアスのある近似に依存することで収束が悪くなるという限界を解決すること。
  • 問題の曲率に適応し、局所的領域で1次最適化手法を上回る収束速度を達成する手法の設計。
  • 意図的にバイアスのある更新を許容する手法について、収束保証を確立すること。これは、2次最適化における不偏な確率的推定の必要性を覆す挑戦である。

提案手法

  • 反復ごとに1つの関数の勾配とヘッセ行列をランダムに選択して反復点を更新する確率的ニュートン法(SN)を提案。
  • 局所的収束性と安定性を保証するため、立方体正則化を組み込んだ確率的3次ニュートン法(SCN)を導入。
  • バイアスのある更新でも収束を示すために、2次最適化に特化した新しいリャプノフ関数の構築法を採用。
  • 立方体正則化項に対してプロキシマル部分問題ソルバーを用い、閉形式のプロキシマル演算子により計算を効率化。
  • 更新ルールを単純かつスケーラブルに設計し、関数総数 n に依存しない1回の関数の勾配とヘッセ行列評価で済ませる。
  • 立方体正則化パラメータ M を動的に調整し、決定的手法と比較してより小さい M 値でも収束することを示した。

実験結果

リサーチクエスチョン

  • RQ11回の反復あたり1つの勾配とヘッセ行列評価のみで、局所的線形・2次収束を達成できる確率的2次最適化手法は存在するか?
  • RQ2バイアスのある確率的更新でも2次最適化手法が収束する理由は何か? その理論的裏付けはどのように与えられるか?
  • RQ3分散低減や大規模バッチサイズに依存せず、局所的領域で確率的ニュートン手法の収束速度が1次最適化手法を上回ることは可能か?
  • RQ4確率的3次ニュートン法の性能は、決定的3次ニュートン法と比較して、必要な正則化パラメータや収束速度の点でどのように異なるか?
  • RQ5バイアスのある確率的2次最適化手法を解析するために必要な新しいリャプノフ関数は何か? それらは1次最適化設定で用いられる関数とどのように異なるか?

主な発見

  • 提案された確率的ニュートン法(SN)および確率的3次ニュートン法(SCN)は、局所的線形・2次収束を達成し、局所的領域で1次最適化手法を上回る性能を示した。
  • 大多数の確率的2次最適化手法とは異なり、SN および SCN は1反復あたり1つの勾配とヘッセ行列評価のみを必要とし、大規模バッチサイズを回避した。
  • 手法は意図的にバイアスを持つが、2次最適化に特化した新しいリャプノフ関数のおかげで収束を達成した。
  • SCN は決定的3次ニュートン法よりも顕著に小さな立方体正則化パラメータ M で収束し、より高いロバストネスと効率性を示した。
  • ロジスティック回帰における実験結果から、最適解から離れた初期化でも SCN が決定的3次ニュートン法を上回ることを示した。特に、条件数が悪い問題で顕著な優位性を示した。
  • バッチサイズが1であっても効果を発揮するなど、他の確率的2次最適化手法が高分散やバイアスのため失敗する状況でも実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。