Skip to main content
QUICK REVIEW

[論文レビュー] Second-Order Methods with Cubic Regularization Under Inexact Information

Saeed Ghadimi, Han Liu|arXiv (Cornell University)|Oct 16, 2017
Sparse and Compressive Sensing Techniques参考文献 11被引用数 20
ひとこと要約

本稿では、凸最適化のための不正確な2次最適化手法を、立方体正則化を用いて提案している。ヘッセ行列の近似を用いることで計算コストを低減する。ヘッセ行列近似誤差にやや緩い仮定を置くと、最適な1次最適化手法と同等の反復複雑度を達成するグローバル収束性を示し、数値結果から不正確なヘッセ行列が理論的境界が正確な場合より悪いにもかかわらず、実用的性能の顕著な高速化をもたらすことが示された。

ABSTRACT

In this paper, we generalize (accelerated) Newton's method with cubic regularization under inexact second-order information for (strongly) convex optimization problems. Under mild assumptions, we provide global rate of convergence of these methods and show the explicit dependence of the rate of convergence on the problem parameters. While the complexity bounds of our presented algorithms are theoretically worse than those of their exact counterparts, they are at least as good as those of the optimal first-order methods. Our numerical experiments also show that using inexact Hessians can significantly speed up the algorithms in practice.

研究の動機と目的

  • ニュートン型手法における正確なヘッセ行列計算の高コストを低減する効率的な2次最適化手法の開発。
  • 立方体正則化付き加速ニュートン法を、不正確なヘッセ行列情報が利用可能な状況に一般化すること。
  • ヘッセ行列近似誤差およびヘッセ行列の滑らかさに関するやや緩い仮定の下で、グローバル収束レートを確立すること。
  • 理論的複雑度境界が正確な手法より悪いにもかかわらず、不正確なヘッセ行列近似が実用的収束を著しく高速化できることを示すこと。
  • 不正確な2次情報が与えられた場合の(強い)凸問題における反復複雑度および収束速度の理論的保証を提供すること。

提案手法

  • 本手法は以下の形の部分問題を用いる:最小化 f(x_k) + ⟨∇f(x_k), x−x_k⟩ + ½⟨H_k(x−x_k), x−x_k⟩ + (η/6)‖x−x_k‖³、ここで H_k は不正確なヘッセ行列近似である。
  • ヘッセ行列近似が、真のヘッセ行列からの最大偏差を表す μ_u および反復点から最適解までの距離を表す R という誤差境界を満たすものと仮定する。
  • ヘッセ行列が γ-リプシッツ連続であると仮定することで、ヘッセ行列の滑らかさを保証する。
  • 収束レートは、立方体正則化と不正確なヘッセ行列情報の組み合わせにより導出され、μ_u、R、γ、ε に明示的な依存関係を持つ。
  • ネステロフ風のモーメンタムを用いることで加速が達成され、強い凸問題においてより優れた収束レートが得られる。
  • 部分問題は高精度にランチェス法を用いて解かれ、ヘッセ行列近似は計算コストを低減するためのサブサンプリングにより計算される。

実験結果

リサーチクエスチョン

  • RQ1立方体正則化ニュートン法を、不正確なヘッセ行列近似が利用可能な状況に一般化できるか?グローバル収束性は保たれるか?
  • RQ2ヘッセ行列近似誤差が有界な条件下で、不正確な立方体正則化ニュートン法の理論的収束速度はどのようになるか?
  • RQ3実用的性能において、不正確な手法は正確な手法および最適な1次最適化手法と比べてどのように差がつくか?
  • RQ4サブサンプリングされたヘッセ行列近似を用いることで、理論的複雑度境界が悪いにもかかわらず、収束が高速化するか?
  • RQ5反復回数および実行時間の観点から、ヘッセ行列近似における最適なサブサンプルサイズは何か?

主な発見

  • 凸問題における ε-解を達成するための総反復回数は、O(μ_u R² / ε + √(γ R³ / ε)) で有界であり、最適な1次最適化手法と同等の複雑度である。
  • 強い凸問題において、立方体正則化付き加速不正確ニュートン法は、標準的な1次最適化手法よりも速い収束レートを達成する。
  • バイナリ分類問題における数値実験から、|S_H| = 0.005m のサブサンプルを用いた不正確ヘッセ行列が、Mushrooms および Gisette データセットの両方で最良の実行時間性能を示した。
  • 両データセットにおいて、INCR 法は加速勾配法(AG)と比較して、反復回数およびCPU時間の両面で著しく速い収束を示した。
  • AINCR およびマルチステージ AINCR の変種は、反復回数において INCR を上回り、実行時間は同等またはわずかに改善されており、不正確なヘッセ行列情報との加速の恩恵が示された。
  • 理論的境界ではより大きなサブサンプルサイズが精度を向上させると示唆されるが、実用的性能では比較的小さなサブサンプルサイズ(0.005m)が最良であった。これは、過剰に正確なヘッセ行列近似が効率性を向上させない可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。