Skip to main content
QUICK REVIEW

[論文レビュー] Globally Convergent Newton Methods for Ill-conditioned Generalized Self-concordant Losses

Ulysse Marteau-Ferey, Francis Bach|arXiv (Cornell University)|Jul 3, 2019
Sparse and Compressive Sensing Techniques被引用数 10
ひとこと要約

本稿では、正則化パラメータμ ≥ λを徐々に小さくする問題の系列を解くことで、悪条件な一般化自己調和損失(例:ロジスティック回帰やソフトマックス回帰)に対して、グローバルに収束するニュートン法を提案する。線形収束を達成し、条件数に対して対数的依存性を示し、非パrametricなロジスティック回帰に対して、最適な複雑度かつ条件数に依存しない理論的保証を備えた大規模なアルゴリズムを初めて提供する。

ABSTRACT

In this paper, we study large-scale convex optimization algorithms based on the Newton method applied to regularized generalized self-concordant losses, which include logistic regression and softmax regression. We first prove that our new simple scheme based on a sequence of problems with decreasing regularization parameters is provably globally convergent, that this convergence is linear with a constant factor which scales only logarithmically with the condition number. In the parametric setting, we obtain an algorithm with the same scaling than regular first-order methods but with an improved behavior, in particular in ill-conditioned problems. Second, in the non parametric machine learning setting, we provide an explicit algorithm combining the previous scheme with Nystr{\\"o}m projection techniques, and prove that it achieves optimal generalization bounds with a time complexity of order O(ndf $\\lambda$), a memory complexity of order O(df 2 $\\lambda$) and no dependence on the condition number, generalizing the results known for least-squares regression. Here n is the number of observations and df $\\lambda$ is the associated degrees of freedom. In particular, this is the first large-scale algorithm to solve logistic and softmax regressions in the non-parametric setting with large condition numbers and theoretical guarantees.

研究の動機と目的

  • 条件数に比例して性能が著しく低下する第一階層の最適化手法が、機械学習における悪条件問題に対してスケーリングしにくいため、その課題に取り組む。
  • グローバル収束性に欠け、大規模な設定で計算コストが高いため、従来のニュートン法の限界を克服する。
  • ロジスティック回帰やソフトマックス回帰を含む一般化自己調和損失に適用可能な、グローバルに収束する二階最適化手法を開発する。
  • 非パrametricなカーネル学習において、時間計算量O(n·dfλ)およびメモリ計算量O(dfλ²)の最適一般化境界を達成し、条件数に依存しない。
  • 非パrametricな設定における大規模で悪条件なロジスティック回帰およびソフトマックス回帰について、理論的保証を提供する——これは従来、未解決の問題であった。

提案手法

  • 正則化パramータμ ≥ λを徐々に小さくする問題の系列を解くパスフォロービングスキームを提案する。
  • 各fμに対して近似ニュートンステップを用い、局所的な自己調和性の性質によりグローバル収束を保証する。
  • 一般化自己調和性フレームワークを活用し、局所的条件数κℓ = R²/λをバウンドすることで、悪条件性にたいして対数的依存性を実現する。
  • パスフォロービングニュートン法とニストローム射影技術を組み合わせ、無限次元ヒルバート空間における次元削減を実現する。
  • 一様またはレバレッジスコアに基づくサンプリングを用いてヘシアンの低ランク近似を構築し、安定的かつ高精度なニュートンステップを保証する。
  • 射影空間における近似ニュートンステップが、高確率で元の問題に対するρ-近似解を与えることを証明する。

実験結果

リサーチクエスチョン

  • RQ1高精度なヘシアン逆行列を必要とせず、悪条件な一般化自己調和損失に対してグローバルに収束するニュートン法を設計することは可能か?
  • RQ2提案手法は、特に悪条件な設定において、グローバルな条件数に依存しない収束速度を達成するか?
  • RQ3非パrametricなカーネル学習において、時間計算量とメモリ計算量の最適性を維持しながら、ロジスティック回帰およびソフトマックス回帰を解くことは可能か?
  • RQ4パスフォロービングニュートン法とニストローム射影を組み合わせることで、条件数に依存しない最適一般化境界を達成することは可能か?
  • RQ5一様サンプリングかレバレッジスコアのどちらのサンプリング戦略が、大規模な問題における安定的かつ高精度な低ランクヘシアン近似を保証するか?

主な発見

  • アルゴリズムは線形収束を達成し、収束係数が局所的条件数κℓに対して対数的依存性を示す。
  • パラメトリックな設定では、複雑度において最良の第一階層手法と同等であるが、悪条件な問題ではそれらを上回る性能を示す。
  • 非パラメトリックな設定では、時間計算量O(n·dfλ)およびメモリ計算量O(dfλ²)を達成し、条件数に依存しない。
  • 本手法は、高悪条件性下でも理論的保証を備えた大規模な非パラメトリック設定におけるロジスティック回帰およびソフトマックス回帰を解く最初のアルゴリズムである。
  • 高確率で、レバレッジスコアまたは一様サンプリングによるニストロームサンプリングが、ニュートンステップに対するρ-近似解を生成し、安定的収束を保証する。
  • 理論的解析により、スペクトルノルムを介したヘシアン近似誤差のバウンドが得られ、低ランク射影誤差に対してもロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。