[論文レビュー] Large Scale Empirical Risk Minimization via Truncated Adaptive Newton Method
本稿では、適応的サンプルサイズと切り捨てられたヘッセ行列の逆行列を用いる大規模な経験的リスク最小化(ERM)のための2次最適化アルゴリズム、k-切り捨て適応ニュートン(k-TAN)法を提案する。訓練データのサイズを幾何級数的に増加させ、各部分問題を1回の切り捨てニュートンステップで解くことで、データに対して約2回のフルパスで統計的精度に到達し、劣悪な条件数を持つ問題においても、勾配上昇の速さを示す、確率的1次最適化手法を凌駕する。
We consider large scale empirical risk minimization (ERM) problems, where both the problem dimension and variable size is large. In these cases, most second order methods are infeasible due to the high cost in both computing the Hessian over all samples and computing its inverse in high dimensions. In this paper, we propose a novel adaptive sample size second-order method, which reduces the cost of computing the Hessian by solving a sequence of ERM problems corresponding to a subset of samples and lowers the cost of computing the Hessian inverse using a truncated eigenvalue decomposition. We show that while we geometrically increase the size of the training set at each stage, a single iteration of the truncated Newton method is sufficient to solve the new ERM within its statistical accuracy. Moreover, for a large number of samples we are allowed to double the size of the training set at each stage, and the proposed method subsequently reaches the statistical accuracy of the full training set approximately after two effective passes. In addition to this theoretical result, we show empirically on a number of well known data sets that the proposed truncated adaptive sample size algorithm outperforms stochastic alternatives for solving ERM problems.
研究の動機と目的
- 高次元データと大規模データセットを伴う大規模な経験的リスク最小化(ERM)における2次最適化手法の高い計算コストを低減すること。
- 高次元および大規模なサンプル集合において、完全なヘッセ行列の計算と逆行列化の費用が非常に高価であるという問題を克服すること。
- 統計的精度の境界を活用して、計算複雑性を低減しつつ解の品質を損なわない近似を正当化すること。
- 訓練データサイズを幾何級数的に増加させつつ、収束が統計的精度に達する適応的サンプルサイズ戦略を開発すること。
- 各部分問題を低ランクのヘッセ行列近似を用いて効率的に解くことができる切り捨てニュートン法を設計することにより、各部分問題ごとの収束を高速化すること。
提案手法
- 適応的サンプルサイズ選択と切り捨てられたヘッセ行列の逆行列を組み合わせたk-Truncated Adaptive Newton(k-TAN)法を提案する。
- データの増加する部分集合上で定義されたERM問題の系列を用い、各段階でサンプルサイズを2倍にして幾何的増加を達成する。
- ヘッセ行列の上位k個の固有値のみを用いた切り捨て固有値分解を用いて、低コストでヘッセ行列の逆行列を近似する。
- 各部分問題に対して1回の切り捨てニュートンステップを適用し、現在の部分問題の統計的精度内に収束することを保証する。
- ニュートン減少量と曲率情報を利用して、各部分問題の2次収束領域内に反復点が留まるようにする。
- 部分最適性と切り捨て誤差の境界を導出し、各部分問題の解が完全なERM解の統計的精度内に留まることを保証する。
実験結果
リサーチクエスチョン
- RQ1ヘッセ行列の計算と逆行列化のコストを低減することで、2次最適化手法を大規模なERM問題にスケーラブルにできるか?
- RQ2各部分問題を1回の切り捨てニュートンステップで解きつつ、訓練データサイズを幾何的に増加させることで、統計的精度に収束するか?
- RQ3低ランク近似を用いたヘッセ行列の逆行列の切り捨てが、計算コストを削減しつつ収束速度を維持できるか?
- RQ4k-TAN反復点の部分最適性が、現在のデータサブセットの統計的精度によって有界であるか、全体の解の品質が保証されるか?
- RQ5本手法が、データセットを約2回の有効なパスで、完全データの統計的精度に収束できるか?
主な発見
- k-TAN法は、切り捨てられたヘッセ行列近似を用いていながらも、データに対して約2回の有効なパスで、完全なトレーニングセットの統計的精度に到達する。
- 適応的サンプリングによって2次収束領域に入ることで、各部分問題に対して1回の切り捨てニュートンステップで十分であり、各ERMインスタンスをその統計的精度内に解くことができる。
- k-TAN反復点の部分最適性は、統計的精度 $V_m = ilde{O}(1/m)$ と切り捨て誤差 $ ho c V_n$ の関数によって有界であり、望ましい許容誤差内に収束することが保証される。
- 各部分問題に対して、実質的に2次収束率を達成する。切り捨て誤差 $ ho$ は、追加誤差が統計的精度と比べて無視できるほどに制御されており、その影響は小さい。
- 実験的結果では、k-TAN法は、特に1次最適化手法が収束が遅い劣悪な条件数を持つ問題において、有名なデータセットで確率的1次最適化手法を上回ることを示している。
- 理論的分析により、ヘッセ行列の $k+1$ 番目の固有値が $ u_{k+1} riangleq ho c V_n$ を満たす場合、部分最適性 $S_n( extbf{x}_n)$ が $V_n$ によって有界であることが示され、解が完全なERM問題の統計的精度内にあることが保証される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。