[論文レビュー] Stochastic Second-order Methods for Non-convex Optimization with Inexact Hessian and Gradient
本稿では、固定サンプルの確率的近似を用いて、不正確な勾配およびヘッセ行列推定値を伴う非凸最適化のための確率的信頼領域(STR)法と確率的立方 regularization(SARC)法を提案する。両手法が、不正確なヘッセ行列および勾配のもとでも、弱い不正確さの条件下で、正確な手法と同等の反復複雑度を達成し、$\epsilon$-近似の2次的最適性に到達することを確立している。また、深層学習タスクにおける性能が検証されている。
Trust region and cubic regularization methods have demonstrated good performance in small scale non-convex optimization, showing the ability to escape from saddle points. Each iteration of these methods involves computation of gradient, Hessian and function value in order to obtain the search direction and adjust the radius or cubic regularization parameter. However, exactly computing those quantities are too expensive in large-scale problems such as training deep networks. In this paper, we study a family of stochastic trust region and cubic regularization methods when gradient, Hessian and function values are computed inexactly, and show the iteration complexity to achieve $ε$-approximate second-order optimality is in the same order with previous work for which gradient and function values are computed exactly. The mild conditions on inexactness can be achieved in finite-sum minimization using random sampling. We show the algorithm performs well on training convolutional neural networks compared with previous second-order methods.
研究の動機と目的
- 大規模な非凸最適化における不正確な勾配およびヘッセ行列推定値を扱える実用的な確率的2次最適化手法の開発。
- 不正確なヘッセ行列および勾配近似のもとでのSTRおよびSARCの収束性および反復複雑度の理論的分析。
- 勾配、ヘッセ行列、関数値の計算における不正確さが存在しても、反復複雑度が正確な手法と同等のオーダーに保たれることの証明。
- 部分サンプル化された関数値を用いて、信頼領域半径および正則化パラメータの適応的調整を可能にする。
- 深層畳み込みニューラルネットワークの学習において、提案手法の実験的妥当性を検証し、実行時間の改善を示す。
提案手法
- 固定サイズのサンプリングを用いて不正確な勾配およびヘッセ行列近似を行う確率的信頼領域(STR)法と確率的立方 regularization(SARC)法を採用。
- 不正確な $ g(x_k) $ および $ B(x_k) $ を用いた二次モデル $ m_k(s) = f(x_k) + \langle g(x_k), s \rangle + \frac{1}{2} \langle s, B(x_k)s \rangle $ を適用。誤差は有界かつ固定である。
- オペレータ・ベルンシュタイン不等式を用いて部分サンプル化された関数値をバウンドし、信頼領域半径および立方正則化パラメータの自動的調整を可能にする。
- 勾配、ヘッセ行列、関数値が不正確であっても、部分サンプル化された目的関数値に基づく適応的半径および正則化パラメータの更新を導入。
- 滑らかさおよびヘッセ行列の変動の有界性に関する仮定を活用し、不正確さのもとでの成功確率および収束速度を統一的にバウンドする分析フレームワークを採用。
- 不正確な勾配ノルムおよび不正確なヘッセ行列の最小固有値に基づく終了基準を用い、2次的最適性を保証する。
実験結果
リサーチクエスチョン
- RQ1勾配およびヘッセ行列の両方が不正確な場合、確率的2次最適化手法が正確な手法と同等の反復複雑度を維持できるか?
- RQ2STRおよびSARC手法において、$\epsilon$-近似の2次的最適性に収束するための不正確さに関する条件は何か?
- RQ3勾配およびヘッセ行列が不正確な場合でも、部分サンプル化された関数値のみを用いて信頼領域半径および立方正則化パラメータを適応的に調整できるか?
- RQ4深層学習タスクにおける収束速度および学習時間の観点から、提案手法のSTRおよびSARCは、既存の確率的2次最適化手法と比べてどのように異なるか?
- RQ5固定サンプルの勾配およびヘッセ行列近似を用いた場合に、確率的2次最適化手法の理論的収束保証を達成することは可能か?
主な発見
- STRおよびSARCの反復複雑度は、弱い不正確さの条件下で $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$ であり、正確な手法と同等の複雑度を達成する。
- SARCの場合、終了基準を満たした際の反復複雑度は $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-3/2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$ に改善され、STRよりも優れている。
- 固定で有界な不正確さを伴う部分サンプル化された確率的近似を用いても、勾配、ヘッセ行列、関数値が不正確であっても、$\epsilon$-近似の2次的最適性への収束が達成される。
- オペレータ・ベルンシュタイン不等式の使用により、関数値の信頼性のある部分サンプリングが可能となり、信頼領域半径および正則化パラメータの自動的かつ適応的な調整が可能になる。
- VGGネットワークを用いたCIFAR-10における実験では、提案手法のSTRおよびSARCが、既存の信頼領域および立方正則化手法よりも実行時間の観点で高速であることが示された。
- 理論的分析は、先行研究([7]では勾配の不正確さを許容しない、[8]ではより強い不正確さの条件を要する)を拡張しており、不正確な勾配を許容しつつも、最適な複雑度を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。