[論文レビュー] Apollo: An Adaptive Parameter-wise Diagonal Quasi-Newton Method for Nonconvex Stochastic Optimization
Apollo は、ヘッセ行列を対角行列で逐次的に近似することで、非凸な確率的最適化のためのパラメータごとの対角 quasi-Newton 法であり、絶対値を修正することで正定値性を保証する。線形時間およびメモリ計算量を達成し、視覚および言語タスクにおいて、SGD や Adam の変種を上回る収束速度と一般化性能を実現する。
In this paper, we introduce Apollo, a quasi-Newton method for nonconvex stochastic optimization, which dynamically incorporates the curvature of the loss function by approximating the Hessian via a diagonal matrix. Importantly, the update and storage of the diagonal approximation of Hessian is as efficient as adaptive first-order optimization methods with linear complexity for both time and memory. To handle nonconvexity, we replace the Hessian with its rectified absolute value, which is guaranteed to be positive-definite. Experiments on three tasks of vision and language show that Apollo achieves significant improvements over other stochastic optimization methods, including SGD and variants of Adam, in term of both convergence speed and generalization performance. The implementation of the algorithm is available at https://github.com/XuezheMax/apollo.
研究の動機と目的
- Adam などの一次の適応的手法に見られるような、劣悪な局所最適解への収束や一般化性能の低さといった限界を解消すること。
- 深層学習のような高次元で非凸的かつ確率的な設定において、古典的な quasi-Newton 法が効果を発揮しない問題を克服すること。
- 計算コストやメモリコストを高めることなく、曲率情報を効率的に組み込むスケーラブルな quasi-Newton 法を開発すること。
- ヘッセ行列の近似を絶対値を修正することで正定値にすることで、非凸な設定でも安定性と収束性を保証すること。
提案手法
- 勾配の差分に基づいて反復的に更新される対角行列を用いてヘッセ行列を近似し、パラメータごとの弱いセカント条件を満たす。
- 対角ヘッセ行列近似に絶対値を修正する操作を適用することで、正定値性を保証し、非凸性に対処する。
- 初期の収束安定性を向上させるために、線形に温められた学習率スケジュールを採用する。
- 対角成分のみを保存し、逐次的に更新することで、線形時間およびメモリ計算量を維持する。
- 勾配差分の無限大ノルムと結合された正則化しきい値を導入することで、スケール不変な変種を提示し、追加のハイパーパrameterの必要性を排除する。
- パラメータごとの勾配クリッピングを自然に拡張することで、学習におけるロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ1深層学習における非凸な確率的最適化に対して、効率的かつ効果的な対角 quasi-Newton 法を構築できるか?
- RQ2対角ヘッセ行列近似による曲率情報の組み込みが、一次の手法と比較して収束速度と一般化性能に与える影響は何か?
- RQ3非凸性に対して頑健でありながら、線形計算量を維持できるヘッセ行列近似は可能か?
- RQ4ヘッセ行列近似の修正された絶対値が、実際の学習安定性および一般化性能を向上させるか?
- RQ5追加のハイパーパrameterを導入せずに、スケール不変にできるか?
主な発見
- CIFAR-10 では SGD より 1.42 倍速く、ImageNet では 1.49 倍速く、ResNeXt-50 では 1.62 倍低いメモリコストを達成した。
- One Billion Words 語彙モデル化タスクでは、テスト損失が 31.75 ± 0.10 に達し、標準的な勾配クリッピング(31.94 ± 0.09)を上回った。
- WMT-14 神経機械翻訳タスクでは、BLEU スコアが 28.39 ± 0.11 に達し、標準的な勾配クリッピング(28.34 ± 0.10)をわずかに上回った。
- 小さな CNN モデルにおいて、Apollo は SdLBFGS よりも速く収束したが、1 回の反復が 10 倍以上速く、さらに大幅に少ないメモリを消費した。
- Apollo のスケール不変な変種は、追加のハイパーパrameterを必要としない一方で、性能を維持した。
- 二次の手法 AdaHessian は顕著に高いコストを要し、CIFAR-10 では 5.76 倍、ImageNet では 11.78 倍遅く、Apollo の効率性を浮き彫りにした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。