Skip to main content
QUICK REVIEW

[論文レビュー] Online Regularized Nonlinear Acceleration

Damien Scieur, Edouard Oyallon|arXiv (Cornell University)|May 24, 2018
Stochastic Gradient Optimization Techniques参考文献 12被引用数 6
ひとこと要約

本稿では、勾配降下法やネステロフの高速勾配法などの一次順序最適化アルゴリズムを、リアルタイムでアンダーソン型外挿に正則化を適用することによって加速する、新しい手法であるオンライン正則化非線形加速(Online RNA)を提案する。凸問題において漸近的に最適な収束レートを達成し、ラインサーチや問題固有のパラメータを必要とせずに、標準的手法よりも顕著に性能を向上させる。

ABSTRACT

Regularized nonlinear acceleration (RNA) estimates the minimum of a function by post-processing iterates from an algorithm such as the gradient method. It can be seen as a regularized version of Anderson acceleration, a classical acceleration scheme from numerical analysis. The new scheme provably improves the rate of convergence of fixed step gradient descent, and its empirical performance is comparable to that of quasi-Newton methods. However, RNA cannot accelerate faster multistep algorithms like Nesterov's method and often diverges in this context. Here, we adapt RNA to overcome these issues, so that our scheme can be used on fast algorithms such as gradient methods with momentum. We show optimal complexity bounds for quadratics and asymptotically optimal rates on general convex minimization problems. Moreover, this new scheme works online, i.e., extrapolated solution estimates can be reinjected at each iteration, significantly improving numerical performance over classical accelerated methods.

研究の動機と目的

  • Nesterov法などの高速な多ステップアルゴリズムに適応可能な汎用的な加速フレームワークを開発すること。既存のRNA手法では、これらのアルゴリズムを加速できなかったという制限を克服すること。
  • オンライン加速を可能にすること。各反復後に外挿を再計算することで、バッチリスタート方式よりも数値的安定性と性能が向上すること。
  • 二次関数および一般の凸関数において、収束性と最適な複雑度バウンズを保証すること。確率的設定も含む。
  • 大規模問題、特にディープラーニングを含む、BFGS や Katyusha などの最先端手法と同等またはそれを上回るスケーラビリティと性能を示すこと。

提案手法

  • Nesterovの高速勾配法などの多ステップ法に適応するため、アンダーソン型外挿のステップを、Nesterov法のモーメンタム項を組み込む形に変更する。
  • 外挿の安定性を高めるために、係数計算に正則化項を導入し、劣悪な条件数やノイズの多い設定でも発散を防ぐ。
  • 再帰的定式化を用いて、各反復後に改善された推定値を再注入できるオンラインで外挿反復を計算する。
  • 数値的安定性を保証するため、チホノフ正則化を用いた最小二乗問題として外挿係数を解く。
  • 決定論的および確率的最適化、特に有限和問題とディープニューラルネットワークに本手法を適用する。
  • 問題の条件数やデータサイズに応じて動的に正則化パラメータをスケーリングすることで、安定性を維持する。

実験結果

リサーチクエスチョン

  • RQ1Nesterovの高速勾配法のように、標準的な勾配降下法よりも高速な多ステップアルゴリズムを、RNAで一般化して加速できるか?
  • RQ2各反復後に外挿を再計算するオンライン適用は、バッチリスタート方式と比較して収束速度と安定性を向上させるか?
  • RQ3条件数の知識が不要な状態で、滑らかで(強く)凸関数に対して漸近的に最適な収束レートを達成できるか?
  • RQ4凸問題および非凸問題において、BFGS や Katyusha といった既存手法と比較して、性能とスケーラビリティに優れているか?
  • RQ5RNAの計算コストは何か?問題サイズやモデルの複雑さに伴いどのようにスケーリングされるか?

主な発見

  • オンラインRNAは、滑らかで(強く)凸関数に対して漸近的に最適な収束レートを達成し、Nesterov法の下界と一致する。
  • 特に条件数が 10^6 に達するような劣悪な条件の問題において、標準的な勾配降下法やNesterovの高速勾配法と比較して収束速度が顕著に向上する。
  • 正則化は不可欠である:正則化なしのアンダーソン加速は、ノイズが多いか劣悪な条件の設定で発散するが、適切なλのチューニングによりオンラインRNAは安定性を保つ。
  • MNISTデータセットでは、オンラインRNAはSGD や SAGA を上回り、ラインサーチを必要としない加速有限和手法Katyushaと同等の性能を示す。
  • ImageNetにおけるResNet-50の学習では、オフラインRNAはモデル精度を維持するが、オンラインRNAは性能を低下させる。これは、非凸なディープラーニング設定ではオンライン加速が効果的でないことを示唆している。
  • 深層ネットワークにおける1回のフォワード・バックワードパスと比較して、RNAの計算コストは無視できるほど小さいため、CPUベースの加速にとって実用的であり、Nが増加するにつれてスケーリングが良好である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。