Skip to main content
QUICK REVIEW

[論文レビュー] A single potential governing convergence of conjugate gradient, accelerated gradient and geometric descent

Sahar Karimi, Stephen A. Vavasis|arXiv (Cornell University)|Dec 27, 2017
Sparse and Compressive Sensing Techniques参考文献 15被引用数 9
ひとこと要約

本稿では、共役勾配法(CG)、加速勾配法(AG)、幾何的降下法(GD)の統一的収束解析を導入し、各反復で少なくとも $1 - \sqrt{\ell/L}$ の割合で減少する、計算可能で一様なポテンシャル関数を同定することで、それらの3つの手法の収束を統一的に説明する。このポテンシャル関数は、3つのアルゴリズムの収束を支配し、二次関数の設定ではCGの効率性を保ちつつ、一般の滑らかで強い凸関数に対しても最適な $O(\sqrt{L/\ell}\log(1/\epsilon))$ の反復複雑性を達成するハイブリッド手法(HyNCG)を可能にする。

ABSTRACT

Nesterov's accelerated gradient (AG) method for minimizing a smooth strongly convex function $f$ is known to reduce $f({\bf x}_k)-f({\bf x}^*)$ by a factor of $ε\in(0,1)$ after $k=O(\sqrt{L/\ell}\log(1/ε))$ iterations, where $\ell,L$ are the two parameters of smooth strong convexity. Furthermore, it is known that this is the best possible complexity in the function-gradient oracle model of computation. Modulo a line search, the geometric descent (GD) method of Bubeck, Lee and Singh has the same bound for this class of functions. The method of linear conjugate gradients (CG) also satisfies the same complexity bound in the special case of strongly convex quadratic functions, but in this special case it can be faster than the AG and GD methods. Despite similarities in the algorithms and their asymptotic convergence rates, the conventional analysis of the running time of CG is mostly disjoint from that of AG and GD. The analyses of the AG and GD methods are also rather distinct. Our main result is analyses of the three methods that share several common threads: all three analyses show a relationship to a certain "idealized algorithm", all three establish the convergence rate through the use of the Bubeck-Lee-Singh geometric lemma, and all three have the same potential that is computable at run-time and exhibits decrease by a factor of $1-\sqrt{\ell/L}$ or better per iteration. One application of these analyses is that they open the possibility of hybrid or intermediate algorithms. One such algorithm is proposed herein and is shown to perform well in computational tests.

研究の動機と目的

  • 共役勾配法(CG)、加速勾配法(AG)、幾何的降下法(GD)という3つの代表的1次元最適化手法の収束解析を統一すること。
  • 3つのアルゴリズムすべてに共通する、実行時で計算可能なポテンシャル関数を同定すること。
  • 3つの手法が、同じ幾何的補題とポテンシャル関数を用いて、同じ最適な反復複雑性 $O(\sqrt{L/\ell}\log(1/\epsilon))$ を達成することを示すこと。
  • CGとAG/GDの長所を組み合わせたハイブリッドアルゴリズムを設計し、$\ell$ と $L$ の事前知識がなくても最適な複雑性を達成できることを可能にすること。
  • 新しいハイブリッド手法(HyNCG)が、ステップ選択をポテンシャルの減少に基づいて行い、他の手法を上回ることを理論的および実験的に裏付けること。

提案手法

  • 最適解からの距離と関数ギャップを抑え、$\tilde{\sigma}_k^2 \geq \|\bm{y}_k - \bm{x}^*\|^2 + \frac{2(f(\bm{x}_k) - f(\bm{x}^*))}{\ell}$ を満たす共通のポテンシャル関数 $\tilde{\sigma}_k^2$ を提案する。
  • Bubeck-Lee-Singhの幾何的補題を用いて、$\tilde{\sigma}_{k+1}^2 \leq \left(1 - \sqrt{\ell/L}\right)\tilde{\sigma}_k^2$ を確立し、最適なレートでグローバル収束を保証する。
  • 実装不可能な理想化されたアルゴリズムを定義し、CG、AG、GDの収束を同じポテンシャル関数を用いて分析する基準として用いる。
  • 各反復でCGステップとGDステップの両方を計算し、ポテンシャル $\tilde{\sigma}_k$ を最も大きく減少させる方を選択するハイブリッドアルゴリズム(HyNCG)を設計する。ラインサーチのコストを回避する。
  • 合成問題に対してHyNCGを実装・テストし、AG、GD、NCGと比較する。勾配ノルムや関数値ではなく、ポテンシャルの減少に基づいてステップを選択する。
  • GDとHyNCGでは正確なラインサーチを用い、AGでは外側の反復を用いる。内側のラインサーチステップを含めた総反復回数を報告する。

実験結果

リサーチクエスチョン

  • RQ1滑らかで強い凸関数に対して、CG、AG、GDの収束を説明する、1つの実行時で計算可能なポテンシャル関数を同定できるか?
  • RQ2CG、AG、GDが、共通の幾何的補題とポテンシャル関数を用いて、同じ最適な反復複雑性 $O(\sqrt{L/\ell}\log(1/\epsilon))$ を達成するか?
  • RQ3二次関数の設定ではCGの効率性を保ちつつ、一般のケースでAGとGDの最適な複雑性を維持するハイブリッドアルゴリズムを構築できるか?
  • RQ4実際の実験では、ステップ選択をポテンシャルの減少に基づけると、勾配ノルムや関数値に基づく選択よりも優れているか?
  • RQ5HLテストスイートにおいて、GDとAGの反復回数は $\lambda$ にほとんど依存しないが、AGのコストは $\lambda$ が小さくなると著しく増加する。その理由は何か?

主な発見

  • 1つのポテンシャル関数 $\tilde{\sigma}_k^2$ が、CG、AG、GDの収束を支配し、各反復で $\tilde{\sigma}_{k+1}^2 \leq \left(1 - \sqrt{\ell/L}\right)\tilde{\sigma}_k^2$ を満たす。
  • ポテンシャルの減少に基づいてステップを選択するハイブリッド手法HyNCGは、すべてのテストケースでAGおよびGDを上回り、多くの場合で2倍以上も優れている。
  • ABPDN問題($n=262144$)では、HyNCGは123反復で完了したが、AGは34,758反復、NCGは488反復を要した。これは、極めて優れた効率性を示している。
  • HLテストスイートでは、$\lambda$ にかかわらずHyNCGは37〜44反復で安定しており、AGのコストは $\lambda$ が小さくなると著しく増加する。これは、安定性の高さを示している。
  • 勾配ノルム(HyNCG/gr)や関数値(HyNCG/f)に基づくハイブリッド手法に比べ、ポテンシャルに基づく選択(HyNCG)は、一部のケースで最大250,000反復も必要になる場合がある。
  • ポテンシャルに基づく選択では、代替ステップの評価を回避できるため、HyNCG/gr や HyNCG/f よりも効率的であり、各反復で2回の評価を必要とする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。