Skip to main content
QUICK REVIEW

[論文レビュー] Convergence Analysis of the Frank-Wolfe Algorithm and Its Generalization in Banach Spaces

Hong‐Kun Xu|arXiv (Cornell University)|Oct 19, 2017
Sparse and Compressive Sensing Techniques参考文献 14被引用数 3
ひとこと要約

本稿では、バナッハ空間におけるフランク=ウルフアルゴリズムおよびその一般化の収束解析を提示し、フレシェ微分の均一連続性のもとで収束を確立するとともに、順序 $ \sigma \in (1,2] $ の新しい曲率定数を用いて、$ \nu $-ホルダー連続勾配のもとで収束速度 $ O(1/k^{\nu}) $ を導出している。解析は線分最小化則とオープンループステップサイズ則の両方をカバーしており、より広い関数クラスおよび一般空間への既存結果の拡張を実現している。

ABSTRACT

The Frank-Wolfe algorithm, a very first optimization method and also known as the conditional gradient method, was introduced by Frank and Wolfe in 1956. Due to its simple linear subproblems, the Frank-Wolfe algorithm has recently been received much attention for solving large-scale structured optimization problems arising from many applied areas such as signal processing and machine learning. In this paper we will discuss in detail the convergence analysis of the Frank-Wolfe algorithm in Banach spaces. Two ways of the selections of the stepsizes are discussed: the line minimization search method and the open loop rule. In both cases, we prove the convergence of the Frank-Wolfe algorithm in the case where the objective function $f$ has uniformly continuous (on bounded sets) Fréchet derivative $f'$. We introduce the notion of the curvature constant of order $σ\in (1,2]$ and obtain the rate $O(\frac{1}{k^{σ-1}})$ of convergence of the Frank-Wolfe algorithm. In particular, this rate reduces to $O(\frac{1}{k^ν})$ if $f'$ is $ν$-Hölder continuous for $ν\in (0,1]$, and to $O(\frac{1}{k})$ if $f'$ is Lipschitz continuous. A generalized Frank-Wolfe algorithm is also introduced to address the problem of minimizing a composite objective function. Convergence of iterates of both Frank-Wolfe and generalized Frank-Wolfe algorithms are investigated.

研究の動機と目的

  • 射影や双対写像が困難となる一般のバナッハ空間におけるフランク=ウルフアルゴリズムの収束解析を拡張すること。
  • リプシッツ連続性よりも弱い仮定、具体的には有界集合上で均一連続であるという仮定のもとで収束を確立すること。
  • ホルダー連続勾配のもとで、フランク=ウルフおよび一般化フランク=ウルフアルゴリズムの収束速度を導出すること。
  • 収束速度を定量化するために、順序 $ \sigma \in (1,2] $ の曲率定数の概念を導入し、それを活用すること。
  • 厳密強凸性、一様強凸性、コンパクト性などのさまざまな凸性条件のもとでの反復列の収束挙動を調査すること。

提案手法

  • 順序 $ \sigma \in (1,2] $ の曲率定数を導入し、高階の滑らかさを捉えるために古典的曲率定数を一般化する。
  • 線分最小化探索とオープンループ則の2つのステップサイズ戦略を分析し、両者とも $ f' $ の均一連続性のもとで収束を保証する。
  • 関数減少量 $ \varphi(x_{k+1}) - \varphi^* \leq (1 - \gamma_k)(\varphi(x_k) - \varphi^*) + \frac{\gamma_k^\sigma}{\sigma} C_f^{(\sigma)} $ を用いたテレスコピック不等式のアプローチにより、レートの上限を導出する。
  • 再帰的数列に関する補題 2.4 を適用し、誤差の減衰を $ O(1/k^{\sigma-1}) $ で抑え、これは $ \nu $-ホルダー連続勾配の場合に $ O(1/k^\nu) $ に帰着する。
  • 凸かつ下半連続な関数 $ f, g $ を用いた合成目的関数 $ \varphi(x) = f(x) + g(x) $ に対するフランク=ウルフアルゴリズムの一般化。
  • 厳密凸性、一様凸性、または $ C $ がコンパクトで有限個のクラスターポイントを持つ場合に、弱収束および強収束の結果を確立する。

実験結果

リサーチクエスチョン

  • RQ1勾配のリプシッツ連続性よりも弱い滑らかさの仮定のもとで、フランク=ウルフアルゴリズムはバナッハ空間で収束するか?
  • RQ2フレシェ微分が $ \nu \in (0,1] $ に対して $ \nu $-ホルダー連続であるとき、フランク=ウルフアルゴリズムの収束速度はいかほどか?
  • RQ3順序 $ \sigma \in (1,2] $ の曲率定数は収束速度とどのように関係するか? また、既存の結果を一般化できるか?
  • RQ4フランク=ウルフおよび一般化フランク=ウルフアルゴリズムの反復列が、どのような条件下で強くまたは弱く収束するか?
  • RQ5オープンループステップサイズ則は、一般化された合成設定において収束と収束速度の保証を確保できるか?

主な発見

  • フレシェ微分 $ f' $ が有界集合上で均一連続である場合、フランク=ウルフアルゴリズムはバナッハ空間で収束する。これはリプシッツ連続性よりも弱い条件である。
  • $ \nu $-ホルダー連続勾配のもとで、収束速度は $ O(1/k^\nu) $ である。これはリプシッツ勾配の場合の $ O(1/k) $ を含む。
  • 順序 $ \sigma \in (1,2] $ の曲率定数を用いることで、一様な速度解析が可能となり、$ f' $ がこの滑らかさを持つ場合に $ O(1/k^{\sigma-1}) $ の収束が得られる。
  • オープンループ則のもとで、合成目的関数 $ \varphi = f + g $ に対して、一般化フランク=ウルフアルゴリズムは $ O(1/k^{\sigma-1}) $ の速度を達成する。
  • 関数 $ f $ が厳密凸であれば反復列は解に弱収束し、$ f $ が一様凸であるか、$ C $ がコンパクトで有限個のクラスターポイントを持つ場合、強収束する。
  • 収束速度 $ O(1/k^\nu) $ は、$ \nu $-ホルダー滑らかさのもとで第一順序法の既知の下界と一致するため、最適性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。