Skip to main content
QUICK REVIEW

[論文レビュー] Relatively-Smooth Convex Optimization by First-Order Methods, and Applications

Haihao Lu, Robert M. Freund|arXiv (Cornell University)|Oct 18, 2016
Sparse and Compressive Sensing Techniques参考文献 17被引用数 4
ひとこと要約

本稿は、ユーザーが定義する基準関数 $ h(\cdot) $ に対する相対的滑らかさ(relative smoothness)に一般化することで、一階凸最適化のための新規フレームワークを提示する。これは、従来の均一なリプシッツ連続性が成立しない問題に対しても効率的なアルゴリズムを可能にする。主な貢献は、非一様滑らか関数に対し $ O(1/k) $ の部分線形収束を達成する、新たな収束解析とアルゴリズムフレームワークの確立であり、$ D $-最適設計やその他の滑らかでない問題に応用されている。

ABSTRACT

The usual approach to developing and analyzing first-order methods for smooth convex optimization assumes that the gradient of the objective function is uniformly smooth with some Lipschitz constant $L$. However, in many settings the differentiable convex function $f(\cdot)$ is not uniformly smooth -- for example in $D$-optimal design where $f(x):=-\ln \det(HXH^T)$, or even the univariate setting with $f(x) := -\ln(x) + x^2$. Herein we develop a notion of "relative smoothness" and relative strong convexity that is determined relative to a user-specified "reference function" $h(\cdot)$ (that should be computationally tractable for algorithms), and we show that many differentiable convex functions are relatively smooth with respect to a correspondingly fairly-simple reference function $h(\cdot)$. We extend two standard algorithms -- the primal gradient scheme and the dual averaging scheme -- to our new setting, with associated computational guarantees. We apply our new approach to develop a new first-order method for the $D$-optimal design problem, with associated computational complexity analysis. Some of our results have a certain overlap with the recent work \cite{bbt}.

研究の動機と目的

  • 標準的一階法が勾配の均一リプシッツ連続性を要件としているという制限を解消し、多くの実用的凸最適化問題で成立しない場合があることに対処する。
  • 計算的に取り扱いやすい基準関数 $ h(\cdot) $ に対して相対的滑らかさと呼ばれる一般化された滑らかさ条件を構築し、非一様滑らか関数の解析を可能にする。
  • プライマル勾配法とデュアルエーディングスキームを相対的滑らかさ設定に拡張し、新たな収束保証を提供する。
  • $ D $-最適設計やその他の滑らかでない問題に応用し、勾配のリプシッツ定数が無限大になるため従来法が失敗する問題に適用可能である。
  • 基準関数 $ h(\cdot) $ を選択することで、計算の取り扱いやすさと収束速度の両立を図る。具体的には、ギャップ関数 $ Lh - f $ のヘッセ行列を最小化するように選ぶ。

提案手法

  • 相対的滑らかさの定義:微分可能な凸関数 $ f $ が、$ 1 $-強凸基準関数 $ h $ に対して $ L $-滑らかであるとは、$ \nabla f(x) - \nabla f(y) \leq L \cdot \|x - y\|_h $ を満たすこと。ここで $ \|\cdot\|_h $ は $ h $ によって誘導されるノルムである。
  • Bregman距離 $ D_h(x,y) = h(x) - h(y) - \langle \nabla h(y), x - y \rangle $ を用いて、新たな最適化部分問題を定義する。
  • 標準的な $ \|x - x^i\|_2^2 $ 項を $ L D_h(x, x^i) $ に置き換えることで、プライマル勾配スキームを変更する。
  • 相対的滑らかさのもとで一般化された三重点性質を証明し、Bregman距離を用いた収束解析を可能にする。
  • 収束レート $ f(x^k) - f(x^*) \leq \frac{L D_h(x^*, x^0)}{k} $ を確立し、古典的な $ O(1/k) $ レートを一般化する。
  • 部分問題の取り扱いやすさと収束速度のバランスを図る戦略を提案:$ Lh - f $ のヘッセ行列が小さくなるように $ h(\cdot) $ を選ぶことで、劣化した条件数と困難な部分問題を回避する。

実験結果

リサーチクエスチョン

  • RQ1勾配のリプシッツ定数が一様でない関数、例えば $ f(x) = -\ln(x) + x^2 $ や $ f(x) = -\ln \det(HXH^T) $ のような関数に対し、一階法を拡張することは可能か?
  • RQ2非一様滑らか関数に対して収束保証が得られるような滑らかさの適切な一般化とは何か?
  • RQ3Bregman距離フレームワークをどのように変更すれば、相対的滑らかさのもとで $ O(1/k) $ 収束レートを維持できるか?
  • RQ4収束速度と部分問題の複雑さの両立を考慮した場合、基準関数 $ h(\cdot) $ の選定に適した基準とは何か?
  • RQ5本フレームワークは、$ D $-最適設計や勾配のリプシッツ定数が無限大になる問題に、実際に適用可能か?

主な発見

  • 本稿は、$ f(x) = -\ln(x) + x^2 $ や $ f(x) = -\ln \det(HXH^T) $ のような非一様滑らか凸関数が、$ h(x) = \frac{1}{2}\|x\|_2^2 $ や $ h(x) = \sum x_i \ln x_i $ のような単純な基準関数に対して相対的滑らかであることを示している。
  • 相対的滑らかさフレームワークにより、プライマル勾配法が $ O(1/k) $ 収束率 $ f(x^k) - f(x^*) \leq \frac{L D_h(x^*, x^0)}{k} $ を達成でき、$ f $ が一様に滑らかでない場合でも成立する。
  • $ D $-最適設計では、古典的手法で見られる $ L_f $ の指数的増加を回避する計算複雑度の上限が得られ、実用的実装が可能である。
  • 相対的滑らかさのもとでギャップ関数 $ \nabla^2(Lh - f) $ のヘッセ行列は非負定値であるため、収束境界が適切に定義され、非増加的であることが保証される。
  • $ h(\cdot) $ の選定にはトレードオフがある:$ h(\cdot) = f(\cdot) $ とするとギャップのヘッセ行列はゼロだが、部分問題が困難になる。一方 $ h(\cdot) = \frac{1}{2}\|\cdot\|_2^2 $ とすると部分問題は簡単だが、ヘッセ行列の制御が不十分になる。
  • 本フレームワークは標準的一階法を一般化し、プリコンディショニング行列 $ B $ を用いるなどして、収束を改善しつつ計算の実行可能性を損なわない、体系的な $ h(\cdot) $ 選択法を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。