Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Conditional Gradient++

Hamed Hassani, Amin Karbasi|arXiv (Cornell University)|Feb 19, 2019
Stochastic Gradient Optimization Techniques参考文献 74被引用数 14
ひとこと要約

本稿では、非自明な確率的最適化のための新しいバリアンス低減技術である Stochastic Conditional Gradient++ (SFW++) を導入する。この手法により、非凸および凸関数の効率的最小化、連続的DR-サブモジュラ関数の最大化が可能となる。凸最小化およびサブモジュラ最大化において、$O(1/\theta^2)$ の最適収束速度を達成し、$(1-1/e)$-近似保証を厳密に得る。また、情報理論的議論を用いて収束速度の最適性を証明する。

ABSTRACT

In this paper, we consider the general non-oblivious stochastic optimization where the underlying stochasticity may change during the optimization procedure and depends on the point at which the function is evaluated. We develop Stochastic Frank-Wolfe++ ($ ext{SFW}{++} $), an efficient variant of the conditional gradient method for minimizing a smooth non-convex function subject to a convex body constraint. We show that $ ext{SFW}{++} $ converges to an $ε$-first order stationary point by using $O(1/ε^3)$ stochastic gradients. Once further structures are present, $ ext{SFW}{++}$'s theoretical guarantees, in terms of the convergence rate and quality of its solution, improve. In particular, for minimizing a convex function, $ ext{SFW}{++} $ achieves an $ε$-approximate optimum while using $O(1/ε^2)$ stochastic gradients. It is known that this rate is optimal in terms of stochastic gradient evaluations. Similarly, for maximizing a monotone continuous DR-submodular function, a slightly different form of $ ext{SFW}{++} $, called Stochastic Continuous Greedy++ ($ ext{SCG}{++} $), achieves a tight $[(1-1/e) ext{OPT} -ε]$ solution while using $O(1/ε^2)$ stochastic gradients. Through an information theoretic argument, we also prove that $ ext{SCG}{++} $'s convergence rate is optimal. Finally, for maximizing a non-monotone continuous DR-submodular function, we can achieve a $[(1/e) ext{OPT} -ε]$ solution by using $O(1/ε^2)$ stochastic gradients. We should highlight that our results and our novel variance reduction technique trivially extend to the standard and easier oblivious stochastic optimization settings for (non-)covex and continuous submodular settings.

研究の動機と目的

  • 目的関数の確率的性質が意思決定変数に依存する非自明な確率的最適化の課題に対処する。この設定では、標準的なバリアンス低減手法が無効となる。
  • 現在の反復点に依存する確率的関数の分布でさえも、バイアスを導入せずに勾配差分の不偏推定が可能な、新たなバリアンス低減メカニズムを構築する。
  • 非自明な確率的設定下で、非凸最小化および連続的サブモジュラ最大化の両方において、最適な収束速度を達成する。
  • 最小限の確率的勾配呼び出しで、高品質な解(例:単調DR-サブモジュラ最大化における$(1-1/e)$-近似)への収束を理論的に保証する。
  • 連続的サブモジュラ最大化におけるStochastic Continuous Greedy++ (SCG++)アルゴリズムの収束速度が、情報理論的に最適であることを確立する。

提案手法

  • 現在の意思決定変数に依存する確率的関数の分布を持つ非自明な確率的最適化に特化した、Frank-Wolfe法の変種としてStochastic Conditional Gradient++ (SFW++)を提案する。
  • 問題の構造的性質を活用することで、分布が点に依存する場合でも、1つのサンプルで2点間の勾配差分を推定可能な、新たなバリアンス低減技術を導入する。
  • 2段階のサンプリングスキームを採用:1つは勾配推定、もう1つは勾配差分推定に使用。これにより、更新におけるバイアスは低く抑えられ、分散は制御される。
  • 有効領域内の反復点を維持するためのラインサーチを伴うFrank-Wolfe更新則を用いながら、バリアンス低減勾配推定を統合することで収束性を向上させる。
  • 連続的DR-サブモジュラ最大化に特化した変種、Stochastic Continuous Greedy++ (SCG++)を設計。正規化された方向と適切に調整されたステップサイズを用いることで、高精度な近似保証を達成する。
  • マルティングルの濃度不等式および有効領域の強い凸性に類似した性質を用いて収束バウンドを証明し、サブ最適性および収束速度に関するタイトなバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1確率的関数の分布が現在の意思決定変数に依存する非自明な確率的最適化に対して、バリアンス低減技術を設計できるか?
  • RQ2非自明な設定下で、非凸および凸最小化における確率的1階最適化手法の最適収束速度は何か?
  • RQ3Stochastic Conditional Gradient++アルゴリズムは、単調連続DR-サブモジュラ最大化において、最適なサンプル複雑度で$(1-1/e)$-近似を達成できるか?
  • RQ4非自明な設定下で、サブモジュラ最大化における$O(1/\theta^2)$収束速度は、情報理論的に最適か?
  • RQ5提案手法は、凸制約付きの強化学習方策勾配問題に適用可能であり、最適な軌道複雑度を達成できるか?

主な発見

  • 非凸最小化において、SFW++は$O(1/\epsilon^3)$の確率的勾配評価で$\epsilon$-1階停留点に収束し、以前の$O(1/\epsilon^4)$のレートを改善する。
  • 凸最小化において、SFW++はわずか$O(1/\epsilon^2)$の確率的勾配で$\epsilon$-最適解を達成し、情報理論的に最適なレートに一致する。
  • 単調連続DR-サブモジュラ最大化において、SCG++は$O(1/\epsilon^2)$の確率的勾配で$[(1-1/e)\text{OPT} - \epsilon]$の解を達成し、タイトな近似保証を得る。
  • SCG++の収束速度は、ベルヌーイパラメータ推定の難易度や困難なサブモジュラ最大化インスタンスの解法への還元により、情報理論的に最適であることが証明された。
  • 非単調連続DR-サブモジュラ最大化において、アルゴリズムは$O(1/\epsilon^2)$の確率的勾配で$[(1/e)\text{OPT} - \epsilon]$の解を達成する。
  • 副次的成果として、SFW++は、非自明な設定下で凸制約付き強化学習方策勾配問題に対して、$O(1/\epsilon^3)$の最初の軌道複雑度を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。