Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Compositional Gradient Descent: Algorithms for Minimizing Compositions of Expected-Value Functions

Mengdi Wang, Ethan X. Fang|arXiv (Cornell University)|Nov 14, 2014
Stochastic Gradient Optimization Techniques参考文献 21被引用数 6
ひとこと要約

本稿では、期待値関数の合成を最小化するための新しいアルゴリズムである確率的合成勾配降下法(SCGD)を提案する。これは、形式 min_x E_v[f_v(E_w[g_w(x)])] の問題を対象としている。SCGDは、内側および外側の関数からの勾配のノイズのあるサンプルを用い、E_w[g_w(x)] を追跡する補助変数を導入する。この手法は、最適解への確実収束を達成する。一般の凸問題に対しては O(k^{-1/4})、強い凸問題に対しては O(k^{-2/3}) の収束速度を示し、加速版ではそれぞれ O(k^{-2/7}) および O(k^{-4/5}) の収束速度を達成する。これはサンプリング制約下でも成立する。

ABSTRACT

Classical stochastic gradient methods are well suited for minimizing expected-value objective functions. However, they do not apply to the minimization of a nonlinear function involving expected values or a composition of two expected-value functions, i.e., problems of the form $\min_x \mathbf{E}_v [f_v\big(\mathbf{E}_w [g_w(x)]\big)]$. In order to solve this stochastic composition problem, we propose a class of stochastic compositional gradient descent (SCGD) algorithms that can be viewed as stochastic versions of quasi-gradient method. SCGD update the solutions based on noisy sample gradients of $f_v,g_{w}$ and use an auxiliary variable to track the unknown quantity $\mathbf{E}_w[g_w(x)]$. We prove that the SCGD converge almost surely to an optimal solution for convex optimization problems, as long as such a solution exists. The convergence involves the interplay of two iterations with different time scales. For nonsmooth convex problems, the SCGD achieve a convergence rate of $O(k^{-1/4})$ in the general case and $O(k^{-2/3})$ in the strongly convex case, after taking $k$ samples. For smooth convex problems, the SCGD can be accelerated to converge at a rate of $O(k^{-2/7})$ in the general case and $O(k^{-4/5})$ in the strongly convex case. For nonconvex problems, we prove that any limit point generated by SCGD is a stationary point, for which we also provide the convergence rate analysis. Indeed, the stochastic setting where one wants to optimize compositions of expected-value functions is very common in practice. The proposed SCGD methods find wide applications in learning, estimation, dynamic programming, etc.

研究の動機と目的

  • 期待値関数の合成を最小化するための確率的最適化手法の不足に応えること。特に、古典的 SGD がサンプリング確率における非線形性のため失敗するような問題 E_v[f_v(E_w[g_w(x)])] を対象とする。
  • サンプリングオラクルを介して内側および外側の関数からのノイズのある勾配サンプルのみを用いる、部分情報下での確率的1次最適化手法の開発。
  • 凸および非凸なスチュアティックコンポジション問題の両方に対して、確実収束および収束速度の上限を確立すること。
  • 動的計画法、リスク回避最適化、確率的最短経路問題などの応用を通じて、実用的適用可能性を示すこと。

提案手法

  • SCGD は、主変数 x と E_w[g_w(x)] を追跡する補助変数の2段階スケールの更新則を採用する。
  • サンプリングオラクルを介して、∇f_v(y) および ∇g_w(x) の不偏なノイズのあるサンプルを用いて、外側および内側関数の勾配を推定する。
  • f ∘ g を合成関数として扱い、f が g の期待値に適用されるという枠組みを用いる確率的近似フレームワークを適用する。
  • 非滑らか問題に対しては、部分勾配近似を用いる。滑らか問題に対しては、勾配情報を利用することで収束を加速する。
  • 補外技術を用いた加速スキームを導入し、一般凸問題では O(k^{-2/7})、強い凸問題では O(k^{-4/5}) の収束速度を達成する。
  • min や max などの微分不能な演算は、h_ϵ(y1,y2) などの滑らか近似を用いて勾配ベース最適化が可能になるように変換する。

実験結果

リサーチクエスチョン

  • RQ1古典的 SGD がサンプリング確率における非線形性のため失敗するような、期待値関数の合成を扱うための確率的勾配法を拡張することは可能か?
  • RQ2部分情報およびノイズのある勾配アクセス下でのスチュアティックコンポジション最適化に対して、どのような収束保証を確立できるか?
  • RQ3凸および非凸設定下でのスチュアティックコンポジション問題の最適収束速度は何か?
  • RQ4加速技術は、滑らかおよび強い凸ケースの収束速度を向上させるためにどのように適合可能か?
  • RQ5SCGD は、動的計画法やリスク回避最適化といった実世界問題に理論的保証とともに適用可能か?

主な発見

  • SCGD は、標準的な仮定の下で、凸なスチュアティックコンポジション問題に対して最適解への確実収束を達成する。
  • 非滑らか凸問題では、一般ケースで O(k^{-1/4})、強い凸ケースで O(k^{-2/3}) の収束速度を達成する。
  • 滑らか凸問題では、加速 SCGD の変種が一般ケースで O(k^{-2/7})、強い凸ケースで O(k^{-4/5}) の収束速度を達成する。
  • 非凸問題では、SCGD のすべての極限点が停留点であることが保証され、収束速度の解析が提供されている。
  • 確率的最短経路問題における数値実験により、SCGD の収束が確認され、加速 SCGD が実際の性能で基本バージョンを上回ることが示された。
  • 動的計画法問題において、SCGD は価値反復の結果と一致する最適意思決定ルールを回復でき、学習中に Q 値をオンラインで推定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。