Skip to main content
QUICK REVIEW

[論文レビュー] A Stochastic Derivative Free Optimization Method with Momentum

Eduard Gorbunov, Adel Bibi|arXiv (Cornell University)|May 30, 2019
Stochastic Gradient Optimization Techniques参考文献 46被引用数 7
ひとこと要約

本稿では、関数評価のみを用いて無制約平滑最小化を行う、確率的勾配フリー最適化手法SMTPを提案する。重み付きボールモーメンタムを組み込んだ本手法は、非凸、凸、強凸な設定において、STPおよび最先端のDFO手法を上回る収束速度を達成し、理論的複雑度境界とMuJoCo環境を用いた連続的制御タスクにおける実験的優位性を示す。

ABSTRACT

We consider the problem of unconstrained minimization of a smooth objective function in $\mathbb{R}^d$ in setting where only function evaluations are possible. We propose and analyze stochastic zeroth-order method with heavy ball momentum. In particular, we propose, SMTP, a momentum version of the stochastic three-point method (STP) \cite{Bergou_2018}. We show new complexity results for non-convex, convex and strongly convex functions. We test our method on a collection of learning to continuous control tasks on several MuJoCo \cite{Todorov_2012} environments with varying difficulty and compare against STP, other state-of-the-art derivative-free optimization algorithms and against policy gradient methods. SMTP significantly outperforms STP and all other methods that we considered in our numerical experiments. Our second contribution is SMTP with importance sampling which we call SMTP_IS. We provide convergence analysis of this method for non-convex, convex and strongly convex objectives.

研究の動機と目的

  • 関数評価のみが利用可能な勾配フリー設定において、モーメンタムに基づく確率的ゼロスオーダー最適化手法を開発すること。
  • 非凸、凸、強凸な目的関数に対して、グローバル収束性と改善された複雑度境界を確立すること。
  • 座標方向における局所的滑らかさに比例する非一様重要度サンプリングを用いた変種、SMTP_ISを設計し、収束効率をさらに向上させること。
  • 連続的制御タスクにおける実験的妥当性を確認し、STP、他のDFOアルゴリズム、ポリシー勾配法と比較してSMTPの優位性を検証すること。

提案手法

  • 関数評価を3点(x_k, x_k + α_k s_k, x_k - α_k s_k)で行い、ランダムな探索方向を用いる、Stochastic Three-Point(STP)法のモーメンタム強化型であるSMTPを提案する。
  • 過去の反復点を活用することで収束を加速するヘビーボールモーメンタムを導入し、ポリアックのモーメンタムに類似しているが、ゼロスオーダー設定に適応させたものである。
  • 確率的三ポイント更新則を採用:x_{k+1} = argmin{f(x_k), f(x_k + α_k s_k), f(x_k - α_k s_k)}。
  • 局所的滑らかさ(L_i / sum L_i)に比例する非一様重要度サンプリングを用いた変種であるSMTP_ISを開発する。
  • 勾配と探索方向の期待内積が有界であることを保証する一般枠組み(仮定3.1)を用いる。
  • L-スムーズ性の下で収束を分析し、異なる問題クラスにおける関数評価回数に基づく複雑度境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1勾配にアクセスできない状況下でも、勾配フリー最適化にモーメンタムを効果的に組み込むことは可能か?
  • RQ2非凸、凸、強凸関数に対して、モーメンタムに基づくゼロスオーダー手法の理論的収束速度は何か?
  • RQ3座標方向における重要度サンプリングは、勾配フリー手法の収束をどのように改善するか?
  • RQ4提案手法は、STPおよび他の最先端のDFOアルゴリズムを、実用的RLベンチマークで上回るか?

主な発見

  • 非凸問題において、SMTPはO(1/ε²)の複雑度を達成し、ゼロスオーダー手法の最良知られているレートと一致する。
  • 凸目的関数において、SMTPはO(1/ε)の複雑度を達成し、与えられた仮定下でゼロスオーダー手法にとって最適である。
  • 強凸の場合、SMTPはO(log(1/ε))の複雑度を達成し、対数的収束速度を示す。
  • SMTP_ISは、条件数および座標方向の滑らかさに依存する要因により、SMTPよりも優れた複雑度を達成し、高次元設定においても定数が改善される。
  • 実験的結果から、SMTPはMuJoCoの連続的制御タスクにおいて、STP、他のDFO手法、ポリシー勾配ベースラインを著しく上回ることが示された。
  • 本手法は、タスク難易度の変動に関係なく、ロバストで効率的であることが確認され、モーメンタムと重要度サンプリングの実用的利点が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。