Skip to main content
QUICK REVIEW

[論文レビュー] Boosting One-Point Derivative-Free Online Optimization via Residual Feedback

Yan Zhang, Yi Zhou|arXiv (Cornell University)|Oct 14, 2020
Advanced Bandit Algorithms Research参考文献 27被引用数 7
ひとこと要約

本稿では、勾配の分散を著しく低減するための残差フィードバックを用いた、1点勾配フリーのオンライン最適化手法を提案する。連続する関数評価値の差を活用することで、より弱い仮定のもとで凸および非凸問題の両方において、従来の1点法よりも理論的・実践的に優れたレギュレートバウンドを達成する。

ABSTRACT

Zeroth-order optimization (ZO) typically relies on two-point feedback to estimate the unknown gradient of the objective function. Nevertheless, two-point feedback can not be used for online optimization of time-varying objective functions, where only a single query of the function value is possible at each time step. In this work, we propose a new one-point feedback method for online optimization that estimates the objective function gradient using the residual between two feedback points at consecutive time instants. Moreover, we develop regret bounds for ZO with residual feedback for both convex and nonconvex online optimization problems. Specifically, for both deterministic and stochastic problems and for both Lipschitz and smooth objective functions, we show that using residual feedback can produce gradient estimates with much smaller variance compared to conventional one-point feedback methods. As a result, our regret bounds are much tighter compared to existing regret bounds for ZO with conventional one-point feedback, which suggests that ZO with residual feedback can better track the optimizer of online optimization problems. Additionally, our regret bounds rely on weaker assumptions than those used in conventional one-point feedback methods. Numerical experiments show that ZO with residual feedback significantly outperforms existing one-point feedback methods also in practice.

研究の動機と目的

  • 1ステップあたり1回の関数評価しか許されないオンライン最適化における、従来の1点フィードバックの限界を解消すること。
  • オンラインおよび非定常な状況で性能を低下させる、標準的な1点勾配推定器の高い分散を克服すること。
  • 先行研究よりも弱い仮定のもとで、ゼロスラッシュオンライン最適化のよりタイトなレギュレートバウンドを確立すること。
  • 敵対的かつ非定常な環境下でも、時間的に変化する最適化子を効果的に追跡できること。
  • 非凸オンライン最適化問題における1点ZO手法の理論的分析を初めて提供すること。

提案手法

  • 2つの連続するフィードバックポイント間の残差を用いる新しい勾配推定器を導入:$ \widetilde{g}_t^{\text{res}} = \frac{u_t}{\delta} \left( f_t(x_t + \delta u_t) - f_{t-1}(x_{t-1} + \delta u_{t-1}) \right) $。
  • この残差フィードバックを、1ステップあたり1回の関数クエリしか許されないオンライン設定で勾配を推定するために用いる。
  • リプシッツ連続性および滑らかさの仮定のもとで、勾配推定器の2次モーメントを分析することで理論的レギュレートバウンドを確立する。
  • 確定的および確率的設定の両方のレギュレートバウンドを導出。低分散のおかげで、収束速度が向上していることを示す。
  • 時間経過に伴う勾配ノルムの分散の増大を制御するため、$ \alpha = \frac{4dL_0^2\eta^2}{\delta^2} $ を用いた再帰的期待値バウンドを導入する。
  • 時間的に変化する目的関数を、全変動が有界であると仮定する仮定I.3を導入。これにより、非定常状態下での解析が可能になる。

実験結果

リサーチクエスチョン

  • RQ1オンラインゼロスラッシュ最適化において、1点フィードバックを改善することで、勾配推定の分散を低減できるか?
  • RQ2連続する時間ステップ間の残差フィードバックは、標準的な1点フィードバックよりも優れたレギュレートバウンドをもたらすか?
  • RQ3提案手法は、既存の1点ZO手法よりも弱い仮定のもとで、よりタイトなレギュレートバウンドを達成するか?
  • RQ4この手法は、非定常的かつ敵対的な環境下でも、時間的に変化する最適化子を効果的に追跡できるか?
  • RQ5非凸オンライン最適化問題における、提案された残差フィードバック手法は理論的に正当化されるか?

主な発見

  • 提案された残差フィードバック手法は、従来の1点フィードバックよりも著しく低い分散の勾配推定を生成する。
  • 凸および非凸問題の両方において、既存の1点ZO手法よりもタイトなレギュレートバウンドを達成しており、目的関数値が大きい場合に顕著に優位性を示す。
  • 理論的分析は、関数値の均一な上界ではなく、時間的全変動が有界であるというより弱い仮定に依拠している。
  • 数値実験により、残差フィードバックを用いたZOが、時間的に変化する最適化子の追跡において、従来の1点法を上回ることが確認された。
  • 本稿は、非凸オンライン最適化における1点ゼロスラッシュ手法の理論的レギュレート解析を初めて提供する。
  • 勾配推定器の2次モーメントは、$ \frac{1}{1 - \alpha} \left( 16L_0^2(d+4)^2 + \frac{2d}{\delta^2}V_f^2 \right) $ で有界であることが示され、安定性および収束性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。