Skip to main content
QUICK REVIEW

[論文レビュー] Online and Bandit Algorithms for Nonstationary Stochastic Saddle-Point Optimization

Abhishek Roy, Yifang Chen|arXiv (Cornell University)|Dec 3, 2019
Advanced Bandit Algorithms Research参考文献 62被引用数 10
ひとこと要約

本稿は、オンラインおよびバンディット設定における非定常な確率的サドルポイント最適化のための新しいレグレット定義を導入し、強い凸性および凹性のもとで部分線形レグレットバウンドを達成するextragradientおよびFrank-Wolfeアルゴリズムを提案する。主な貢献は、ゼロ次フィードバックを用いて$\epsilon$-最適解への幾何的収束レートを保証する理論的収束保証である。

ABSTRACT

Saddle-point optimization problems are an important class of optimization problems with applications to game theory, multi-agent reinforcement learning and machine learning. A majority of the rich literature available for saddle-point optimization has focused on the offline setting. In this paper, we study nonstationary versions of stochastic, smooth, strongly-convex and strongly-concave saddle-point optimization problem, in both online (or first-order) and multi-point bandit (or zeroth-order) settings. We first propose natural notions of regret for such nonstationary saddle-point optimization problems. We then analyze extragradient and Frank-Wolfe algorithms, for the unconstrained and constrained settings respectively, for the above class of nonstationary saddle-point optimization problems. We establish sub-linear regret bounds on the proposed notions of regret in both the online and bandit setting.

研究の動機と目的

  • 非定常な確率的サドルポイント最適化のオンラインおよびバンディット設定における意味のある静的および動的レグレットの概念を形式化すること。
  • 時間的に変化する目的関数を伴うサドルポイント問題に、オンライン凸最適化フレームワークを拡張すること。
  • 非定常性のもとでの非制約および制約付き設定に対して、extragradientおよびFrank-Wolfeアルゴリズムの設計と解析を行うこと。
  • オンライン(一次)およびバンディット(ゼロ次)フィードバック設定の両方で部分線形レグレットバウンドを確立すること。
  • 確率的ゼロ次オラクルを用いて、$\epsilon$-最適なサドルポイントへの幾何的収束を達成すること。

提案手法

  • ナッシュ均衡基準に基づく滑らか化された静的レグレットの概念を導入し、時間的に変化する関数に適応させる。
  • 非制約設定に対して、適応的ステップサイズ$\gamma_k = \min\{1, \frac{C_0}{4C_1}g_{k-1}\}$を用いたextragradientアルゴリズムを提案する。
  • 制約付き設定に対しては、線形部分問題オラクルを活用したFrank-Wolfeアルゴリズムを適用する。
  • ゼロ次バンディットフィードバックにおいて、$m_k$および$v_k$を用いて勾配を近似する。
  • 潜在関数$w_k$に対する再帰的不等式を導出し、収束レートをバウンドする。
  • 収縮係数$\rho = 1 - \min\{\frac{C_0^2\delta_\mu^2}{8C_1}, \frac{C_0}{2}\}$を用いて、$\mathbb{E}[w_k]$の幾何的減衰を確立する。

実験結果

リサーチクエスチョン

  • RQ1オンラインおよびバンディット設定における非定常なサドルポイント最適化に対して、意味のあるレグレットの概念をどのように定義できるか?
  • RQ2extragradientおよびFrank-Wolfeアルゴリズムは、非定常的で確率的かつ強く凸・凹な設定でも部分線形レグレットを達成できるか?
  • RQ3ゼロ次フィードバックのもとで、これらのアルゴリズムに保証できる収束レートは何か?
  • RQ4適応的ステップサイズの選択が、$\epsilon$-最適解への収束にどのように影響するか?
  • RQ5収束は勾配推定誤差および問題パラメータにどのように依存するか?

主な発見

  • 提案されたextragradientおよびFrank-Wolfeアルゴリズムは、非定常なサドルポイント最適化問題において、オンラインおよびバンディット設定の両方で部分線形レグレットを達成する。
  • これらのアルゴリズムは、$\rho = 1 - \min\{\frac{C_0^2\delta_\mu^2}{8C_1}, \frac{C_0}{2}\}$によって制御される$\epsilon$-最適なサドルポイントへの幾何的収束を示す。
  • 期待値の反復は、$\mathbb{E}[w_k] \leq (1 - \rho)^T(\mathbb{E}[w_0] - \frac{1}{\rho}\max\{\mathbb{E}[T_2], \mathbb{E}[T_3]\}) + \frac{1}{\rho}\max\{\mathbb{E}[T_2], \mathbb{E}[T_3]\}$を満たし、幾何的収束を示唆する。
  • エラーが$\epsilon$-最適性を達成するために必要な確率的ゼロ次オラクルの呼び出し回数および線形部分問題の呼び出し回数は有界である。
  • 勾配推定誤差$\Delta_k^{x[y]}$は、バウンド内の項$T_2$および$T_3$を通じて収束レートに直接影響を与える。
  • 解析により、時間的に変化する目的関数およびノイズのあるフィードバックのもとでも、アルゴリズムが安定かつ収束することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。