Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Recursive Gradient Descent Ascent for Stochastic Nonconvex-Strongly-Concave Minimax Problems

Luo Luo, Haishan Ye|arXiv (Cornell University)|Jan 11, 2020
Stochastic Gradient Optimization Techniques参考文献 48被引用数 15
ひとこと要約

本稿では、非凸強凸最小最大化問題に対する、新たな確率的再帰的勾配降下上昇法SREDAを提案する。再帰的分散低減とxおよびy変数間の適応的学習率のバランスを活用することで、SREDAは最適な確率的勾配複雑度O(κ³ε⁻³)を達成し、従来の最良手法SGDAのO(κ³ε⁻⁴)を改善する。

ABSTRACT

We consider nonconvex-concave minimax optimization problems of the form $\min_{\bf x}\max_{\bf y\in{\mathcal Y}} f({\bf x},{\bf y})$, where $f$ is strongly-concave in $\bf y$ but possibly nonconvex in $\bf x$ and ${\mathcal Y}$ is a convex and compact set. We focus on the stochastic setting, where we can only access an unbiased stochastic gradient estimate of $f$ at each iteration. This formulation includes many machine learning applications as special cases such as robust optimization and adversary training. We are interested in finding an ${\mathcal O}(\varepsilon)$-stationary point of the function $Φ(\cdot)=\max_{\bf y\in{\mathcal Y}} f(\cdot, {\bf y})$. The most popular algorithm to solve this problem is stochastic gradient decent ascent, which requires $\mathcal O(κ^3\varepsilon^{-4})$ stochastic gradient evaluations, where $κ$ is the condition number. In this paper, we propose a novel method called Stochastic Recursive gradiEnt Descent Ascent (SREDA), which estimates gradients more efficiently using variance reduction. This method achieves the best known stochastic gradient complexity of ${\mathcal O}(κ^3\varepsilon^{-3})$, and its dependency on $\varepsilon$ is optimal for this problem.

研究の動機と目的

  • fがxに関して非凸でyに関して強凸である、確率的非凸強凸最小最大化問題におけるε-停留点の探索という課題に対処する。
  • SGDAのような既存手法の高い確率的勾配複雑度(O(κ³ε⁻⁴)評価を必要とする)を克服する。
  • xおよびy変数の学習率と反復回数を効率的にバランスさせる分散低減ベースのアルゴリズムを開発する。
  • εに最適な依存関係を達成し、勾配複雑度をO(κ³ε⁻³)に低減することで、非凸最適化の理論的下界に一致させる。
  • 有限和および一般確率的設定を統一的にカバーする解析を提供し、両ケースにおいてタイトな複雑度境界を示す。

提案手法

  • xおよびyの両更新における分散低減を実現するため、再帰的勾配推定器を維持する確率的再帰的勾配降下上昇法SREDAを提案する。
  • y更新のためのマルチステップ内ループを用いて勾配推定を安定化させ、xおよびy変数間の学習率をバランスさせる。
  • y更新レートがx更新レートのO(κ²)倍になるように適応的学習率を導入し、ネストドループを必要とせずに収束を保証する。
  • xおよびyの勾配推定器に再帰的分散低減技術を適用し、確率的勾配評価回数を削減する。
  • エポックベースの更新と適応的ステップサイズを組み合わせた二重ループ構造を採用し、外側のループが勾配推定器の精度を制御する。
  • リャプノフ関数を用いた収束解析を行い、Φ(x) = max_y f(x,y)の勾配ノルムの期待値がO(ε)に収束することを証明する。

実験結果

リサーチクエスチョン

  • RQ1分散低減技術は、非凸強凸最小最大化問題に効果的に適応可能か? これにより勾配複雑度が向上するか?
  • RQ2非凸強凸最小最大化問題を解く確率的一次順序アルゴリズムにおいて、εに最適な依存関係は何か?
  • RQ3再帰的勾配推定は、SGDAにおけるネストドループの必要性を排除しつつ収束保証を維持できるか?
  • RQ4条件数κは、このクラスの問題における確率的設定での収束速度にどのように影響するか?
  • RQ5Φ(x) = max_y f(x,y)のε-停留点を求めるために必要な最小の確率的勾配評価回数は何か?

主な発見

  • SREDAはO(κ³ε⁻³)の確率的勾配複雑度を達成し、これは最適であり、非凸最適化の既知の下界と一致する。
  • SGDAのO(κ³ε⁻⁴)複雑度に対し、ε依存性をε⁻⁴からε⁻³に低減することで、性能が向上する。
  • 有限和の場合、SREDAはO((n + κ)log(κ/ε))の勾配評価回数を達成し、nおよびκに関してほぼ最適である。
  • n ≥ κ²の領域では、複雑度はO(n log(κ/ε) + κ²n¹ᐟ²ε⁻²)となり、nに有利にスケーリングされる。
  • n ≤ κ²の領域では、複雑度はO((κ² + κn)ε⁻²)となり、小規模なnに対しても効率的である。
  • 解析により、再帰的勾配推定器が分散を効果的に低減することが確認され、明示的なmaxオракルクエリを必要とせずに高速収束が実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。