Skip to main content
QUICK REVIEW

[論文レビュー] On the Rate of Convergence of Payoff-based Algorithms to Nash Equilibrium in Strongly Monotone Games

Tatiana Tatarenko, Maryam Kamgarpour|arXiv (Cornell University)|Feb 22, 2022
Stochastic Gradient Optimization Techniques被引用数 4
ひとこと要約

本稿は、関数評価(ゼロオーダー情報)のみを用いて、凸的かつ強く単調なゲームにおけるナッシュ均衡を学習する報酬ベースのアルゴリズムを提案する。1点フィードバック設定では $O(1/√{T})$ の収束速度を、2点フィードバック設定では $O(1/T)$ の収束速度を確立し、反復点を時間変化する滑らか化ゲームの均衡と比較する新しい解析によって、このクラスのゲームにおいて最高の既知のレートを達成する。

ABSTRACT

We derive the rate of convergence to Nash equilibria for the payoff-based algorithm proposed in \cite{tat_kam_TAC}. These rates are achieved under the standard assumption of convexity of the game, strong monotonicity and differentiability of the pseudo-gradient. In particular, we show the algorithm achieves $O(\frac{1}{T})$ in the two-point function evaluating setting and $O(\frac{1}{\sqrt{T}})$ in the one-point function evaluation under additional requirement of Lipschitz continuity of the pseudo-gradient. These rates are to our knowledge the best known rates for the corresponding problem classes.

研究の動機と目的

  • 報酬ベースの学習における収束速度の境界のギャップを埋める。
  • 報酬フィードバックのみを用いて、1点および2点の関数評価設定におけるタイトな収束レートを導出する。
  • アルゴリズムの反復点を時間変化する滑らか化ゲームの解と比較することで、導出されたレートの最適性を確立する。
  • 混合戦略均衡を含む滑らか化ゲームにおける新たな解析技術を導入することで、従来の $O(1/T^{1/3})$ レートを改善する。
  • 凸性、強く単調性、微分可能性、および擬似勾配のリプシッツ連続性という標準的仮定の下で、レートを検証する。

提案手法

  • ガウスノイズを用いた確率的勾配推定戦略を採用し、報酬情報のみから勾配を近似する。
  • ナッシュ均衡が滑らかさパラメータ $\rho_t$ に応じて時間変化する、時間変化する滑らか化ゲームモデルを導入する。
  • 反復点 $\bm{\mu}(t)$ を各ステップにおける滑らか化ゲームのナッシュ均衡 $\mathbf{z}(t)$ と比較することで収束を解析する。
  • 収束を保証するとともに推定誤差を制御するため、サンプリング分布に減少する分散パラメータ $\sigma_t$ を導入する。
  • チャングの補題およびポルトマントの補題を用いて、反復点が真のナッシュ均衡にほとんど確実かつ確率的に収束することを確立する。
  • 期待二乗距離 $\mathrm{E}[\|\bm{\mu}(t+1) - \mathbf{z}(t)\|^2]$ のバOUNDSを導出し、$O(1/t)$ の減衰を示すことで、最終的な収束レートに至る。

実験結果

リサーチクエスチョン

  • RQ1報酬フィードバックのみを用いた場合、強く単調なゲームにおいて $O(1/T^{1/3})$ よりも速い収束速度を達成できるか?
  • RQ21点フィードバック設定における $O(1/\sqrt{T})$ レートは、ゼロオーダー確率的勾配法が強い凸最適化に適用される場合に最適か?
  • RQ3勾配情報が利用できない状況でも、2点フィードバック設定で $O(1/T)$ レートを達成できるか?
  • RQ4時間変化する滑らか化ゲーム均衡とアルゴリズムの反復点を比較することで、真の均衡と直接比較するのと比べて、よりタイトな収束バOUNDSが得られるか?
  • RQ5ミラー降下スタイルの更新と組み合わせた場合、ガウス分布をサンプリング分布として選ぶと収束にどのような影響を与えるか?

主な発見

  • 提案されたアルゴリズムは、1点関数評価設定において $O(1/\sqrt{T})$ の収束速度を達成し、従来の $O(1/T^{1/3})$ レートを改善する。
  • 2点関数評価設定では、$O(1/T)$ の収束速度を達成し、有界な勾配推定のもとでゼロオーダー確率的勾配法にとって最適である。
  • 向上したレートは、アルゴリズムの変更ではなく、反復点を時間変化する滑らか化ゲームの均衡と比較する洗練された解析技術によるものである。
  • 2点設定における $O(1/T)$ の収束速度は、勾配の完全なアクセスがあるゼロオーダー強く凸最適化の既知の下界と一致する。
  • 1点設定における $O(1/\sqrt{T})$ のレートは、ゼロオーダー滑らかで強く凸最適化の既知の下界と一致しており、与えられた仮定のもとで最適性を示唆する。
  • 解析により、$\sigma_t \to 0$ の仮定の下で、反復点が真のナッシュ均衡 $\bm{a}^*$ にほとんど確実かつ確率的に収束することが確立される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。