Skip to main content
QUICK REVIEW

[論文レビュー] Fast Policy Extragradient Methods for Competitive Games with Entropy Regularization

Shicong Cen, Yuting Wei|arXiv (Cornell University)|May 31, 2021
Advanced Bandit Algorithms Research参考文献 48被引用数 10
ひとこと要約

本稿では、競合ゲームにおける均衡を計算するための、証明可能に効率的な勾配外法(extragradient)手法を提案する。エントロピー正則化を用いることで、零和行列ゲームにおける数量応答均衡(QRE)への線形収束と、正則化なしのゲームにおける近似ナッシュ均衡への亜線形収束を達成する。アルゴリズムは、各プレイヤーの自身の報酬に基づく分散型・対称的・乗法的更新を採用し、状態空間および行動空間のサイズにほぼ依存しない収束速度を達成する。

ABSTRACT

This paper investigates the problem of computing the equilibrium of competitive games, which is often modeled as a constrained saddle-point optimization problem with probability simplex constraints. Despite recent efforts in understanding the last-iterate convergence of extragradient methods in the unconstrained setting, the theoretical underpinnings of these methods in the constrained settings, especially those using multiplicative updates, remain highly inadequate, even when the objective function is bilinear. Motivated by the algorithmic role of entropy regularization in single-agent reinforcement learning and game theory, we develop provably efficient extragradient methods to find the quantal response equilibrium (QRE) -- which are solutions to zero-sum two-player matrix games with entropy regularization -- at a linear rate. The proposed algorithms can be implemented in a decentralized manner, where each player executes symmetric and multiplicative updates iteratively using its own payoff without observing the opponent's actions directly. In addition, by controlling the knob of entropy regularization, the proposed algorithms can locate an approximate Nash equilibrium of the unregularized matrix game at a sublinear rate without assuming the Nash equilibrium to be unique. Our methods also lead to efficient policy extragradient algorithms for solving (entropy-regularized) zero-sum Markov games at similar rates. All of our convergence rates are nearly dimension-free, which are independent of the size of the state and action spaces up to logarithm factors, highlighting the positive role of entropy regularization for accelerating convergence.

研究の動機と目的

  • 制約付き競合ゲームにおける勾配外法の理論的理解の不足に取り組むこと、特に乗法的更新の文脈で。
  • エントロピー正則化を用いたゼロ和行列ゲームにおける数量応答均衡(QRE)を計算する、証明可能な効率性を持つアルゴリズムを開発すること。
  • 各プレイヤーが相手の行動を観測せず、自身の報酬のみを用いて更新できる分散型・対称的ポリシー更新を可能にすること。
  • 正則化なしの行列ゲームにおける近似ナッシュ均衡への高速収束を達成すること。均衡の一意性を仮定しない。
  • 同様の収束保証を持つ枠組みを、エントロピー正則化付きゼロ和マルコフゲームに拡張すること。

提案手法

  • エントロピー正則化報酬勾配に基づく乗法的更新を用いる2つの勾配外法(PUとOMWU)を提案。
  • エントロピー正則化を用いて学習を安定化させ、双線形構造を維持することで収束保証を可能にする。
  • 正則化目的関数と単体制約を考慮した、新規の解析フレームワークを用いて、行列ゲームにおける最終反復の線形収束を導出。
  • マルコフゲームにおける価値関数変化をバウンディングするためのパフォーマンス差分補題を導入し、収束解析を可能にする。
  • ポリシーの対数変換を用いて単体制約を扱い、強い凸性を用いて安定性バウンディングを導出。
  • エントロピー正則化パラメータの制御により、次元にほぼ依存しない収束レートを確立。状態空間および行動空間のサイズに依存しないが、対数因子まで考慮する。

実験結果

リサーチクエスチョン

  • RQ1エントロピー正則化付き勾配外法は、制約付き双線形ゼロ和行列ゲームにおいて、数量応答均衡(QRE)への線形収束を達成できるか?
  • RQ2エントロピー正則化は、相手の行動を観測せず、自身の報酬のみを用いて分散型・対称的ポリシー更新を可能にする仕組みは何か?
  • RQ3提案手法は、均衡の一意性を仮定しない正則化なしの行列ゲームにおいて、近似ナッシュ均衡への亜線形収束を達成できるか?
  • RQ4エントロピー正則化はマルコフゲームにおける収束加速に果たす役割は何か?また、収束レートは状態空間および行動空間のサイズにどのように依存するか?
  • RQ5収束保証は、同様のレートを持つエントロピー正則化付きゼロ和マルコフゲームに拡張可能か?

主な発見

  • 提案されたPUおよびOMWUアルゴリズムは、エントロピー正則化付きゼロ和行列ゲームにおいて、数量応答均衡(QRE)への最終反復線形収束を達成する。
  • 収束レートはほぼ次元フリーであり、ε-精度を達成するためのスケーリングがO(log n / ε)であり、状態空間および行動空間のサイズに依存しない(対数因子まで考慮)。
  • エントロピー正則化パラメータを調整することで、均衡の一意性を仮定しない正則化なしの行列ゲームにおいて、近似ナッシュ均衡への亜線形収束を達成できる。
  • 手法は分散型かつ対称的であり、各プレイヤーが相手の行動を観測せず、自身の報酬のみを用いて更新可能である。
  • エントロピー正則化付きゼロ和マルコフゲームでは、ポリシー勾配外法が、同様のほぼ次元フリーのレートで近似ナッシュ均衡への最終反復収束を達成する。
  • 理論的解析により、対数的ポリシー変換とエントロピーに基づく正則性を用いて、ポリシーおよび価値関数の変化に対するリプシッツ型バウンディングを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。