Skip to main content
QUICK REVIEW

[論文レビュー] Actor-Critic Algorithms for Learning Nash Equilibria in N-player General-Sum Games

H. L. Prasad, L. A. Prashanth|arXiv (Cornell University)|Jan 8, 2014
Game Theory and Applications参考文献 39被引用数 5
ひとこと要約

本稿では、N人一般和確率ゲームにおける定常ナッシュ均衡を学習するための2つのアクタ・クリティック法、OFF-SGSP(モデルベース)およびON-SGSP(モデルフリーモデル)を提案する。一般化された非線形最適化問題を定式化し、必要十分なSG-SP条件を導出することで、価値関数を推定するクリティックを用いた方策勾配降下法を採用し、局所的最小値を回避し、自己対戦において安定ナッシュ均衡への収束を達成する。ON-SGSPは合成ゲームにおいてNashQおよびFFQを上回る性能を示した。

ABSTRACT

We consider the problem of finding stationary Nash equilibria (NE) in a finite discounted general-sum stochastic game. We first generalize a non-linear optimization problem from Filar and Vrieze [2004] to a $N$-player setting and break down this problem into simpler sub-problems that ensure there is no Bellman error for a given state and an agent. We then provide a characterization of solution points of these sub-problems that correspond to Nash equilibria of the underlying game and for this purpose, we derive a set of necessary and sufficient SG-SP (Stochastic Game - Sub-Problem) conditions. Using these conditions, we develop two actor-critic algorithms: OFF-SGSP (model-based) and ON-SGSP (model-free). Both algorithms use a critic that estimates the value function for a fixed policy and an actor that performs descent in the policy space using a descent direction that avoids local minima. We establish that both algorithms converge, in self-play, to the equilibria of a certain ordinary differential equation (ODE), whose stable limit points coincide with stationary NE of the underlying general-sum stochastic game. On a single state non-generic game (see Hart and Mas-Colell [2005]) as well as on a synthetic two-player game setup with $810,000$ states, we establish that ON-SGSP consistently outperforms NashQ ([Hu and Wellman, 2003] and FFQ [Littman, 2001] algorithms.

研究の動機と目的

  • N人一般和確率ゲームにおける定常ナッシュ均衡を効率的かつ収束的に求めるアルゴリズムの開発。
  • 2人ゲームからの非線形最適化フレームワークを、非線形制約を伴うN人ゲームへ一般化すること。
  • 必要十分なSG-SP条件から導かれる降下方向を用いたアクタ・クリティック法の設計により、局所的最小値を回避すること。
  • 定常ナッシュ均衡に対応する常微分方程式(ODE)の安定限界点への収束を確立すること。
  • 大規模な合成ゲームにおいて、既存のマルチエージェント強化学習アルゴリズムと比較しての実験的評価。

提案手法

  • FilarとVriezeの2人ゲームフレームワークを拡張し、N人一般和確率ゲームのための一般化された非線形最適化問題を定式化する。
  • 各エージェントと状態ごとにベルマン誤差がゼロとなる部分問題の解としてナッシュ均衡を特徴付ける、必要十分なSG-SP(確率ゲーム-部分問題)条件を導出する。
  • アクタ・クリティックアーキテクチャを設計:クリティックは固定方策の価値関数を推定し、アクターは局所的最小値を回避する降下方向を用いて方策降下を実行する。
  • 2つのアルゴリズムを提案:OFF-SGSP(モデルベース)およびON-SGSP(モデルフリー)、両者とも収束を確保するためのマルチタイムスケール確率的近似を用いる。
  • 関連する常微分方程式(ODE)の均衡への収束を保証するため、自己対戦ダイナミクスを用いる。
  • 状態空間の複雑さを低減するため、価値関数と方策関数が相対的状態差にのみ依存する制限付き設定で関数近似を実装する。

実験結果

リサーチクエスチョン

  • RQ1N人一般和確率ゲームに対して、ベルマン誤差がゼロとなる部分問題としてナッシュ均衡を捉えることができる一般化された非線形最適化フレームワークを開発可能か?
  • RQ2N人確率ゲームにおけるナッシュ均衡と部分問題の解を結びつける必要十分条件(SG-SP)は何か?
  • RQ3局所的最小値を回避する降下方向を用いたアクタ・クリティック法は、自己対戦において定常ナッシュ均衡への収束を保証できるか?
  • RQ4提案されたON-SGSPアルゴリズムの性能は、合成ゲームにおけるNashQおよびFFQと比較してどのように異なるか?
  • RQ5相対的位置に基づく関数近似は、計算複雑性を顕著に低減しつつ、収束性と均衡品質を維持できるか?

主な発見

  • ON-SGSPは810,000状態を有する合成2人ゲームにおいて、NashQおよびFFQを一貫して上回り、収束が速く、戦略の安定性も優れた結果を示した。
  • 810,000状態のゲームでは、ON-SGSPは約2×10^7イテレーションで30×30グリッド内の4×4グリッドに収束し、1状態あたり平均約21イテレーションを要した。
  • NashQは約5×10^7イテレーションを要し、8×8グリッドに到達したが、戦略の安定化に失敗しており、収束性が低いことが示された。
  • FFQは約30,000イテレーションで8×8グリッドに到達したが、状態空間の十分な探索が行われず、グリッドの大部分でナッシュでない戦略が得られた。
  • ON-SGSPは約42分で5×10^7イテレーションを完了したのに対し、NashQは1イテレーションあたりナッシュ均衡の計算を要するため、約50時間を要した。
  • 相対的位置に基づく関数近似を用いた部分情報設定では、ON-SGSPは約200,000イテレーション(約5秒)で収束し、1相対的状態差あたり平均22イテレーションを要した。これは、次元が削減された部分空間においても高速な収束を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。