Skip to main content
QUICK REVIEW

[論文レビュー] Algorithms for Nash Equilibria in General-Sum Stochastic Games.

H. L. Prasad, L. A. Prashanth|arXiv (Cornell University)|Jan 8, 2014
Economic theories and models参考文献 23被引用数 3
ひとこと要約

本稿では、一般和割引確率的ゲームにおけるナッシュ均衡を計算するための、3つの新規アルゴリズム—OFF-SGSP、ON-SGSP、DON-SGSP—を提案する。スケーラビリティと一般性の面で長年の課題に取り組み、主な貢献は、この設定における最初の分散型オンラインアルゴリズムであるDON-SGSPであり、両方のオンラインバージョンが計算的に効率的であることが証明されている。

ABSTRACT

The field of stochastic games has been actively pursued over the last seven decades because of several of its important applications in oligopolistic economics. In the past, zerosum stochastic games have been modelled and solved for Nash equilibria using the standard techniques of Markov decision processes. General-sum stochastic games on the contrary have posed difficulty as they cannot be reduced to Markov decision processes. Over the past few decades the quest for algorithms to compute Nash equilibria in general-sum stochastic games has intensified and several important algorithms such as stochastic tracing procedure [Herings and Peeters, 2004], NashQ [Hu and Wellman, 2003], FFQ [Littman, 2001], etc., and their generalised representations such as the optimization problem formulations for various reward structures [Filar and Vrieze, 2004] have been proposed. However, they suffer from either lack of generality or are intractable for even medium sized problems or both. In this paper, we propose three algorithms, OFF-SGSP, ON-SGSP and DON-SGSP, respectively, which we show provide Nash equilibrium strategies for general-sum discounted stochastic games. Here OFF-SGSP is an off-line algorithm while ON-SGSP and DON-SGSP are online algorithms. In particular, we believe that DON-SGSP is the first decentralized on-line algorithm. We show that both our on-line algorithms are computationally efficient.

研究の動機と目的

  • 一般和確率的ゲームにおけるナッシュ均衡を計算するための一般的で実行可能なアルゴリズムの欠如に取り組む。
  • 確率的トレーシング手順やNashQといった先行手法の限界を克服する。これらは非効率性や一般性の欠如により、問題となる。
  • 既存の手法が失敗する中規模問題にスケーリング可能な効率的なオンラインアルゴリズムを開発する。
  • マルチエージェント確率的環境におけるリアルタイムで分散型の均衡計算を可能にする、分散型オンラインアルゴリズム(DON-SGSP)を導入する。
  • 割引一般和確率的ゲームの文脈において、すべての提案アルゴリズムの理論的収束性と計算効率を保証する。

提案手法

  • 反復的方策改善と価値関数更新を用いてナッシュ均衡戦略を計算するオフラインアルゴリズムであるOFF-SGSPを提案する。
  • リアルタイムの相互作用データを用いて戦略を段階的に更新するオンラインアルゴリズムであるON-SGSPを設計する。これにより動的適応が可能になる。
  • エージェントが局所的情報のみを用いて独立して均衡戦略を計算できる分散型オンラインアルゴリズムであるDON-SGSPを導入する。
  • 一般報酬構造に適合した最適化問題の定式化を活用し、FilarとVrieze(2004)の先行研究を一般和ゲームをサポートする形に拡張する。
  • 反復的固定点計算と、確率的ゲームフレームワークに適応した方策反復技術を用いて収束を保証する。
  • オンラインバージョンではグローバルな調整を最小限に抑え、局所的かつ非同期更新に依存することで計算効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1一般和割引確率的ゲームにおけるナッシュ均衡を計算する一般用途のアルゴリズムを設計可能か?その際、マルコフ決定過程への還元を回避できるか?
  • RQ2環境の変化に応じて即座に反応しなければならないオンライン設定において、計算効率を達成できるか?
  • RQ3一般和確率的ゲームにおけるナッシュ均衡計算のための分散型オンラインアルゴリズムを開発可能か?
  • RQ4中規模問題において、NashQ や確率的トレーシング手順といった既存のアルゴリズムの理論的・実用的限界は何か?
  • RQ5提案されたアルゴリズムは、先行手法と比較して収束速度とスケーラビリティの面でどのように異なるか?

主な発見

  • DON-SGSPは、一般和割引確率的ゲームにおけるナッシュ均衡計算のための、最初の分散型オンラインアルゴリズムである。
  • ON-SGSPおよびDON-SGSPの両方とも計算的に効率的であり、中規模問題への実用的応用を可能にする。
  • 確率的トレーシング手順やNashQといった先行手法の非効率性の問題を、提案されたアルゴリズムが克服している。
  • OFF-SGSPは、オフライン計画や分析に適した信頼性の高いオフライン解を提供する。
  • オンラインアルゴリズムはリアルタイムの適応を可能にし、動的でマルチエージェント環境に適している。
  • フレームワークは一般報酬構造をサポートしており、ゼロ和や単純化された設定に限定されない、より広範な適用可能性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。