Skip to main content
QUICK REVIEW

[論文レビュー] On the Complexity of Computing Markov Perfect Equilibrium in General-Sum Stochastic Games

Xiaotie Deng, Yuhao Li|arXiv (Cornell University)|Sep 4, 2021
Reinforcement Learning in Robotics参考文献 45被引用数 9
ひとこと要約

この論文は、有限 horizon、割引係数付き、一般和の確率的ゲーム(SGs)における近似マーケットパラメータ均衡(MPE)を計算することがPPAD完全であることを確立している。著者らは、戦略空間上で多項式的に有界な関数を構築することで、MPE計算を固定点問題に還元し、NP困難である可能性が極めて低い(NP = co-NPでない限り)ことを証明した。これにより、マルチエージェント強化学習(MARL)研究における計算複雑性の基盤が提供された。

ABSTRACT

Similar to the role of Markov decision processes in reinforcement learning, Stochastic Games (SGs) lay the foundation for the study of multi-agent reinforcement learning (MARL) and sequential agent interactions. In this paper, we derive that computing an approximate Markov Perfect Equilibrium (MPE) in a finite-state discounted Stochastic Game within the exponential precision is extbf{PPAD}-complete. We adopt a function with a polynomially bounded description in the strategy space to convert the MPE computation to a fixed-point problem, even though the stochastic game may demand an exponential number of pure strategies, in the number of states, for each agent. The completeness result follows the reduction of the fixed-point problem to {\sc End of the Line}. Our results indicate that finding an MPE in SGs is highly unlikely to be extbf{NP}-hard unless extbf{NP}= extbf{co-NP}. Our work offers confidence for MARL research to study MPE computation on general-sum SGs and to develop fruitful algorithms as currently on zero-sum SGs.

研究の動機と目的

  • 一般和の確率的ゲーム(SGs)における近似マーケットパラメータ均衡(MPE)を計算する計算複雑性を特定すること。
  • SGsにおけるMPE計算がNP困難であるか、より構造的な複雑性クラスに属するかという理解のギャップを埋めること。
  • マルチエージェント強化学習(MARL)におけるMPE計算のためのアルゴリズム開発を支援する理論的基盤を提供すること。
  • MPE計算がNP困難である可能性が極めて低く、NP = co-NPでない限りPPAD完全であると示すこと。

提案手法

  • 著者らは、戦略空間上で多項式的に有界な関数 f を定義し、純粋戦略の指数的数の存在にもかかわらず、MPE計算を固定点問題に還元可能であることを可能にした。
  • 辞書的最小の正の行動に基づく戦略プロファイルのラベル付けスキームを構築し、各プロファイルに一意のラベルを割り当てた。
  • 単体に基づくアプローチを用いて、特定のエージェントと状態のすべての行動が表現される停止単体を同定し、近似固定点を導出可能とした。
  • 部分関数 g を介して問題を End of the Line(EOL)問題に還元した。この関数は単体から単体へ写像し、ペアにならない単体が停止単体に対応する性質を持つ。
  • 関数 g 及びその逆関数が多項式時間で計算可能であり、EOL問題への有効な還元が可能となった。EOL問題は既知のPPAD完全問題である。
  • d = 32A_max^5 R_max^3 (λ+1) / (1−γ)^5 L^2 を選ぶことで、EOLの任意の解が 1/L-近似MPEを生成することを保証した。

実験結果

リサーチクエスチョン

  • RQ1一般和の確率的ゲームにおける近似MPEの計算はPPAD完全であるか?
  • RQ2指数的戦略空間があるにもかかわらず、MPE計算を固定点問題に還元できるか?
  • RQ3SGsにおけるMPE計算はNP困難である可能性が低く、これはMARLアルゴリズム設計に何を意味するか?
  • RQ4戦略空間上で多項式的に有界な関数は、SGsにおけるMPE計算を効果的に表現できるか?

主な発見

  • 有限状態、割引係数付き、一般和の確率的ゲームにおける近似MPEの計算はPPAD完全である。
  • End of the Line(EOL)問題への還元により、MPE計算がPPAD複雑性クラスに属することを確認した。
  • 戦略空間上で多項式的に有界な関数の構築により、固定点問題への有効な還元が可能となり、純粋戦略の指数的表現を回避できた。
  • この結果は、MPE計算がNP困難である可能性が極めて低く、NP = co-NP でない限りPPAD完全であることを示唆する。
  • EOLインスタンスの解を用いることで 1/L-近似MPEを計算可能であり、d を適切に選ぶことで必要な精度が保証される。
  • 理論的枠組みは、一般和のSGsにおけるMARLアルゴリズムの開発を支援するものであり、ゼロ和設定での既存の進展と類似した枠組みを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。