QUICK REVIEW
[論文レビュー] On the computational complexity of solving stochastic mean-payoff games
Vladimir Gurvich, Peter Bro Miltersen|ArXiv.org|Dec 2, 2008
Logic, Reasoning, and Knowledge参考文献 10被引用数 3
ひとこと要約
この論文は、Condonゲーム(単純な確率的ゲーム)、報酬・確率を単一表現(unary)で表現する確率的平均報酬ゲーム、および二進表現(binary)で表現する同様のゲームの間で、多項式時間の同等性を確立している。著者らは、これらの3つのゲームクラスを解く計算の複雑さが同一であることを証明しており、報酬の追加や二進符号化の使用が、標準的な単純な確率的ゲームの複雑さを超えて問題の難易度を高めることはないことを示している。
ABSTRACT
We consider some well-known families of two-player, zero-sum, perfect information games that can be viewed as special cases of Shapley's stochastic games. We show that the following tasks are polynomial time equivalent: - Solving simple stochastic games. - Solving stochastic mean-payoff games with rewards and probabilities given in unary. - Solving stochastic mean-payoff games with rewards and probabilities given in binary.
研究の動機と目的
- 確率的平均報酬ゲーム(割引率なしのGilletteゲーム)を解くことと、単純な確率的ゲーム(Condonゲーム)を解くことの計算的同等性を特定すること。
- ゲーム内での報酬の導入が、確率的ゲームを解く際の計算複雑度を、単純な確率的ゲームのものよりも高めるかどうかを調査すること。
- 入力表現の影響、特に報酬と確率の単一表現と二進表現の違いが、これらのゲームを解く際の複雑度に与える影響を検討すること。
- 例えば、1人目のプレイヤーに依存する遷移を有するFilarゲームのようなGilletteゲームのさらなる一般化が、Condonゲームと多項式時間で同等であるかどうかを調査すること。
提案手法
- 割引率ありGilletteゲームからCondonゲームへの還元を構築する。割引率を終端吸収確率によってシミュレートするために、補助的頂点と確率的ガジェットを導入する。
- 元のゲームのすべての報酬を[0,1]区間にアフィンスケーリングすることで、戦略の同等性を保ちつつ最適行動を変更しないようにする。
- 元のゲームの各(状態, 行動)ペアに対して、新しい確率的頂点をCondonゲームに作成し、その行動の報酬と遷移確率に基づいてプレイをルーティングする。吸収確率は割引報酬に比例するように設定する。
- 戦略的同等性を示すために、Condonゲームにおける終端状態への到達確率が、元のGilletteゲームにおける割引報酬の期待値に等しいことを証明する。
- Condonゲームから割引率なしのGilletteゲームへの逆還元を構築する。終端吸収を報酬1、その他のすべての遷移を報酬0にマッピングすることで、終端状態への到達確率が限界平均報酬として保存されるようにする。
- 元のゲームにおける純粋かつ位置的戦略が、変換後のゲームにおいて一対一に対応しており、両方の還元において最適戦略が保存されることを証明する。
実験結果
リサーチクエスチョン
- RQ1Condonゲームを解くことと、確率的平均報酬ゲーム(割引率なしのGilletteゲーム)を解くことの計算的同等性は存在するか?
- RQ2確率的ゲーム内での報酬の導入が、単純な確率的ゲームのものよりも計算複雑度を高めるか?
- RQ3確率的平均報酬ゲームを解く際の計算複雑度は、入力表現(報酬と確率の単一表現対二進表現)に依存するか?
- RQ4例えば、1人目のプレイヤーに依存する遷移を有するFilarゲームのようなGilletteゲームのさらなる一般化が、多項式時間でCondonゲームに還元可能か?
主な発見
- Condonゲームを解くことは、報酬と確率を単一表現で表現する確率的平均報酬ゲームを解くことと多項式時間で同等である。
- 報酬と確率を二進表現で表現する確率的平均報酬ゲームを解くことについても、Condonゲームを解くことと多項式時間で同等である。
- ゲーム内での報酬の存在は、確率的ゲームを解く際の計算複雑度を、単純な確率的ゲームのものよりも高めない。
- 割引率ありGilletteゲームからCondonゲームへの還元は最適戦略を保存しており、多項式時間で計算可能であり、Condonゲームにおける吸収確率は元のゲームにおける割引報酬に等しい。
- Condonゲームから割引率なしのGilletteゲームへの還元は、終端状態への到達確率を限界平均報酬として保存しており、戦略的同等性を保証する。
- これらの結果から、報酬の有無や入力の単一表現対二進表現の違いに関わらず、これらのゲーム族を解く際の計算複雑度は本質的に同一であることが示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。