Skip to main content
QUICK REVIEW

[論文レビュー] Policy iteration algorithm for zero-sum multichain stochastic games with mean payoff and perfect information

Marianne Akian, Jean Cochet-Terrasson|arXiv (Cornell University)|Aug 2, 2012
Supply Chain and Inventory Management参考文献 2被引用数 9
ひとこと要約

本稿では、平均報酬と完全情報を持つゼロ和多連鎖確率ゲームに対して、退化した反復が発生しても収束を保証する非線形スペクトル射影を用いた方策反復アルゴリズムを提示する。この手法により、終了保証が得られ、リッチマンゲームや追跡回避ゲームを含む大規模なインスタンスが、平均報酬と相対的価値ベクトルの検証とともに効率的に解かれる。

ABSTRACT

We consider zero-sum stochastic games with finite state and action spaces, perfect information, mean payoff criteria, without any irreducibility assumption on the Markov chains associated to strategies (multichain games). The value of such a game can be characterized by a system of nonlinear equations, involving the mean payoff vector and an auxiliary vector (relative value or bias). We develop here a policy iteration algorithm for zero-sum stochastic games with mean payoff, following an idea of two of the authors (Cochet-Terrasson and Gaubert, C. R. Math. Acad. Sci. Paris, 2006). The algorithm relies on a notion of nonlinear spectral projection (Akian and Gaubert, Nonlinear Analysis TMA, 2003), which is analogous to the notion of reduction of super-harmonic functions in linear potential theory. To avoid cycling, at each degenerate iteration (in which the mean payoff vector is not improved), the new relative value is obtained by reducing the earlier one. We show that the sequence of values and relative values satisfies a lexicographical monotonicity property, which implies that the algorithm does terminate. We illustrate the algorithm by a mean-payoff version of Richman games (stochastic tug-of-war or discrete infinity Laplacian type equation), in which degenerate iterations are frequent. We report numerical experiments on large scale instances, arising from the latter games, as well as from monotone discretizations of a mean-payoff pursuit-evasion deterministic differential game.

研究の動機と目的

  • マルコフ連鎖に非可約性の仮定を設けない、平均報酬と完全情報付きのゼロ和多連鎖確率ゲームに対する方策反復アルゴリズムの開発。
  • 平均報酬ベクトルが向上しない退化した反復が頻発する状況下でも、アルゴリズムの収束を保証すること。
  • 平均報酬ベクトルと相対的価値ベクトル(バイアス)を含む非線形方程式系を用いてゲームの価値を特徴付けること。
  • リッチマンゲームや追跡回避微分ゲームの単調離散化といった実用的問題への応用。
  • 大規模数値インスタンスにおけるアルゴリズムの効率性と頑健性の実証。

提案手法

  • 退化反復時における相対的価値ベクトルの更新に、線形ポテンシャル論における超調和関数削減に類似した非線形スペクトル射影を用いる。
  • 各反復で、現在の戦略の平均報酬と相対的価値を計算し、平均報酬が向上しない場合には削減ステップを介して相対的価値を更新する。
  • 平均報酬と相対的価値ベクトルの系列は、辞書式単調性を満たし、サイクルの発生を防ぎ、有限回の反復で終了を保証する。
  • 動的計画法の作用素は多面体的であり、順序を保ち、加法的同次性を持つため、価値の不変半直線特徴付けが可能となる。
  • アルゴリズムは、2人プレイヤーの戦略最適化を交互に繰り返す2段階のポリシー反復ループとして実装される。
  • 数値実験では、連続的追跡回避ゲームの有限差分離散化を用い、状態空間をグリッドに離散化し、境界違反を避けるために行動を制限する。

実験結果

リサーチクエスチョン

  • RQ1平均報酬付きゼロ和多連鎖確率ゲームに対して、頻繁な退化反復が発生してもサイクルを回避する方策反復アルゴリズムを設計可能か?
  • RQ2非可約性の仮定が存在しない状況下で、非線形スペクトル射影の概念をどのように適応させれば収束を保証できるか?
  • RQ3相対的価値ベクトルは、多連鎖ゲームにおける平均報酬の特徴付けにおいて果たす役割は何か?
  • RQ4離散化された追跡回避ゲームやリッチマンゲームなどの大規模インスタンスにおいて、アルゴリズムの性能はいかがなものか?
  • RQ5非対称な速度を持つゲーム、たとえばネズミとネコのゲームにおいて、相対的価値ベクトルと最適戦略の関係は何か?

主な発見

  • 辞書式単調性の性質により、退化反復が存在しても、価値と相対的価値の系列が有限回で終了することが保証される。
  • ネコの速度が 0.999 のネズミとネコのゲームでは、捕獲球外部の位置 x に対して平均報酬は η(x) = 0.492、内部では η(x) = 0 であり、ネズミが距離を維持可能であることを示す。
  • ネコの速度が 1.001 の場合、平均報酬はほぼゼロであり、ネコが最終的にネズミを捕らえることを示し、相対的価値ベクトルは捕獲までの時間構造を示している。
  • 等速の場合(bar{b} = 1)、相対的価値は概ねゼロであり、平均報酬は η(x) ≈ ||x||²₂ となる。これは距離の維持を示している。
  • 257×257グリッドの大規模インスタンスを効率的に解き、残差が 1e-14 未満、CPU時間は 1000 秒未満を達成した。
  • 強力な退化反復は、bar{b} = 0.999 および bar{b} = 1.001 の場合、主に最終段階でのみ発生し、収束の安定性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。